AI 爬虫消耗 Linux Kernel 仓库 20% 计算资源
Linux 内核代码库每日收到约六百万次请求,其中仅约 2% 来自真实用户。其余大部分是 AI 驱动的爬虫,反复请求同一提交页面,导致服务器计算资源被大量占用。Linux 基金会基础设施安全主管 Konstantin Ryabitsev 统计,git.kernel.org 的 90 核心服务器中,有 14–16 核心几乎全部用于渲染这些爬虫请求,约占整体算力的 20%。一次完整克隆耗时约 200 CPU‑秒,而通过 cgit 页面逐页抓取 148 万次提交则消耗 280 CPU‑小时;对 922 个 fork 重复抓取后,总计高达 258 160 CPU‑小时,等同于单次克隆的 460 万倍。
这对开发者意味着:AI 爬虫的低效抓取不仅浪费公共算力,还可能导致服务不稳定,影响真正的代码审查与协作。若你在维护或使用 Linux 内核相关工具,需关注项目对爬虫的防护策略,或考虑在 CI/CD 流程中加入对 AI 生成内容的审查,以免被误当作合法请求。
#GitHub #开源 #LinuxKernel #AI爬虫 #计算资源 #开源安全 @GitHub开源榜
@GitHubTrendingHub
Post #969
15


