Linux内核基础设施遭到AI爬虫持续轰炸 即便部署反爬措施也会被AI绕过

Linux内核基础设施遭到AI爬虫持续轰炸 即便部署反爬措施也会被AI绕过

💡 原文中文,约2300字,阅读约需6分钟。
📝

内容提要

Linux内核基础设施正遭受AI爬虫的持续攻击,每日600万次请求中仅2%为正常访问。爬虫绕过Anubis验证,消耗约20%算力,远超Git克隆等正常使用。管理员考虑减少可抓取URL、限制匿名访问,但问题根源在于爬虫低效消耗开源社区资源,最终代价由正常用户承担。

🔎

延伸解读

反爬困境:验证机制的两难

Anubis 工作量证明机制最初有效,但爬虫已能完成难度 4 甚至 5 的验证。管理员无法继续提高难度,因为这会增加手机等正常用户的等待时间和计算负担。这反映出反爬措施在对抗 AI 爬虫时的根本矛盾:验证强度与用户体验难以兼得,单纯依赖技术手段难以彻底解决问题。

低效抓取放大资源消耗

Linux 内核仓库本可通过 Git 高效克隆,但部分爬虫选择逐页请求 cgit 生成的 HTML 页面。主仓库约 148 万个提交,加上 922 个分支仓库,可组合出数十亿 URL,导致大量重复抓取。这种低效方式将渲染压力全部留给服务器,消耗约 20% 算力,甚至超过正常 Git 克隆,凸显了爬虫行为对开源基础设施的额外负担。

代理 IP 使封禁失效

早期爬虫使用云服务器 IP,管理员可通过封禁 IP 或 ASN 高效应对。但现在流量大量来自住宅 IP 和移动网络 IP 代理,每个地址仅请求数次便消失,使传统封禁手段失效。文章提到这与代理 SDK 变现网络有关,三星和 LG 电视曾被发现有第三方应用内置此类 SDK,将用户网络变为代理,增加了反爬难度。

Q&A

Linux内核基础设施最近遭受了什么类型的攻击?

Linux内核基础设施(git.kernel.org)正遭受AI爬虫的持续轰炸,每天约600万次请求中只有2%是正常访问,爬虫消耗了约20%的算力,甚至超过了Git克隆等正常使用。

Linux内核基础设施管理员采取了哪些反爬措施?效果如何?

管理员最初通过封禁IP和ASN来应对,后来部署了Anubis工作量证明验证机制,但AI爬虫已能绕过,完成难度4或5的验证,继续消耗资源。

为什么AI爬虫要抓取Linux内核的HTML页面而不是直接克隆Git仓库?

因为Linux内核的历史代码和提交记录公开且相对干净,适合作为训练语料。但部分爬虫选择逐个请求cgit生成的HTML页面,而不是高效克隆,导致大量重复抓取,给服务器带来巨大渲染压力。

Linux内核基础设施的流量中,正常访问占比是多少?

根据管理员估算,即使采用宽松标准,真正的正常访问可能只有2%。

AI爬虫如何绕过IP封禁和反爬措施?

爬虫流量大量来自住宅IP和移动网络IP代理,每个地址仅请求数次后便消失,同时伪装成普通浏览器,使得基于IP的封禁失效。

Linux基金会计划如何应对AI爬虫问题?

管理员准备减少可抓取的URL、关闭部分高成本功能、对匿名访问增加限制,但尚未出台官方政策。

AI爬虫对Linux内核基础设施造成了哪些具体影响?

爬虫消耗了约20%的算力,长期占用14-16个CPU核心用于渲染HTML,导致正常用户可能面临资源紧张和访问变慢。

🏷️

标签

➡️

继续阅读