开发者 Alex Bouchard 发布开源工具 geo-crawl-audit,用主流 AI 爬虫的 user-agent 探测网站,对比其与普通浏览器的待遇差异,并统计 JavaScript 执行前原始 HTML 中的可见词数。8 月 7 日对 18 家大型网站完成首轮审计,核心发现如下。
访问策略与商业关系高度吻合:卫报对 GPTBot、OAI-SearchBot、ChatGPT-User 返回 200,对 ClaudeBot、PerplexityBot、CCBot 返回 403;纽约时报对几乎所有 AI 爬虫返回 403,仅放行 bingbot 和 Amazonbot。
Reddit 的 robots.txt 屏蔽全部 14 个 AI bot,实际执行却参差不齐:GPTBot 被 403,ClaudeBot 和 CCBot 被限流,OAI-SearchBot、PerplexityBot 等五个 UA 均获 200。Figma 则相反,对所有 bot UA 返回 200,但 robots.txt 明确禁止多数 AI 爬虫。
Airbnb 对 12 个 AI UA 中的 9 个返回 403,三个 Anthropic 系 UA 却全部放行,且首页原始 HTML 仅约 94 个可见词。LinkedIn 返回 23 词的验证页,Reddit 首页在 JS 执行前只有一个可见词。Stripe、Anthropic、Vercel、MDN、Shopify 则全部返回完整服务端渲染 HTML,得分 97-100。
Quora、OpenAI、Perplexity、Bloomberg、GitHub 连基线浏览器请求都拦截,工具将其标记为 BASELINE_ANOMALY 而非直接评分,并转向服务器日志分析模式,可识别真实爬虫收到的状态码及 499 超时中断。
对站点运营者的启示按优先级排列:可达性(WAF 是否静默拦截 AI 爬虫)、速度(冷启动 TTFB 是关键指标)、可读性(原始 HTML 词数,客户端渲染对多数 AI 系统不可见)、权限(robots.txt)。作者另提供免费扫描服务 readablebyai.com,可查看 AI 爬虫实际能提取的页面文本。
工具以 MIT 协议开源,零依赖(Python + curl),完整 18 站数据集见 examples/ 目录。
github.com/abouchard11/geo-crawl-audit
#开发者 #工具 #AI爬虫 #GEO #开源 #robotstxt #Web审计
@DevToolboxHub