AI 爬虫模拟访问
你的 robots.txt 放行了 GPTBot,但服务器防火墙真的放行了吗?以 12 只主流 AI 爬虫的真实 UA 发起模拟抓取,一次对比重点四只的可达性矩阵,或查看单只爬虫实际读到的页面内容——浏览器里正常的页面,AI 爬虫可能一片空白。
以所选 AI 爬虫的真实 UA 向目标网址发起一次抓取:矩阵模式一次对比 GPTBot、ClaudeBot、Bytespider、PerplexityBot 四只重点爬虫的可达性;单只模式额外展示该爬虫实际"读到"的页面内容。
工具简介
网站对 AI 爬虫的拦截发生在两层:robots.txt 是"声明层",告诉爬虫可不可以来;服务器 WAF/CDN 是"执行层", 决定爬虫实际进不进得来。很多站长放行了 robots.txt,却被 Cloudflare、Nginx 防火墙或主机商的默认规则在第二层挡掉, 自己却毫不知情。本工具以各爬虫官方文档公布的真实 UA 发起访问,直接验证执行层的真实可达性: 返回 401/403/406/429 判定为被拦截,2xx 判定为可抓取。
覆盖三类用途的代表性爬虫:模型训练(GPTBot、ClaudeBot、Bytespider 等,决定你的内容能否进入训练语料)、 搜索索引(OAI-SearchBot、PerplexityBot、Kimi-SearchBot 等,决定能否被联网搜索实时引用)、 用户代取(ChatGPT-User、Claude-User 等,用户在对话中贴链接时触发,拦截会直接丢失这次曝光)。 单只模式展示爬虫视角的标题、描述与纯文本片段——AI 爬虫普遍不执行 JavaScript, 如果正文片段为空而浏览器显示正常,说明你的内容对 AI 基本不可见,需要服务端渲染。 需要说明:本工具只模拟 UA,不模拟爬虫真实出口 IP,少数按 IP 白名单放行的站点可能与实际抓取结果存在偏差。各项结果仅供分析参考。