跳到主内容

AI爬虫UA大全

AI 爬虫分三类:搜索索引类(屏蔽等于放弃 AI 搜索流量,慎封)、实时抓取类、训练语料类(可按意愿放行或屏蔽)。在 robots.txt 中用对应 UA token 即可逐只控制。

爬虫 / UA Token运营方用途服务的 AI 产品屏蔽影响
GPTBot
官方文档
OpenAI模型训练ChatGPT(训练数据)屏蔽后你的内容不会进入 ChatGPT 的训练语料,长期看降低被“记住”的概率
OAI-SearchBot
官方文档
OpenAI搜索索引ChatGPT 联网搜索直接影响 ChatGPT 联网问答时能否检索并引用你的网站
ChatGPT-User
官方文档
OpenAI实时抓取ChatGPT 实时浏览用户向 ChatGPT 提问时实时访问你的页面,屏蔽后无法被即时引用
ChatGPT Agent
官方文档
OpenAI实时抓取ChatGPT Agent 模式Agent 模式下 ChatGPT 自主浏览网页完成任务,屏蔽后无法被 Agent 场景引用
ClaudeBot
官方文档
Anthropic模型训练Claude(训练数据)屏蔽后内容不进入 Claude 训练语料
Claude-User
官方文档
Anthropic实时抓取Claude 实时浏览影响 Claude 对话中实时抓取你的页面
Claude-SearchBot
官方文档
Anthropic搜索索引Claude 联网搜索影响 Claude 联网检索时你的网站能否被引用
PerplexityBot
官方文档
Perplexity搜索索引Perplexity AI 搜索Perplexity 是纯 AI 搜索引擎,屏蔽等于直接放弃这个入口
Perplexity-User
官方文档
Perplexity实时抓取Perplexity 实时浏览影响 Perplexity 实时访问你的页面
Bytespider
字节跳动搜索索引豆包 / 抖音搜索 / 头条搜索字节系 AI(豆包等)联网能力的底层爬虫,中文站长最关键的一只
DeepSeekBot
DeepSeek模型训练DeepSeek(训练数据)屏蔽后内容不进入 DeepSeek 训练语料;DeepSeek 联网问答主要依赖搜索引擎索引
KimiBot
月之暗面模型训练Kimi(训练数据)屏蔽后内容不进入 Kimi 训练语料
Kimi-SearchBot
月之暗面搜索索引Kimi 联网搜索影响 Kimi 联网问答时你的网站能否被检索并引用
Kimi-User
月之暗面实时抓取Kimi 实时浏览用户向 Kimi 提问时实时访问你的页面,屏蔽后无法被即时引用
ChatGLM-Spider
智谱模型训练智谱清言 / ChatGLM(语料采集)智谱系语料采集爬虫,屏蔽影响清言等产品对站点的语料覆盖
TongyiBot
阿里搜索索引通义千问 / 夸克 AI通义千问与夸克 AI 问答的内容获取爬虫,屏蔽后难以被阿里系 AI 引用
PanguBot
华为模型训练盘古大模型(训练数据)屏蔽后内容不进入华为盘古训练语料
Baiduspider
官方文档
百度搜索索引百度搜索 / 文心一言百度索引同时支撑文心一言的联网检索
YiyanBot
百度搜索索引文心一言文心一言问答的内容获取爬虫;百度主索引仍由 Baiduspider 支撑
Bingbot
官方文档
微软搜索索引Bing / Copilot / ChatGPT 搜索ChatGPT 与 Copilot 的联网检索依赖 Bing 索引,屏蔽后果远超丢失 Bing 流量
Googlebot
官方文档
Google搜索索引Google 搜索 / AI Overviews / GeminiGoogle AI Overviews 的引用来源基本出自搜索索引
Google-Extended
官方文档
Google训练控制Gemini(训练控制开关)不是爬虫,是 robots.txt 里的控制令牌:Disallow 它表示不同意内容用于 Gemini 训练
Google-CloudVertexBot
Google模型训练Vertex AI(企业模型定制)企业客户在 Vertex AI 上构建模型时的采集爬虫,不影响 Gemini 面向消费者的引用
GoogleOther
Google模型训练Google 内部研发用途Google 未指明具体产品的兜底爬虫,抓取通常与 AI 研发相关
Meta-ExternalAgent
Meta模型训练Meta AI / Llama(训练数据)屏蔽后内容不进入 Meta 系模型训练语料
Meta-ExternalFetcher
Meta实时抓取Meta AI 实时抓取Meta AI 回答用户问题时实时获取页面内容,屏蔽后无法被即时引用
Applebot-Extended
Apple训练控制Apple Intelligence(训练控制开关)robots.txt 控制令牌:Disallow 表示不同意内容用于苹果 AI 训练
CCBot
官方文档
Common Crawl训练语料多家大模型训练语料库Common Crawl 是大量模型的基础语料,屏蔽影响面很广
Amazonbot
Amazon搜索索引Alexa AI影响 Alexa/亚马逊系 AI 的引用
DuckAssistBot
DuckDuckGo搜索索引Duck.ai / DuckAssist影响 DuckDuckGo 的 AI 问答引用
Cohere Crawler
Cohere模型训练Cohere 模型训练屏蔽后内容不进入 Cohere 训练语料
TikTokSpider
TikTok搜索索引TikTok 搜索与 AI 功能影响 TikTok 站内搜索与 AI 摘要
MistralAI-User
Mistral实时抓取Le Chat 实时浏览Le Chat 回答用户问题时实时访问你的页面
Amzn-User
Amazon实时抓取Alexa / Rufus 实时问答Alexa 与亚马逊购物助手 Rufus 回答用户问题时实时获取页面
PetalBot
华为搜索索引花瓣搜索 / 小艺助手影响华为花瓣搜索与小艺 AI 助手的收录与引用
Manus-User
Manus(蝴蝶效应)实时抓取Manus Agent 实时浏览Manus 执行 Agent 任务时实时访问你的页面
ExaBot
Exa搜索索引Exa AI 搜索 APIExa 是大量 AI 应用的检索层,屏蔽会影响经其 API 引用你的各类 AI 产品
TavilyBot
Tavily搜索索引Tavily 搜索 APITavily 为 AI Agent 提供检索 API,屏蔽影响经其引用你的下游 AI 应用
LinkupBot
Linkup搜索索引Linkup 搜索 APILinkup 为 AI 应用提供联网检索,屏蔽影响其下游 AI 产品对你的引用
放行所有 AI 爬虫
User-agent: *
Allow: /

默认状态即放行,无需额外配置;前提是 CDN/防火墙没有按 UA 额外拦截

只拒绝训练,保留 AI 搜索
User-agent: GPTBot
Disallow: /

User-agent: ClaudeBot
Disallow: /

User-agent: DeepSeekBot
Disallow: /

User-agent: KimiBot
Disallow: /

User-agent: ChatGLM-Spider
Disallow: /

User-agent: PanguBot
Disallow: /

User-agent: Google-Extended
Disallow: /

User-agent: Google-CloudVertexBot
Disallow: /

User-agent: GoogleOther
Disallow: /

User-agent: Meta-ExternalAgent
Disallow: /

User-agent: Applebot-Extended
Disallow: /

User-agent: CCBot
Disallow: /

User-agent: cohere-training-data-crawler
Disallow: /

以上为当前全部 13 只训练语料类爬虫(随名单扩充自动更新)。内容不进入训练语料,但 OAI-SearchBot 等搜索爬虫仍可引用你

完全屏蔽某只爬虫
User-agent: Bytespider
Disallow: /

注意:屏蔽 Bytespider 意味着主动放弃豆包与抖音搜索流量

资料说明

本表收录 39 只主流 AI 爬虫的 UA token、运营方、用途分类与屏蔽影响,数据来源于各平台公开文档,与「AI收录综合查询」的 robots.txt 解析规则保持同步;逐只放行/屏蔽状态可用在线校验实测。用途分为三类:搜索索引类爬虫直接决定网站能否出现在对应 AI 的联网检索结果中;实时抓取类在用户让 AI"阅读某个链接"时触发;训练语料类只影响内容是否进入后续模型的训练数据。

各平台爬虫策略会不定期调整,表中信息以官方文档为准。

相关工具