本文围绕「要不要屏蔽 GPTBot:AI 爬虫、robots.txt 与 llms.txt 的取舍」梳理 GEO 优化、GEO、SEO 与 AI 搜索可见度相关问题,帮助读者快速判断方法是否适合自己的业务场景。
先给结论:想做 GEO,默认放行所有 AI 搜索类爬虫(OAI-SearchBot、PerplexityBot、ChatGPT-User),训练类爬虫(GPTBot、ClaudeBot、Google-Extended)可以放,内容是核心资产、怕被白嫖训练的才屏蔽。llms.txt 成本低可以做,但别指望它是开关。
这事最容易犯的错是把「屏蔽 AI 爬虫」当成一句口号执行。robots.txt 里写 User-agent: GPTBot 和写 User-agent: OAI-SearchBot,后果完全不同——前者挡的是拿你内容去训练模型,后者挡的是 ChatGPT 搜索时能不能读到你的页面。一刀切全禁,等于把店门口的路都封了,还抱怨没客人。
先把爬虫分成两类
第一类:搜索/浏览爬虫,直接影响你会不会被引用。
1. OAI-SearchBot:OpenAI 的搜索爬虫,服务 ChatGPT 的联网搜索。挡了它,ChatGPT 搜索场景里很难引用你。
2. ChatGPT-User:用户在 ChatGPT 里触发浏览时用,挡了等于用户让 AI 看你的站它也看不到。
3. PerplexityBot:Perplexity 的索引爬虫,想在 Perplexity 被引用就别挡。
第二类:训练爬虫,影响的是模型「知识里有没有你」,不直接影响单次回答的引用。
1. GPTBot:OpenAI 训练用。
2. ClaudeBot / anthropic-ai:Anthropic 训练用。
3. Google-Extended:Google 的 Gemini 训练用。
注意 Google-Extended 和 Googlebot 是两回事。Googlebot 负责搜索索引,AI Overviews 的数据基础也来自搜索索引。屏蔽 Google-Extended 只影响 Gemini 训练,不影响 AI Overviews;手滑把 Googlebot 屏了,那是把 Google 搜索也一起拉黑,属于事故。
决策就三个问题
1. 你的商业模式吃不吃「被 AI 提及」?做出海品牌、B2B 获客、独立站的,吃,搜索类爬虫全放行。内容付费墙模式、纯会员制社区,才需要斟酌。
2. 怕不怕内容被拿去训练?大多数营销内容被训练了没什么实际损失,放行 GPTBot 换取长期品牌在模型里的存在感,划算。核心技术文档、数据报告类内容可以单独目录屏蔽。
3. 服务器扛不扛得住爬虫?AI 爬虫的抓取量级目前普遍远低于 Googlebot,扛得住 Google 就扛得住它们。真有压力,用 Crawl-delay 或访问频率控制,别直接禁。
给一份能抄的 robots.txt
多数出海站直接用这个思路:
User-agent: *
Allow: /
User-agent: GPTBot
Allow: /
User-agent: OAI-SearchBot
Allow: /
User-agent: PerplexityBot
Allow: /
想单独保护敏感目录,再加一段 Disallow: /internal-docs/ 之类的针对性规则。改完之后别只在编辑器里看,部署后实际验证:Google Search Console 的 robots 报告、OpenAI 官方文档页列出的 UA 名,隔几个月核对一次——爬虫名单在更新,别把 2025 年的配置当永久答案。
llms.txt:做,但别神化
llms.txt 是 2024 年出现的一份提案:在根目录放一个 llms.txt,用 Markdown 给大模型写一份站点内容导览——你是谁、核心页面在哪、关键事实是什么。
现状要讲清楚:它不是官方标准,主流 AI 平台没有承诺固定抓取它。所以对它的正确预期是「低成本的可读性补充」,而不是「做了就被 AI 记住」的开关。真正的杠杆依然是这三件事:
1. 页面内容本身可被干净解析:标题层级清晰、正文是服务端渲染的 HTML 而不是纯前端渲染。
2. 结构化数据齐全:FAQ、Article、Organization 的 Schema 输出,方法在这篇Schema 标记指南。
3. 更新被快速感知:ChatGPT 搜索重度依赖 Bing 索引,接入 IndexNow 能让 Bing 更快重新抓取新内容,间接缩短你在 ChatGPT 里从发布到被引用的时滞。
这三件事没做之前写 llms.txt,属于门牌擦得很亮但店里没货。
怎么验证爬虫真的来了
服务器日志里 grep 这些 UA:GPTBot、OAI-SearchBot、PerplexityBot、ClaudeBot、Google-Extended。看到抓取记录,说明你的放行生效了。配合 GA4 里的 AI 渠道数据(怎么建见AI 流量归因实操),两头对上,链路就通了。
如果日志里 AI 爬虫从没出现过,先排查 robots.txt 误伤,再排查服务器防火墙把陌生 UA 当恶意流量拦了——不少 CDN 的默认 bot 规则会拦 GPTBot,这是被引用为零的隐形凶手。
爬虫放行只是地基。放行之后内容怎么写到被 AI 引用,回到GEO 5 步法;整套体系怎么搭,看GEO 服务方案。地基打对了,后面的每一步才不是白费。

