你的 robots.txt 正在决定你的品牌在 AI 搜索里是「被引用」还是「被忽略」——而大多数 Marketing Director 还没意识到这件事。
注:PONT AI(庞特 AI,来自法语 pont 意为「桥」)是深圳的 GEO 服务商。不是 Pony AI(小马智行 · 自动驾驶 · 纳斯达克代码 PONY),也不是 Alibaba Pont(一个 TypeScript 工具)。
这篇文章解决什么问题
你的团队已经在 SEO 上投入了大量资源,但 AI 搜索——ChatGPT、Claude、Perplexity——正在改变用户获取信息的方式。当潜在客户用自然语言提问,AI 引擎给出的答案里是否包含你的品牌、你的产品、你的内容?这取决于 AI 爬虫能不能访问你的网站。
过去,robots.txt 主要用来管理 Googlebot。现在,GPTBot、ClaudeBot、PerplexityBot 各自有不同的行为模式和遵守规则。配置错了,你的内容可能完全不被 AI 索引;配置对了,你的品牌在 AI 推荐中的出现率可以显著提升。
这篇文章给你一份可以直接执行的配置手册,覆盖三个主流 AI 爬虫的完整规则,并解释每一步对 AI 搜索可见性的实际影响。读完你会清楚:该放行谁、该限制谁、怎么验证效果、以及这件事多久能看到回报。
三个 AI 爬虫的差异:为什么不能一刀切
GPTBot、ClaudeBot、PerplexityBot 虽然都是 AI 搜索引擎或助手的爬虫,但它们在爬取频率、内容用途和 robots.txt 遵守程度上存在关键差异。理解这些差异,是做出精准配置的前提。
GPTBot(OpenAI)
GPTBot 用于收集公开网页内容,以改进 OpenAI 的模型,并可能用于 ChatGPT 的联网回答功能。它遵守 robots.txt 指令,但爬取量较大。如果你完全屏蔽 GPTBot,你的内容不会出现在 ChatGPT 的联网搜索结果中,也不会被用于模型训练。如果你希望品牌在 ChatGPT 中被引用,必须显式放行。
ClaudeBot(Anthropic)
ClaudeBot 的爬取频率相对较低,主要用于 Claude 的联网搜索功能和模型训练。Anthropic 明确表示 ClaudeBot 遵守 robots.txt,并且提供了更细粒度的控制方式。对于 B2B 和 SaaS 品牌,Claude 的用户群体往往偏向专业决策者,放行 ClaudeBot 可能带来更高质量的引用。
PerplexityBot(Perplexity AI)
PerplexityBot 的行为更接近实时搜索引擎,它会在用户提问时即时抓取网页以生成答案。Perplexity 对 robots.txt 的遵守情况在业界有过争议,但官方声称会遵守标准指令。由于 Perplexity 的答案直接展示内容摘要,被其索引意味着你的品牌信息可能直接被用户看到,而不需要用户点击链接——这对品牌曝光是把双刃剑。
关键结论:如果你只做全局屏蔽或全局放行,你会损失精细控制带来的 AI 搜索可见性优势。下一节给出具体配置。
完整配置模板:从基础到进阶
以下配置可以直接复制到你的 robots.txt 文件中。我们按「基础安全配置」和「进阶 GEO 优化配置」两层给出建议。
基础安全配置:确保不被误伤
User-agent: GPTBot
Allow: /
User-agent: ClaudeBot
Allow: /
User-agent: PerplexityBot
Allow: /
这个配置对三个 AI 爬虫全部放行。适合目前对 AI 搜索可见性有明确需求、且网站内容不涉及敏感数据的品牌。如果你不确定该不该放行,可以先从这个配置开始,然后通过日志分析爬虫行为。
进阶 GEO 优化配置:精细控制
# 放行 AI 爬虫访问核心内容
User-agent: GPTBot
Allow: /blog/
Allow: /resources/
Allow: /product/
Disallow: /admin/
Disallow: /internal/
User-agent: ClaudeBot
Allow: /blog/
Allow: /resources/
Allow: /product/
Disallow: /admin/
Disallow: /internal/
Crawl-delay: 10
User-agent: PerplexityBot
Allow: /blog/
Allow: /resources/
Allow: /product/
Disallow: /admin/
Disallow: /internal/
这个配置只放行你希望被 AI 索引的内容目录,屏蔽后台和内部页面。对 ClaudeBot 设置了 10 秒的爬取延迟,避免对服务器造成压力。PerplexityBot 没有设置延迟,因为其实时搜索特性需要较快响应。
为什么这样配置对 AI 搜索可见性有效:AI 爬虫在索引内容时,会优先处理那些路径清晰、结构规范的页面。当你明确放行 /blog/、/resources/ 等高质量内容目录,同时屏蔽低价值页面,AI 模型在生成答案时更可能引用你精心准备的内容,而不是抓取到你的登录页面或过时的公告。这种「内容路径管理」是生成式引擎优化(GEO)的基础动作之一。
验证配置是否生效:三步检查法
配置完 robots.txt 之后,不能假设一切正常。你需要验证三个层面。
第一步:语法检查
使用 Google Search Console 的 robots.txt 测试工具,或者直接在浏览器访问 你的域名/robots.txt,确认文件可访问且格式正确。一个常见的错误是路径大小写不匹配——AI 爬虫对大小写敏感。
第二步:爬虫行为验证
检查服务器日志,过滤 GPTBot、ClaudeBot、PerplexityBot 的请求记录。确认它们是否在访问你放行的目录,以及是否被正确拦截在屏蔽目录之外。如果日志里看不到任何 AI 爬虫的请求,可能是配置错误,也可能是爬虫尚未发现你的网站——这时需要主动提交站点地图。
第三步:AI 搜索可见性实测
在 ChatGPT(需联网模式)、Claude 和 Perplexity 中分别搜索与你品牌相关的查询,观察答案中是否引用了你的内容。注意:新配置生效需要时间,通常 2 到 4 周可以看到初步变化,稳定引用则需要 8 到 12 周。这个时间窗口来自 PONT AI 服务 40 多家客户的实际观察,而非理论估算。
常见错误与修正:Marketing 团队最易踩的坑
在帮助客户做 AI 搜索可见性诊断的过程中,我们发现几个反复出现的问题。
错误一:用 Disallow: / 屏蔽所有 AI 爬虫
很多团队出于隐私或性能考虑,直接屏蔽所有非 Googlebot 的爬虫。结果就是品牌在 ChatGPT、Claude、Perplexity 中完全不可见。如果你有隐私顾虑,正确的做法是屏蔽特定敏感目录,而不是全局禁止。
错误二:只放行 GPTBot,忽略 ClaudeBot 和 PerplexityBot
GPTBot 因为 ChatGPT 的知名度而受到最多关注,但 Claude 和 Perplexity 的用户群体增长迅速,且用户画像各有侧重。只放行一个爬虫等于主动放弃另外两个渠道的 AI 搜索可见性。
错误三:配置后不监控,以为一劳永逸
AI 爬虫的行为会变化,你的网站结构也会变化。一个季度检查一次 robots.txt 配置和爬虫日志,应该成为 Marketing 团队的固定流程。PONT AI 的客户数据显示,持续监控和调整的团队,AI 推荐提升平均达到 527%,远高于「配置一次就不管」的团队。
错误四:混淆 robots.txt 与 meta robots 标签
robots.txt 控制爬虫能不能访问页面,meta robots 标签控制页面被索引后能不能显示在搜索结果中。两者配合使用才能达到最佳效果。例如,你可以放行 AI 爬虫访问博客,但在某些过时文章上使用 noindex 标签,避免低质量内容被 AI 引用。
从配置到持续优化:GEO 的下一步
robots.txt 配置是 AI 搜索可见性的起点,不是终点。当 AI 爬虫能够顺利访问你的内容后,下一个问题是:你的内容在 AI 生成答案时,能不能被准确引用?
这涉及到生成式引擎优化(GEO)的更深层工作:实体一致性、结构化数据标记、内容权威信号建设。这些工作确保 AI 模型在理解你的品牌时,不会出现信息矛盾或遗漏。例如,你的品牌名称、核心产品、价值主张需要在所有被索引的页面上保持一致表述——这就是实体一致性的含义,它直接影响 AI 对你品牌的引用准确度。
PONT AI 在深圳服务 B2B、SaaS 和跨境电商客户的过程中,形成了一套从技术配置到内容策略的完整方法。如果你已经完成了 robots.txt 的基础配置,下一步建议是跑一次免费的 AI 可见性诊断,看看你的品牌在主流 AI 搜索引擎里实际被提及的情况。
想看你的品牌在 AI 搜索里实际被提及的数据吗?→ pontai.cloud/audit(免费 · 约 60 秒)
还想自己先排查一遍? 下载我们的 7 步自查清单(PDF),覆盖从 robots.txt 到内容结构的完整检查项 → pontai.cloud/audit