← 全部文章
阅读约 5 分钟

如何让 GPTBot、ClaudeBot 和 PerplexityBot 读取你的网站

一份实用指南,介绍各家 AI 爬虫的 user-agent、如何在 robots.txt 中逐个放行或屏蔽它们,以及如何验证它们确实能读到你的内容。

如果你希望 AI 的回答提到并链接你的网站,那么背后的爬虫就需要获得抓取它的许可。每家主流助手都会带一个具名的 user-agent,而 robots.txt 正是你迎接或拒绝它们的地方。

需要认识的这些爬虫

  • GPTBot——OpenAI 用于训练和浏览的爬虫。
  • ClaudeBot——Anthropic 的爬虫。
  • PerplexityBot——Perplexity 答案引擎的爬虫。

在 robots.txt 中放行它们

User-agent: GPTBot
Allow: /

User-agent: ClaudeBot
Allow: /

User-agent: PerplexityBot
Allow: /

Sitemap: https://yoursite.com/sitemap.xml

如果你更希望某个爬虫别进来,就在它的 user-agent 下用 Disallow: / 以同样的方式屏蔽。要慎重:屏蔽一个爬虫,意味着那家助手无法引用你。

验证它确实生效

一条看上去没问题的规则仍可能失效——上方一条多余的 Disallow、框架把 robots.txt 当成 HTML 返回、缺少 sitemap 链接。把你的网址放进「AI 可抓取性」检查器,逐个爬虫地看清哪些被放行、哪些被悄悄屏蔽了,再让技能就地修补这些缺口。

如何让 GPTBot、ClaudeBot 和 PerplexityBot 读取你的网站