阅读约 5 分钟
如何让 GPTBot、ClaudeBot 和 PerplexityBot 读取你的网站
一份实用指南,介绍各家 AI 爬虫的 user-agent、如何在 robots.txt 中逐个放行或屏蔽它们,以及如何验证它们确实能读到你的内容。
如果你希望 AI 的回答提到并链接你的网站,那么背后的爬虫就需要获得抓取它的许可。每家主流助手都会带一个具名的 user-agent,而 robots.txt 正是你迎接或拒绝它们的地方。
需要认识的这些爬虫
- GPTBot——OpenAI 用于训练和浏览的爬虫。
- ClaudeBot——Anthropic 的爬虫。
- PerplexityBot——Perplexity 答案引擎的爬虫。
在 robots.txt 中放行它们
User-agent: GPTBot
Allow: /
User-agent: ClaudeBot
Allow: /
User-agent: PerplexityBot
Allow: /
Sitemap: https://yoursite.com/sitemap.xml如果你更希望某个爬虫别进来,就在它的 user-agent 下用 Disallow: / 以同样的方式屏蔽。要慎重:屏蔽一个爬虫,意味着那家助手无法引用你。
验证它确实生效
一条看上去没问题的规则仍可能失效——上方一条多余的 Disallow、框架把 robots.txt 当成 HTML 返回、缺少 sitemap 链接。把你的网址放进「AI 可抓取性」检查器,逐个爬虫地看清哪些被放行、哪些被悄悄屏蔽了,再让技能就地修补这些缺口。