← 所有文章
閱讀時間 5 分鐘

如何讓 GPTBot、ClaudeBot 和 PerplexityBot 讀取你的網站

一份實用指南,介紹各家 AI 爬蟲的 user-agent、如何在 robots.txt 中逐一允許或封鎖它們,以及如何驗證它們真的能讀到你的內容。

如果你希望 AI 的回答會提到並連結你的網站,那些背後的爬蟲就需要取得抓取權限。每個主要助理都有一個具名的 user-agent,而 robots.txt 正是你歡迎或拒絕它們的地方。

該認識的爬蟲

  • GPTBot — OpenAI 用於訓練與瀏覽的爬蟲。
  • ClaudeBot — Anthropic 的爬蟲。
  • PerplexityBot — Perplexity 的答案引擎爬蟲。

在 robots.txt 中允許它們

User-agent: GPTBot
Allow: /

User-agent: ClaudeBot
Allow: /

User-agent: PerplexityBot
Allow: /

Sitemap: https://yoursite.com/sitemap.xml

如果你寧可讓某個爬蟲留在門外,也是用同樣方式在該爬蟲的 user-agent 底下加上 Disallow: / 來封鎖。要慎重:封鎖一個爬蟲,就代表那個助理無法引用你。

驗證它真的有效

一條看起來沒問題的規則仍可能失效 — 上頭一個漏掉的 Disallow、框架把 robots.txt 當成 HTML 提供、少了 sitemap 連結。把你的網址丟進「AI 爬取能力」檢查器,逐一看清每個爬蟲被允許了什麼、又被悄悄封鎖了什麼,然後讓技能就地補上這些缺口。

如何讓 GPTBot、ClaudeBot 和 PerplexityBot 讀取你的網站