联系我们

选择国家和城市

我们在美國的办公室

  • 纽约
    Division Street 40, New York, 10002
    +1 (347) 620-09-02
  • 華盛頓哥倫比亞特區
    L Street Northwest 1200, Washington, 20005
    +1 (347) 620-09-02

什么是GPTBot?该不该放AI爬虫进自己的网站?

谢尔盖·卡尔普(纽约), 联合创始人 / CTO

GPTBot是ChatGPT背后的公司OpenAI运行的网络爬虫。它访问网站、收集可能用于训练OpenAI模型的内容。它以GPTBot这个user agent表明身份——您在robots.txt里放行或拦截它用的就是这个名字,在服务器日志里看到的也是这个名字。

核心要点

GPTBot是OpenAI的训练爬虫,与OAI-SearchBot和ChatGPT-User不同。放行搜索类爬虫,为训练类定个策略,并检查CDN。

OpenAI有三个机器人,不是一个

  • GPTBot收集用于模型训练的内容;
  • OAI-SearchBot为ChatGPT里的搜索结果寻找页面;
  • ChatGPT-User在用户让ChatGPT看某个页面时打开它。

拦掉GPTBot,并不会把您从ChatGPT搜索里除名;放行它,也不会把您送进去。每个机器人都是分开控制的。

其他AI爬虫

  • Google:Google-Extended控制您的内容是否用于Gemini的训练与事实支撑,它不影响Google搜索。
  • Anthropic:ClaudeBot、Claude-SearchBot和Claude-User。
  • Perplexity:PerplexityBot和Perplexity-User。
  • Microsoft:Copilot依托Bingbot。

举个例子,如果既不想让内容进入OpenAI的训练,又要保持在ChatGPT搜索里可见,robots.txt可以这样写:

User-agent: GPTBot
Disallow: /

User-agent: OAI-SearchBot
Allow: /

该不该放AI爬虫进自己的网站?

  • 搜索和作答机器人,企业网站通常值得放行。否则AI助手既没法引用您的页面,也没法链接到它。
  • 训练机器人,可以按贵公司的政策决定放行还是限制。
  • 私密区域,例如用户中心、购物车和后台,应当对所有机器人关闭。

别停在robots.txt。主机防火墙和CDN的机器人防护,有时会在站长不知情的情况下拦下AI爬虫。服务器日志能告诉您这些机器人到底进没进来。完整的拆解见哪些AI爬虫该放行,哪些该拦截

在AI搜索优化,配置AI爬虫访问权限属于我们技术优化的一部分。预约通话,我们会查清您的网站现在正把哪些机器人拒之门外。

更多文章

AI搜索优化:如何让ChatGPT、Google AI Overviews和Perplexity推荐您的企业

AI助手只推荐它找得到、看得懂、信得过的企业。AI搜索优化让您的网站被引用,让您的公司在AI回答中被点名。

阅读文章

什么是生成式引擎优化(GEO)?写给企业主的GEO与SEO对比

GEO、AEO、LLMO和AI SEO说的是同一个目标:让AI推荐您的企业。GEO建立在SEO之上,两者缺一不可。

阅读文章

预约与AI搜索优化专家通话

我们会让您看到ChatGPT、Google AI Overviews、Perplexity等AI助手如何评价您的企业和竞争对手——以及您的网站内外需要做哪些改变。

纽约, 美國

切尔西·夏克

Division Street 40, New York, 10002, 纽约

+1 (347) 620-09-02

united-states-new-york-city-zh@promo-yar.ru