什么是GPTBot?该不该放AI爬虫进自己的网站?
谢尔盖·卡尔普(纽约), 联合创始人 / CTO
GPTBot是ChatGPT背后的公司OpenAI运行的网络爬虫。它访问网站、收集可能用于训练OpenAI模型的内容。它以GPTBot这个user agent表明身份——您在robots.txt里放行或拦截它用的就是这个名字,在服务器日志里看到的也是这个名字。
核心要点
GPTBot是OpenAI的训练爬虫,与OAI-SearchBot和ChatGPT-User不同。放行搜索类爬虫,为训练类定个策略,并检查CDN。
OpenAI有三个机器人,不是一个
- GPTBot收集用于模型训练的内容;
- OAI-SearchBot为ChatGPT里的搜索结果寻找页面;
- ChatGPT-User在用户让ChatGPT看某个页面时打开它。
拦掉GPTBot,并不会把您从ChatGPT搜索里除名;放行它,也不会把您送进去。每个机器人都是分开控制的。
其他AI爬虫
- Google:Google-Extended控制您的内容是否用于Gemini的训练与事实支撑,它不影响Google搜索。
- Anthropic:ClaudeBot、Claude-SearchBot和Claude-User。
- Perplexity:PerplexityBot和Perplexity-User。
- Microsoft:Copilot依托Bingbot。
举个例子,如果既不想让内容进入OpenAI的训练,又要保持在ChatGPT搜索里可见,robots.txt可以这样写:
User-agent: GPTBot Disallow: / User-agent: OAI-SearchBot Allow: /
该不该放AI爬虫进自己的网站?
- 搜索和作答机器人,企业网站通常值得放行。否则AI助手既没法引用您的页面,也没法链接到它。
- 训练机器人,可以按贵公司的政策决定放行还是限制。
- 私密区域,例如用户中心、购物车和后台,应当对所有机器人关闭。
别停在robots.txt。主机防火墙和CDN的机器人防护,有时会在站长不知情的情况下拦下AI爬虫。服务器日志能告诉您这些机器人到底进没进来。完整的拆解见哪些AI爬虫该放行,哪些该拦截。
在AI搜索优化,配置AI爬虫访问权限属于我们技术优化的一部分。预约通话,我们会查清您的网站现在正把哪些机器人拒之门外。