需要在robots.txt里声明llms.txt吗?
谢尔盖·卡尔普(纽约), 联合创始人 / CTO
不需要。robots.txt里并没有针对llms.txt的指令,所以也无从添加。这个文件靠它的标准地址example.com/llms.txt被找到,就像robots.txt靠example.com/robots.txt被找到一样。在robots.txt里写一行指向llms.txt,并不能帮AI助手发现它。
核心要点
不需要。robots.txt没有针对llms.txt的指令。真正重要的是文件能正常加载,以及AI爬虫没有被挡在网站之外。
robots.txt真正决定的,是AI爬虫能不能访问您的网站。真正的麻烦通常就藏在这里。
llms.txt自查清单:要确认哪些事
在动用llms.txt检查工具或校验器之前,先自己把这几点过一遍:
- 文件能直接打开,不需要登录、也不跳转,并返回200状态码;
- 它以UTF-8编码的纯文本形式提供,而不是一个HTML页面;
- 它遵循基本的Markdown结构:公司名称、简短描述、带链接的章节;
- robots.txt没有拦住您希望进站的AI爬虫,比如OAI-SearchBot、Claude-SearchBot或PerplexityBot;
- 服务器、防火墙或CDN上的机器人防护没有在您不知情的情况下拦下这些爬虫;
- 文件里的每一个链接都指向一个能正常打开的页面。
在线校验器能确认格式、揪出失效链接,但它没法告诉您文件里的事实是不是最新的,也没法告诉您AI爬虫到底进没进得来。这些要看服务器日志。
最常见的错误
一份精心写好的llms.txt,却放在一个对AI爬虫关着门的网站上。这种情况下文件毫无意义:AI助手打不开它,同样也打不开它指向的那些页面。另外还要记住,llms.txt是2024年才被提出的,主流AI厂商并没有正式确认他们在使用它,所以爬虫的抓取权限和清晰的页面,远比这个文件本身重要。
如果您拿不准该放行哪些机器人,请看我们的指南哪些AI爬虫该放进自己的网站。
在AI搜索优化,我们会在每一次AI可见度审计中检查AI爬虫的抓取权限、robots.txt和llms.txt,每月290美元,含前10小时工作时长。预约通话。