GEO 指南
llms.txt 是什么?它能让 AI 收录网站吗
分清 llms.txt、robots.txt 和 sitemap 的用途,按具体工具判断是否维护文件,优先核对企业官网的业务内容和公开访问条件。
llms.txt 是为语言模型和智能体提供网站信息的 Markdown 文件提案。它可以概括网站做什么、说明怎样使用内容,并链接到更详细的材料。是否添加这个文件,应该看你要服务的具体工具是否使用它。
如果你希望网站出现在 Google 的生成式搜索功能里,Google 的官方指南已经明确说明,其搜索不使用 llms.txt。添加这个文件不会为 Google 搜索带来特殊的展示资格。
llms.txt 文件里通常写什么
按照当前提案,文件使用 Markdown,可以包含网站名称、简短概述、使用说明和指向详细资料的链接。提案也讨论了提供网页 Markdown 版本,方便使用这类材料的智能体阅读。
文件可以放在网站根目录,也可以放在子路径,为该路径下的内容提供说明。对产品文档、接口指南和教程较多的网站,整理一份简洁目录有明确的用途。它的作用仍取决于使用方是否读取这份资料。
它与 robots.txt 和 sitemap 有什么区别
这几个文件可以同时存在,各自承担不同工作。
| 文件 | 主要用途 | 不能单独证明什么 |
|---|---|---|
| robots.txt | 向遵守规则的爬虫说明允许或限制哪些抓取路径 | 页面已经收录或会被引用 |
| sitemap | 提供网站页面地址,帮助支持它的搜索系统发现页面 | 所列页面都会进入索引 |
| llms.txt | 为使用它的模型工具或智能体整理网站说明和材料入口 | 所有 AI 都会读取、记住或推荐网站 |
理解差别以后,就可以分别检查。误拦爬虫需要看抓取规则,页面发现需要看链接与地址,资料导览需要看说明是否清楚。无需把每种问题都归到同一个文件上。
为什么添加文件不等于 AI 收录
文件能够被打开,只能说明这个地址可以访问。日志里出现请求,说明有客户端取过它。某个工具能够根据文件回答问题,说明它在该次使用中获得了材料。
网页进入搜索索引、答案显示官网来源和模型训练,涉及其他环节。对于 ChatGPT 搜索,OpenAI 的爬虫说明分别列出搜索用途的 OAI-SearchBot、训练用途的 GPTBot 和用户触发的 ChatGPT-User。观察时应按具体用途判断,不能把一次访问扩写成永久收录。
关于搜索找不到网站的排查,可以继续读ChatGPT 网站可见性指南。
企业官网应该先做什么
先把首页与服务页的业务事实写清楚,确认重要页面能公开访问,站内入口和联系信息有效。如果正文没有解释服务对象和业务条件,单独生成一份目录仍然无法补齐这些内容。
确认具体工具使用 llms.txt 以后,再按网站真实内容编写。保持说明与网页一致,删除失效链接,业务更新时一起维护。别把尚未提供的能力或未经核准的承诺写进文件。
把检查落实到自己的网页
判断有没有必要维护 llms.txt,只需要比较用途与维护成本。判断官网哪些内容影响企业业务表达,则需要看页面本身。
Open GEO Console 可以先检查公开首页。需要继续安排网站内容修改时,可以查看付费深度分析,获得网站分析、页面修改和内容示例。把有限时间先用在重要网页上,往往比不断新增你尚未确认用途的文件更容易形成具体工作。