llms.txt 与 AI 抓取:你的站被 SearchGPT 读到了什么

运营GO 编辑部

llms.txt 是给 AI 爬虫看的”站点说明书”,类似 robots 但面向大模型。AI 搜索崛起,主动告诉模型”哪些内容重要、该怎么用”,正在变成新的技术SEO 动作,早做的站更容易被精准引用、拿到零点击曝光。

它和 robots.txt 互补:robots 管”爬不爬”,llms.txt 管”怎么理解、优先哪些”。这篇文章讲清它是什么、怎么写、怎么和数据策略配合。系统打法可参考技术SEO 实战手册

快速结论

  • llms.txt 是面向 AI 爬虫的声明文件,说明站点哪些内容适合被模型读取与引用。
  • 它和 robots.txt 互补:robots 管”爬不爬”,llms.txt 管”怎么理解、优先哪些”。
  • 文件放根目录,用简洁 Markdown 列出重点页面和授权方式,降低模型误读。
  • 配合抓取预算优化,让 AI 引用更精准,把你的好内容排到最前。

llms.txt 是什么

llms.txt 是社区提议的一个约定:在站点根放一个 Markdown 文件,用人类和大模型都能读的格式,告诉 AI”我站里哪些内容值得读、哪些是授权范围”。它针对的是新一代会读站点的 AI agent 和问答引擎。

和传统 robots.txt 不同,robots 只说”允许/禁止爬哪个路径”,llms.txt 更进一步说明”这些内容该怎么被理解和引用”,相当于给模型的导读,帮它少走弯路、少误读,把有限精力放在你最想被引的内容上。

和 robots.txt 的区别

robots.txt 是老协议,管的是”爬不爬、爬多快”,对内容含义只字不提。llms.txt 不替代它,而是在其之上补充”语义层”指引:哪些文章是旗舰内容、用什么授权、有没有付费墙,职责清晰分工互不打架。

两者配合最稳:用 robots 控抓取边界,用 llms.txt 引导理解。别因为有了 llms.txt 就松懈 robots,前者管”懂你”,后者管”进不进得来”,一个管语义一个管通道,缺一不可,缺了任何一个都会让引用效果打折。

文件怎么写

放根目录 /llms.txt,内容用 Markdown:开头一段站点简介,下面分块列出重点页面链接和一句话说明,再写授权与限制。保持简洁,让模型一眼抓到重点,别写成又臭又长的文档,否则它懒得读、直接跳过你的导读。

重点列你最想被引用的内容(支柱文、权威指南),并标注更新频率。写法参考官方草案即可,核心是”给模型省时间”,它读得越顺,引用你概率越高。详见技术SEO 实战手册的新兴协议小节,能少走不少弯路。

和抓取效率的关系

AI 爬虫也是访客,乱爬同样浪费服务器和你的抓取预算感知。llms.txt 引导它直奔重点,减少在无关页上的消耗,和抓取预算优化的思路同源:把有限注意力引到高价值内容,别在低质页上空转浪费上下文。

尤其内容多的站,模型若逐页乱读,既慢又易抓到过时页。导读式声明能显著提升”被引用的内容质量”,避免在低质页上浪费模型的上下文窗口,也让你的旗舰内容更容易被点名和引用,曝光更精准。

常见错误

错误一:文件放错位置或格式乱,模型根本读不到。错误二:列了一堆低质页,反而稀释重点,好内容被埋。错误三:授权写错,把本该限制的内容放开或反过来。错误四:写完不维护,链接过期成死链。

错误五:以为有了 llms.txt 就不管 robots,结果模型被 robots 挡在门外。它是增量动作,不是替代;和既有抓取策略一起用,才让 AI 引用既准又合规,否则导读写了也是白写,该进不来的还是进不来。

怎么验证被读

在日志里看 AI 爬虫 UA 是否请求了 /llms.txt 及后续重点页,确认导读确实生效。部分平台的引用监测也能看到你的内容是否进答案,把 llms.txt 上线前后做个对比,数据会替你说话,比凭感觉靠谱。

若模型仍频繁读无关页,说明导读没被采纳,回头调文件结构和重点排序。这是个新事物,边做边看数据,别追求一步到位,先让最想被引的内容排到最前,再逐步迭代完善,慢慢就能摸出适合自己站点的写法。

和站点架构的配合

llms.txt 负责”告诉模型重点”,但模型能不能顺畅走到这些重点页,还得看架构。扁平清晰的架构让重点页离首页更近、内链更顺,和 llms.txt 的导读形成双保险,引用路径更短更稳。

建议先把扁平化站点架构梳理到位,再写 llms.txt。架构解决”走得到”,导读解决”读得懂”,两个动作一起做,AI 引用才既准又稳,比只丢一个文件上去有效得多,也更符合长期主义。

小站要不要做 llms.txt

有人问小站值不值得做。答案是值得,因为它成本极低:写一个干净的 Markdown 文件,列清重点页即可,不花什么工程资源。对内容少的小站,一份好的导读反而更容易让模型抓住全站精华,效果更明显。

小站不必追求大而全,把最想被引的三五篇列清楚就够。比起大站要维护海量链接,小站的 llms.txt 反而好打理,先写上再随内容增长迭代,比一直观望更划算,也提前占住 AI 引用的身位。

llms.txt 的定位robots 控边界,llms.txt 引导理解robots管爬不爬llms管怎么理解根目录/llms.txt导读引重点内容+

图:llms.txt 与 AI 爬虫 核心要点(运营GO 整理)

robots.txtllms.txt
管什么爬不爬怎么理解
对象所有爬虫AI 模型
格式文本指令Markdown
位置根目录根目录

下一步行动清单

  • 在根目录新建 /llms.txt,写站点简介与重点页面链接。
  • 列出最想被引的支柱内容,标注更新频率与授权方式。
  • 保持 robots.txt 不变,两者配合而非互相替代。
  • 在日志监控 AI 爬虫是否读取 llms.txt 及重点页。
  • 定期维护链接,避免过期死链稀释导读的整体效果。

相关阅读