llms.txt 是给 AI 爬虫看的”站点说明书”,类似 robots 但面向大模型。AI 搜索崛起,主动告诉模型”哪些内容重要、该怎么用”,正在变成新的技术SEO 动作,早做的站更容易被精准引用、拿到零点击曝光。
它和 robots.txt 互补:robots 管”爬不爬”,llms.txt 管”怎么理解、优先哪些”。这篇文章讲清它是什么、怎么写、怎么和数据策略配合。系统打法可参考技术SEO 实战手册。
快速结论
- llms.txt 是面向 AI 爬虫的声明文件,说明站点哪些内容适合被模型读取与引用。
- 它和 robots.txt 互补:robots 管”爬不爬”,llms.txt 管”怎么理解、优先哪些”。
- 文件放根目录,用简洁 Markdown 列出重点页面和授权方式,降低模型误读。
- 配合抓取预算优化,让 AI 引用更精准,把你的好内容排到最前。
llms.txt 是什么
llms.txt 是社区提议的一个约定:在站点根放一个 Markdown 文件,用人类和大模型都能读的格式,告诉 AI”我站里哪些内容值得读、哪些是授权范围”。它针对的是新一代会读站点的 AI agent 和问答引擎。
和传统 robots.txt 不同,robots 只说”允许/禁止爬哪个路径”,llms.txt 更进一步说明”这些内容该怎么被理解和引用”,相当于给模型的导读,帮它少走弯路、少误读,把有限精力放在你最想被引的内容上。
和 robots.txt 的区别
robots.txt 是老协议,管的是”爬不爬、爬多快”,对内容含义只字不提。llms.txt 不替代它,而是在其之上补充”语义层”指引:哪些文章是旗舰内容、用什么授权、有没有付费墙,职责清晰分工互不打架。
两者配合最稳:用 robots 控抓取边界,用 llms.txt 引导理解。别因为有了 llms.txt 就松懈 robots,前者管”懂你”,后者管”进不进得来”,一个管语义一个管通道,缺一不可,缺了任何一个都会让引用效果打折。
文件怎么写
放根目录 /llms.txt,内容用 Markdown:开头一段站点简介,下面分块列出重点页面链接和一句话说明,再写授权与限制。保持简洁,让模型一眼抓到重点,别写成又臭又长的文档,否则它懒得读、直接跳过你的导读。
重点列你最想被引用的内容(支柱文、权威指南),并标注更新频率。写法参考官方草案即可,核心是”给模型省时间”,它读得越顺,引用你概率越高。详见技术SEO 实战手册的新兴协议小节,能少走不少弯路。
和抓取效率的关系
AI 爬虫也是访客,乱爬同样浪费服务器和你的抓取预算感知。llms.txt 引导它直奔重点,减少在无关页上的消耗,和抓取预算优化的思路同源:把有限注意力引到高价值内容,别在低质页上空转浪费上下文。
尤其内容多的站,模型若逐页乱读,既慢又易抓到过时页。导读式声明能显著提升”被引用的内容质量”,避免在低质页上浪费模型的上下文窗口,也让你的旗舰内容更容易被点名和引用,曝光更精准。
常见错误
错误一:文件放错位置或格式乱,模型根本读不到。错误二:列了一堆低质页,反而稀释重点,好内容被埋。错误三:授权写错,把本该限制的内容放开或反过来。错误四:写完不维护,链接过期成死链。
错误五:以为有了 llms.txt 就不管 robots,结果模型被 robots 挡在门外。它是增量动作,不是替代;和既有抓取策略一起用,才让 AI 引用既准又合规,否则导读写了也是白写,该进不来的还是进不来。
怎么验证被读
在日志里看 AI 爬虫 UA 是否请求了 /llms.txt 及后续重点页,确认导读确实生效。部分平台的引用监测也能看到你的内容是否进答案,把 llms.txt 上线前后做个对比,数据会替你说话,比凭感觉靠谱。
若模型仍频繁读无关页,说明导读没被采纳,回头调文件结构和重点排序。这是个新事物,边做边看数据,别追求一步到位,先让最想被引的内容排到最前,再逐步迭代完善,慢慢就能摸出适合自己站点的写法。
和站点架构的配合
llms.txt 负责”告诉模型重点”,但模型能不能顺畅走到这些重点页,还得看架构。扁平清晰的架构让重点页离首页更近、内链更顺,和 llms.txt 的导读形成双保险,引用路径更短更稳。
建议先把扁平化站点架构梳理到位,再写 llms.txt。架构解决”走得到”,导读解决”读得懂”,两个动作一起做,AI 引用才既准又稳,比只丢一个文件上去有效得多,也更符合长期主义。
小站要不要做 llms.txt
有人问小站值不值得做。答案是值得,因为它成本极低:写一个干净的 Markdown 文件,列清重点页即可,不花什么工程资源。对内容少的小站,一份好的导读反而更容易让模型抓住全站精华,效果更明显。
小站不必追求大而全,把最想被引的三五篇列清楚就够。比起大站要维护海量链接,小站的 llms.txt 反而好打理,先写上再随内容增长迭代,比一直观望更划算,也提前占住 AI 引用的身位。
图:llms.txt 与 AI 爬虫 核心要点(运营GO 整理)
| 项 | robots.txt | llms.txt |
|---|---|---|
| 管什么 | 爬不爬 | 怎么理解 |
| 对象 | 所有爬虫 | AI 模型 |
| 格式 | 文本指令 | Markdown |
| 位置 | 根目录 | 根目录 |
下一步行动清单
- 在根目录新建 /llms.txt,写站点简介与重点页面链接。
- 列出最想被引的支柱内容,标注更新频率与授权方式。
- 保持 robots.txt 不变,两者配合而非互相替代。
- 在日志监控 AI 爬虫是否读取 llms.txt 及重点页。
- 定期维护链接,避免过期死链稀释导读的整体效果。


