robots.txt 这个文件,我最早的理解就是「全放或者全挡」。后来有一次做抓取优化,发现爬虫天天在参数页里打转,宝贵预算被浪费,才意识到 robots 能做得更细——精准引导,而非一刀切。
高级玩法是用规则把蜘蛛引到该去的地方、挡住该挡的地方,既保护预算也护住服务器。具体写法可对照技术SEO 实战手册的抓取控制章节,把规则写明白、写对,少留隐患。
快速结论
- robots.txt 能精细到路径和 UA,而非只有全放全挡。
- 用 Disallow 挡低价值页,用 Allow 放行重要子页。
- 配合抓取预算,把蜘蛛引向核心内容。
- 改完用 GSC 的 robots 测试工具验证生效。
robots.txt 能做什么
robots.txt 是站点根目录下的协议文件,告诉爬虫哪些能抓、哪些不能。它支持按 User-agent 区分搜索引擎,支持通配符匹配路径,比很多人想的灵活得多。会写,抓取效率能差出一大截,值得学。
但要注意:robots 只”建议”不”强制”,主流搜索引擎都遵守,恶意爬虫可能无视。而且被 Disallow 的页若被外链指向,仍可能进索引(只是看不到内容)。想彻底不收,得配合 noindex,两者职责不同,别混为一谈,各管一摊。
精准 Disallow 与 Allow
基础写法 Disallow: /search 挡掉内部搜索页;高级写法是组合:先 Disallow 一整段,再用 Allow 放行其中重要子目录。比如挡掉 /filter/ 下大部分,但 Allow 某个有价值的聚合页,粗细可控,不误伤好页。
通配符(*)和结尾($)很有用:Disallow: /*?* 挡所有带参数 URL,Disallow: /tmp$ 只挡 /tmp 这一个。写准规则,既不误伤好页,也不放过小杂草。细节决定抓取质量,值得逐条推敲,别偷懒。
配合抓取预算
站里参数页、分页、后台入口若被蜘蛛天天抓,预算就耗在杂草上。用 robots 把这些低价值路径挡掉,预算回流到正文,同等时间内好页被抓得更全。这直接服务于收录效率,是免费的提速,立竿见影。
挡之前先拿日志看蜘蛛实际在逛哪,别凭印象乱挡,以免误拦重要页。想系统做这件事,可参考抓取预算优化的排查思路:先量化浪费,再下规则,让每一分预算都花在正文上,不空转,不白费。
常见误用
最痛的误用是 Disallow 了全站或关键目录,导致整站不被抓、排名蒸发。尤其改模板时手滑加了一行 Disallow: /,一夜归零。上线前务必用测试环境验证,别让一行规则毁掉可见性,代价太高,回头难。
另一个坑是把 robots 当 noindex 用:以为挡住就不收,结果页靠外链还是进了索引,只是内容看不到,反而更怪。该不收的页要老老实实加 noindex,robots 只管”抓不抓”,两件事分清,别指望一个顶俩,职责要清。
改 robots 前养成习惯:先在测试环境用真实抓取验一遍,确认该挡的挡、该放的放,再推生产。小步验证比事后救火省心,尤其大站改动牵一发动全身,稳字当头。
和 sitemap 配合
robots.txt 里可以写明 Sitemap 地址,帮蜘蛛更快发现你的索引地图。挡掉杂草的同时,用 sitemap 把核心页主动递上去,一收一放形成清晰指引,蜘蛛的抓取路线更顺,重要页不遗漏,效率翻倍。
但要注意:sitemap 里别放被 Disallow 的页,自相矛盾会让搜索引擎困惑。保持”放行的才进地图、挡住的别提”的一致,信号才干净。这部分和站点架构扁平化的清晰原则同源,别自己打架。
验证是否生效
GSC 的 robots.txt 测试工具能逐条测某 URL 是否被允许,改完先在这里验,确认规则按预期生效再放心。别写完就当成了,规则写错一个字符,效果可能完全相反,验证这步不能省,省了必吃亏。
也看服务器日志:挡掉的路径蜘蛛是否还来。若仍频繁请求,说明规则没生效或被缓存,需排查。把 robots 纳入发布检查,和技术SEO 实战手册的监控项绑定,改动可追溯、可回滚,心里有底。
配合技术手册
把 robots 规则写进站点规范:哪些路径恒定挡、哪些随业务调整,提前约定。规范让改动可评审,避免个人随手写、随手删,尤其大站多人维护时,一行错全局崩,流程比自觉可靠,长期更稳。
整体抓取控制策略可收进技术SEO 实战手册,与 noindex、sitemap、抓取预算合起来看。robots 是入口第一道闸,用好了既护服务器又提收录,是性价比极高的基础工程,值得认真经营,别忽视。
按搜索引擎分而治之
robots 的 User-agent 行可以针对谷歌、必应、百度分别写不同规则。比如对抓取温和的谷歌放宽、对暴躁的爬虫收紧,或让特定爬虫别碰某些区。分而治之,抓取更可控,也护得住服务器,不打架。
但要注意别写出互相矛盾的规则,尤其同一路径被不同 UA 一个允许一个禁止时,以更具体的规则为准。改完逐 UA 验证,别想当然。这层细分和抓取预算优化思路一致:把额度留给该抓的爬虫与页面。
改动要留痕可回滚
robots 影响面广,每次改都该记录:改了哪行、为什么改、预期效果。一旦流量异动能快速定位回滚,而不是瞎猜。大站尤其要把 robots 纳入版本管理,和代码一起评审、一起发,可控。
可回滚还意味着先在测试环境或低流量验证,再全量。把 robots 当正式配置而非随手记事本,纪律决定它帮不帮你。配合技术SEO 实战手册的发布规范,改动有据可查,心里才踏实。
一张表记 robots 指令
图:robots 控制 核心要点(运营GO 整理)
| 指令 | 作用 | 注意 |
|---|---|---|
| User-agent | 指定爬虫 | 分搜索引擎 |
| Disallow | 禁止路径 | 别误拦全站 |
| Allow | 放行子页 | 配合 Disallow |
| Sitemap | 给地图 | 别放被挡页 |
下一步行动清单
- 拉日志看蜘蛛在逛哪些低价值路径。
- 用 Disallow/Allow 精准挡杂草、放重点。
- 在 robots 写明 Sitemap 地址。
- 用 GSC 测试工具逐条验证生效。


