技术 SEO 审计清单:上线前必查的 12 项

运营GO 编辑部

页面不收录、排名上不去,八成不是内容问题,是技术底子漏了项。技术 SEO 审计就是上线前和每季度一次的体检,把爬取、索引、渲染、速度四层一次扫清。等流量跌了才查,要花三倍力气。,具体可参考三层内到核心页,具体可参考迁移版审计清单

快速结论:审计按四层走——爬得动、收得进、渲得出、跑得快。漏掉任何一层,内容写得再好也拿不到排名。把下面 12 项存成模板,每次大改前逐条勾,比事后翻日志省十倍时间。

  1. 爬取层:先让爬虫进得来:确认 robots.txt 不误封 CSS/JS、重要页均有内链可达、服务器近 7 天 5xx 比例低于 1%。
  2. 索引层:让该收的收、不该收的别收:发布前全站搜一遍 noindex、核对 canonical 指向唯一权威版本、sitemap 只放返回 200 的规范页。
  3. 渲染层:确认内容真的被读到:用网址检查工具看渲染后的 HTML,确认正文、内链、结构化数据三样都在场。
  4. 速度层:按真实用户数据达标:以核心网页指标报告为准,LCP 小于 2.5 秒、CLS 小于 0.1、INP 小于 200 毫秒,优先压缩首图与延迟第三方脚本。

爬取层:先让爬虫进得来

爬虫连门都进不来,后面三层都是空谈。这一层查三件事:robots.txt 有没有误封、重要页是否链接可达、返回码是否稳定。

最常见的翻车是 Disallow 写宽了:想封后台写成 Disallow: /wp-,把 /wp-content/ 里的 CSS 和 JS 一起封了,页面渲染不全,排名跟着掉。规则写完先用测试工具挑十个 URL 逐条验,完整写法可对照robots.txt 与 sitemap 的配置要点再核一遍。

可达性同样关键:站内无链接指向的孤儿页抓到了也拿不到权重,用爬虫工具把入链数为 0 的页列出来逐一处理。服务器层面盯 5xx 比例,频繁 5xx 会让 Googlebot 主动降频,近 7 天控制在 1% 以内。

索引层:让该收的收、不该收的别收

爬得进不等于收得进,这一层把四类索引信号对齐。

noindex 最容易在模板级别出事:某类页面的模板带了 noindex,上线后整类集体消失,而你只抽查了首页。发布前全站搜一遍。

canonical 的典型错误有两种:指向错误页面,或分页第 2 页起全部指向第 1 页、导致后续内容不被收录。判断标准只有一条——指向你希望排名的唯一版本。收口方式可参照规范化标签的处理方式逐类型排查。

检查项常见坑正确做法
robots.txt误封 CSS/JS 或整个目录只封确实没有搜索价值的路径
noindex模板级误带,整类页消失发布前全站搜一遍
canonical指向错误页或分页收口过度指向唯一希望排名的版本
sitemap混入 404、301、noindex 页只放返回 200 的规范页
参数页筛选组合生成无限 URL用 canonical 或 robots 收掉

渲染层:确认内容真的被读到

Google 抓取后会执行 JavaScript 再渲染,但渲染是排队进行的,重度依赖前端框架的站点常出现「抓取时是空壳」的情况。

验证方法是用网址检查工具看渲染后的 HTML,确认三样在场:正文、内链、结构化数据。任何一项消失,都说明爬虫看到的比你以为的少。

内链尤其容易漏:onclick 或按钮做的跳转爬虫不识别,必须是带 href 的 <a> 标签,分页、筛选、加载更多三处最常出问题。前端注入的结构化数据也要确认渲染后仍能解析,标记方式可对照结构化数据的标注指南核对。

速度层:三个指标和三个元凶

核心网页指标的及格线是 LCP 小于 2.5 秒、CLS 小于 0.1、INP 小于 200 毫秒,要看真实用户数据而不是实验室分数——实验室 90 分、现场不及格的情况很常见。

元凶几乎永远是三样:首屏大图没压缩、网页字体阻塞渲染、第三方脚本首屏同步加载。按这个顺序修,改前两项通常就能把 LCP 拉回及格线。CLS 主因是图片和广告位没预留尺寸,补齐宽高属性能解决大半。

把四层压成一张可勾的清单

知道四层不够,落地要变成上线前能逐条打勾的表。下面 12 项存成模板重复用。

检查项通过标准怎么查
爬取robots 不误封重要页与 CSS/JS 可抓robots 测试工具
爬取无孤儿页重要页入链数大于 0全站爬虫工具
爬取服务器稳定近 7 天 5xx 低于 1%服务器与监控日志
索引无误加 noindex正式页均可被收录全站搜 noindex
索引canonical 正确指向唯一权威版本抽样核对源码
索引sitemap 干净只放 200 的规范页逐条抽查 URL
索引参数页已收口无无限 URL 组合覆盖率已排除项
渲染正文非纯脚本注入渲染后 DOM 含正文网址检查工具
渲染内链为真实 a 标签渲染后可被提取查看渲染后 HTML
渲染结构化数据留存渲染后仍能解析富媒体测试工具
速度LCP 小于 2.5 秒首屏大图已压缩核心网页指标报告
速度CLS 小于 0.1图片广告位已留尺寸核心网页指标报告

三个最容易被漏掉的盲区

  • 只查首页和栏目页:列表第 3 页、标签页、筛选页才是长尾词掉收录的重灾区
  • 忽略移动端:手机视口下的渲染和速度常和桌面不一致,两套都要跑
  • 只跑一次:模板改过就默认永远干净,实际每次发版都可能引入回归

复检节奏:新站或刚大改完的前三个月每月一次,稳定期每季度一次,大版本发布前再跑一遍。还有一点——覆盖率报告里的「已抓取-尚未编入索引」通常不是技术问题,而是内容价值不足,别混在一起改。

下一步 / 行动清单

  • 把上面 12 项复制成表格模板存进团队文档,标注负责人和频率
  • 本周跑一次全站爬虫,导出 404、重定向链、孤儿页三张清单
  • 用网址检查工具抽 5 个不同类型的页面,逐个确认渲染后正文和内链都在
  • 打开核心网页指标报告按不合格 URL 数量排序,先修数量最多的模板
  • 设好下一次审计时间,把这份清单加进发布流程

常见问题(FAQ)

技术 SEO 审计多久做一次?

新站或大改完的前三个月每月一次,稳定期每季度一次,大版本发布前再跑一遍。存成模板逐条打勾,比事后翻日志省十倍时间。

审计只查 PageSpeed 速度够吗?

不够。速度只是四层之一,爬取、索引、渲染同样决定收录与排名。robots 误封或 noindex 误加,页面再快也进不了索引。

LCP 多少算及格?实验室 90 分算合格吗?

看真实用户数据:LCP 小于 2.5 秒、CLS 小于 0.1、INP 小于 200 毫秒。实验室 90 分、现场不及格的情况很常见,别被实验室分数糊弄。

审计时发现孤儿页怎么办?

站内无链接指向的页面抓到了也拿不到权重。用爬虫工具列出入链数为 0 的页,重要页优先补内链,确无价值可直接 noindex 收掉。


核心要点爬取层:先让爬虫进得来索引层:让该收的收、不该收的别收渲染层:确认内容真的被读到速度层:三个指标和三个元凶

图:{‘raw’: ‘技术 SEO 审计清单:上线前必查的 12 项’, ‘rendered’: ‘技术 SEO 审计清单:上线前必查的 12 项’} 核心要点(运营GO 整理)

相关阅读