Google-Extended 是谷歌用来为 AI 功能(如 AI Overviews、Gemini)抓取内容做训练与生成的专用用户代理。它和 Googlebot 不是一回事:你可以继续让 Googlebot 抓取以保证搜索收录,同时单独决定要不要放 Google-Extended 进门。这道新选择题正在所有内容站面前摆开。
对内容站来说,这是一道新选择题——让 AI 抓,可能换来在答案里的曝光;不让,等于把内容挡在 AI 检索之外。决策要落到 robots.txt 的具体写法上,也可结合技术SEO 实战手册的抓取控制章节一起看,把 AI 爬虫纳入整体抓取治理,而不是孤立地拍脑袋决定。
快速结论
- Google-Extended 与 Googlebot 是两个独立 UA,可在 robots 里分别控制。
- 放行能增加内容进入 AI 答案的机会,但也可能增加服务器负载。
- 不想被 AI 训练就显式 Disallow,但那样会同时失去 AI 渠道的曝光。
- 无论放行与否,都要监控 AI 爬虫带来的流量与带宽成本。
几个常见的 AI 爬虫 UA
除了 Google-Extended,OpenAI 的 GPTBot、Anthropic 的 ClaudeBot、Common Crawl 的 CCBot 也都活跃在内容站。它们用途不同:GPTBot 用于模型训练与 ChatGPT 检索,CCBot 是公开语料库抓取。认清 UA 才能分别制定策略,而不是一刀切全放或全拦,毕竟它们的价值和风险并不一样。
注意 UA 可以被伪造,robots.txt 是”君子协议”而非防火墙。真正要拦恶意流量,得配合 WAF 和 IP 规则。这点对 AI 爬虫同样成立:它愿意遵守就遵守,碰上伪造就只能靠流量层去挡,详见抓取预算优化里对低质爬虫的处理思路,底层手段是一致的。
放行的理由与代价
放行的直接收益是内容可能出现在 AI 问答的引用来源里,带来品牌曝光甚至引流。对依靠内容曝光变现的站,这是新渠道,而且零点击也能拿品牌印象,长期积累的认知价值不低。代价是 AI 爬虫抓取量大、节奏密,会占用带宽和服务器资源,小站尤其要评估会不会影响真实用户访问。
如果服务器本就吃紧,盲目放行可能让 AI 爬虫挤占正常请求,真实用户打开变慢反而伤 SEO。建议先观察一段时间 AI 爬虫的抓取占比,再决定是否限流。放行不等于放任,配合 Crawl-delay(部分爬虫支持)或 WAF 限速更稳,既留渠道又护住体验,不至于因小失大,把主次搞反。
拒绝的写法与影响
只想拦 Google-Extended,就在 robots.txt 单独写一段:User-agent: Google-Extended 然后 Disallow: / 。这样 Googlebot 仍正常工作,搜索收录不受影响,只是内容不进谷歌的 AI 训练与生成。想连 GPTBot 一起拦,就再加对应 UA 段,每段独立声明,互不影响,改起来也清晰,不容易误伤别的爬虫。
拒绝的隐性成本是:你的内容在 AI 答案里彻底隐形,长期看可能损失一块增长中的流量。是否值得,取决于你的流量结构——如果搜索仍是绝对主力,挡掉 AI 影响有限;如果内容本就面向问答场景,挡掉就少了曝光面,等于把潜在读者让给竞争对手,这个账要算清楚再动手。
监控与决策循环
无论选哪种,都要在日志里把 AI 爬虫的请求量单独拉出来看,计算它占用的带宽比例。如果某天占比冲到 30% 以上且影响了真实用户响应,就该考虑限速或局部拦截,而不是等到服务器告警才动手,那时已经伤了真实访客,蜘蛛抓取也跟着受影响,修复成本更高。
决策不是一次性的:季度复盘一次 AI 渠道是否带来可衡量收益,再调整 robots 策略。把放行/拒绝写进团队的抓取管理规范,避免有人随手改 robots 把重要爬虫误伤,和扁平化站点架构一样需要稳定可预期,朝令夕改只会让排查更乱,也难做长期效果评估。
图:AI 爬虫管理策略 核心要点(运营GO 整理)
| UA | 归属 | 建议动作 |
|---|---|---|
| Google-Extended | Google AI | 按收益决定 |
| GPTBot | OpenAI | 按需放行 |
| CCBot | CommonCrawl | 通常放行 |
| ClaudeBot | Anthropic | 按需放行 |
沙箱测试再拍板
拿不准就先做沙箱测试:在测试环境或低权重子域用不同 robots 策略跑两周,观察 AI 爬虫流量、服务器负载和任何来自 AI 渠道的曝光变化,用数据代替猜。小步试错比直接全站改 robots 安全,错了回滚也快,不影响主站收录。
记录测试期间的带宽占比和真实用户响应,确认放行没有拖慢正常访问。若数据表明 AI 渠道带来可衡量曝光且成本可控,再推广到主站;若反而挤占资源,就维持拦截或限速,决策有据可依,也方便向团队解释。
内容授权视角
除了技术层面的放行/拦截,还要从内容授权角度想:你的内容是否允许被训练、被引用,最好在条款或 robots 里表达清楚。放任不等于授权,拦截也不等于保密,二者都不是法律上的授权动作,必要时咨询合规,别把技术设置当成法律结论。
对原创度高的站,内容被 AI 引用可能带来流量也可能稀释独家性,权衡要回到商业模型。技术设置只是执行层,真正的策略来自”我希望内容以什么方式被使用”,先把这层想清楚,robots 怎么写自然就定了,不至于反复横跳。
不同业务规模的取舍
小站流量和内容量都有限,AI 爬虫占比低,放行几乎无感,挡不挡差别不大,先把搜索收录稳住更重要。中大型站内容资产重,AI 渠道的曝光和带宽成本都更显著,才值得专门做沙箱测试和季度复盘,资源要花在杠杆最大的地方。
下一步行动清单
- 在 robots.txt 区分 Google-Extended 与 Googlebot,分别控制。
- 日志中单独统计 AI 爬虫带宽占比,设告警阈值。
- 评估 AI 渠道是否带来曝光,季度复盘策略。
- 对伪造 UA 的恶意流量用 WAF 而非 robots 拦截。
- 把抓取策略写进团队规范,避免误改 robots。


