网址被发现不等于内容被抓取
Google 的 robots.txt 介绍指出,被禁止抓取的页面仍可能因其他站点链接而被索引,原文为“still be indexed if linked to from other sites.”。这不表示 Google 抓到了被禁止的正文;官方说明,网址以及可能存在的公开链接锚文本等信息仍可出现在结果中。Google 的 robots.txt 介绍
因此,看到网址仍在搜索结果里,不能直接判定禁抓规则失效。需要分别查明:规则是否限制了抓取,以及是否有可被读取的移出索引指令。这是两个控制环节。
用四格表定位控制冲突
下面是假设表,比较同一网址对 Googlebot 的抓取许可与 noindex 设置。这里的“允许”还以资源实际可访问为前提;表中结论不是某个网址当前索引状态的证明。
| 是否允许抓取 | 是否提供 noindex | 控制结果与局限 |
|---|---|---|
| 允许 | 不提供 | 可抓取;这两项设置没有要求移出索引,也不保证收录 |
| 允许 | 提供 | Googlebot 有机会读取规则;需核对实际响应并等待重新抓取与处理 |
| 禁止 | 不提供 | 限制抓取;网址仍可能因其他页面链接而出现在结果里 |
| 禁止 | 提供 | 页面有规则也可能读不到;不能仅凭后台配置认定移出完成 |
若目标是让公开可访问的资料退出搜索结果,应围绕“规则能否被读到”安排设置。若目标只是控制抓取量,禁抓规则解决的是另一件事。核实访问日志中的请求身份可参考抓取日志核验方法,这里不展开抓取器用途与令牌选择。
改规则前核对实际响应
关键不是后台勾选框,而是 Googlebot 能取得什么。Google 的 noindex 文档以“Googlebot crawls that page”为条件:抓取该页并提取到标签或响应头后,Google 才据此将页面移出结果。页面不能被 robots.txt 阻断,也必须对抓取器可访问。
针对在 robots.txt 中指定 noindex,官方明确写道:
Specifying the noindex rule in the robots.txt file is not supported by Google.
Google 的 noindex 规则说明
- 列出要移出结果的完整网址,检查该地址是否仍被 robots.txt 禁抓,以及重定向后实际取得哪个资源;不要只核对目录名。如仍禁抓,先修改 robots.txt 放行该网址。
- 查看返回的 HTML 中是否有有效的 robots meta noindex,或 HTTP 响应头是否包含 X-Robots-Tag: noindex。选适合资源类型的方式,不能把规则塞进 robots.txt。
- 文档建议用 URL 检查工具查看抓取时收到的 HTML,以检验 noindex 实现是否正确,原文为“see the HTML that Googlebot received”;同时留存实际响应头。编辑器中的标签不能替代交付响应,浏览器中能打开也不能单独证明 Googlebot 可访问。
留存证据再观察重新抓取
建议给每个网址保留一份变更记录:原始响应体、响应头、对应 robots.txt 规则、修改内容和修改时间。记录修改前后是否允许抓取、noindex 位于何处,以及最近一次可核对的抓取结果,避免只保存一张配置截图。
随后观察 Google 是否重新抓取并提取到规则,以及网址是否仍出现在结果里。官方说明,添加规则后尚未重新抓取,是页面继续出现的可能原因;不能把设置完成时间当成处理完成时间,也不承诺多久生效。
一次搜索观察不足以证明全部处理完成。将后续观察的时间、网址和结果接着记在原记录里;GEO 与 SEO 的三个区别可帮助区分搜索结果与 AI 回答的观察对象,此处只核对搜索移出诉求。
保密资料先做访问授权
机密内容不能靠“搜索不到”保护。Google 对私密资料建议采用密码保护,确保“only authorized users can access it.”;noindex 不阻止持有链接的人直接访问内容。Google 的内容访问控制说明
需要保密的资料先实施登录、密码及相应权限检查,再处理搜索展示。不要为了让 noindex 可读而把私密正文开放给未授权访问者;robots.txt 与 noindex 都不能替代访问授权。
想先看你的品牌现在在 AI 搜索里被怎么说?
领取免费增长诊断