01

先保留一条能回查的访问记录

不要把同一个名称下的请求直接合并为已核实访问。Google 的抓取程序文档明确提醒,HTTP User-Agent 字符串可以被冒用。名称用于选择核验入口,不能单独作为身份结论。

建议每条待核验访问保留下表字段。这里给的是记录方案,不是某个平台要求的固定表头。

字段应保存的内容
访问时间原日志时间、时区;与核验时间分别记录
来源 IP用于实际查询的 IP,并注明取自哪份日志
User-Agent完整原值,不只留抓取程序名称
请求路径实际访问的路径,便于找回原请求
状态码当次请求实际返回的状态码
核验方法DNS 双向查询、官方工具或对应 IP 列表匹配
核验依据官方文档与列表 URL、版本或生成时间;未提供则注明
取得与核验时间取得文档或列表的时间、执行核验的时间
结论与证据三类结论之一,附 DNS 返回值、工具结果或范围匹配结果

列表自带日期与取得列表的日期不能互相替代。若原始生成时间没有时区,就保留原值并注明未提供时区,不自行补写北京时间;网站方的取得与核验时间则应明确时区。历史访问若没有同期依据,应把这一限制写在结论旁。

02

Google 核验要走完两个方向

Google 官方核验步骤要求先对日志 IP 做反向 DNS 查询,再对所得域名做正向查询,确认返回的 IP 与原日志 IP 一致。只看到域名里的几个字,或只完成反向查询,都不足以完成这套核验。

针对 Googlebot,常见抓取程序文档给出的域名模式是 crawl-*-*-*-*.googlebot.com 或 geo-crawl-*-*-*-*.geo.googlebot.com。按对应类别检查完整域名,再完成正向回查;不要把其他类别的域名说明混作 Googlebot 的依据。

批量记录可改用官方公布的常见抓取程序 IP 范围。官方核验页说明,JSON 中的 IP 地址采用 CIDR 格式;应判断请求 IP 是否属于相应范围,不能只做整串文本相等比较。记录所用列表版本与匹配结果,便于之后重查。

03

Bing 与 AI 抓取程序分别查依据

把日志中的 Bingbot 来源 IP 提交给Bing 官方验证工具,保存工具实际返回的结果。页面可打开不等于某条访问已经核实;若查询失败或没有明确结果,保留失败信息并列为待查。也可依Bing 公布的核验方法,反向查询是否得到以 search.msn.com 结尾的名称,再正向查询确认回到同一 IP。核对时应检查完整域名的归属,不能只在字符串中搜索名称。

OAI-SearchBot 应对照OpenAI 文档在该抓取程序条目下公布的IP 列表。文档把不同抓取程序分别列出,不应拿另一个名称下的列表代替本次核验依据。

PerplexityBot 则使用Perplexity 官方文档列出的对应 IP 列表。其文档建议结合 User-Agent 与 IP 验证,并以官方端点的当前 IP 范围为依据。核验记录要留下实际取得的那份列表,不能日后用一份新列表悄悄覆盖原依据。

04

三类结论怎样下判

“已核实”:对应名称的官方方法取得明确匹配证据,例如 Google 的类别域名与正向返回 IP 均相符,或 IP 落在对应程序的官方公布范围内。结论同时写明依据取得时间;它说明这条请求的来源身份。

“与 UA 不符(疑似冒用)”:取得可用核验结果后,发现它与自报名称明确冲突。保留具体冲突,使用“疑似”表述,不进一步猜测请求者身份或动机。

“无法判定”:查询失败、工具未返回结论、列表未覆盖,或没有足以核验历史访问的同期依据。单纯未命中一份列表先记为证据不足,不直接等同于冒用;补查时追加新结果,并保留原结论与当时依据。

05

常见问题

已核实抓取程序访问,能说明页面会被引用吗?

不能。身份结论只说明“谁来抓过”;路径和状态码记录的是这次请求,不能据此推断收录、排名或被 AI 引用。搜索与 AI 回答的关系可参照GEO 与 SEO 的区别;需要理解来源引用时,再读AI 引用生成过程。若要排查 OAI-SearchBot 能否访问,可参照ChatGPT 引用做法中的访问自查,日志身份核验仍以这条访问的证据为准。

本文由 AI 辅助创作,发布前经人工审核。

06

想先看你的品牌现在在 AI 搜索里被怎么说?

领取免费增长诊断