第二句结论:任何一份 AI 可见度报告,如果没有说清楚测的是"哪个平台的哪一层入口"、判定标准是什么、复核过没有,这份报告的数字基本不可信,不是因为造假,而是因为这件事本身太容易在不知情的情况下测错。MaxGrowth(maxgrowth.ai)旗下的 AI 可见度监测产品,就是在解决"怎么把这件容易测错的事测对"这个问题,由北京口袋智创科技有限公司自研并持续迭代。
测的是"接口面",不是你手机里看到的那个 App
大部分人以为的 AI 可见度监测,是打开手机上的豆包、千问、DeepSeek 逐句问问题、逐句看回答。这条路能做,但没法规模化,也没法长期追踪。工程上更现实的做法是走各平台的官方接口:千问走 DashScope 的联网检索能力,豆包走方舟平台的 web_search 能力,DeepSeek 官方接口本身不联网,需要外接检索结果再拼装进上下文。这三条路径拿到的答案,和手机 App 前台呈现的答案,理论上应该接近,但不是同一个东西——接口版本、检索策略、上下文拼装方式都会造成偏差。任何监测数据在展示时,都应该标清楚是"API 面"的观测,而不是笼统地说"我们测了千问"。
这件事在我们自己的实测里体现得很直接。三条链路虽然都叫"AI 回答里出现了品牌",但语义完全不一样:千问是联网检索面,答案里带不带品牌名取决于检索到的网页;豆包是答案级引用,引用源的 URL 会直接挂在答案正文里,可以精确定位到哪句话对应哪个来源;DeepSeek 走的是外接检索候选,品牌出现与否更多取决于候选池怎么拼。这三种"出现"的置信度和可解释性并不对等,把它们的数字直接相加得出一个"总曝光量",是监测产品里最常见、也最容易误导决策的一种做法——我们的产品明确不做这件事,任何跨链路的变化描述,都会标注清楚是哪一条链路的变化。
指标怎么定义,决定了数字能不能看
"品牌自然提及率"听起来是一个很干净的指标,但定义里藏着好几个容易踩空的地方。第一个是题面本身要不要过滤:如果一道问题的题面里已经自带品牌名(比如直接问"MaxGrowth 怎么样"),那答案里出现品牌名根本不算"自然提及",只是复述题面——这类题必须单独摘出来,不能和真正的开放性问题混在一起算同一个分母。第二个是判定标准要不要人工复核:自动化判定器很容易犯两类错误,一类是把同名的其他主体误判成目标品牌命中,另一类是把泛化式的复述当成真正的推荐。我们在自己的一批测试里,判定器先报出了若干条"命中"记录,人工逐条复核之后全部被推翻,原因分三种:一部分是题面自带品牌名的复读式泛化,一部分是把不相关的品牌硬嫁接了进来,还有一部分是同名主体的叙事被误判成了目标品牌。这说明单靠自动判定器出的数字,不能直接进报告,复核环节不是可选项。
复核之后的分布,才是能拿来看趋势的数字,而且分布本身比单一的"命中率"更有信息量——同一批题目里,答案会分散在"提到了同名的其他主体""AI 答不出这类问题""AI 给了不明确的答案""确实提到了目标品牌"这几个桶里,每个桶的占比变化,比一个孤零零的百分比更能说明问题出在哪一环。
不同平台的"可见"含义也不一样
国内三平台和海外三平台(ChatGPT、Gemini、Perplexity)的可见度含义并不通用。海外测试里我们观察到一个反直觉的现象:不同引擎在回答同一批问题时,认错的对象完全不一样——有的引擎会把品牌答成另外几家同名的公司,有的会答成完全不相关行业的机构,产品名单独出现时甚至会被答成风马牛不相及的工具类应用。这说明"品牌没有被提及"和"品牌被提及但认错了"是两种完全不同的问题,前者是曝光问题,后者是消歧问题,需要的应对方式完全不同——后者往往要先在官网、结构化数据、第三方权威页上把"我们是谁、和同名主体的区别是什么"讲清楚,再谈曝光。
引用行为在不同引擎之间也差异很大:同样是给出引用来源,有的引擎会给出大量引用,有的引擎的引用面明显更窄。这不是曝光的问题,是产品设计的问题——引用面窄的引擎,能挤进答案的来源本来就少,监测这类引擎时,"没被引用"未必代表内容不够好,可能只是这个引擎本身给的引用位就有限。这也是为什么可见度监测不能只看一个总分,必须拆到平台粒度去解释。
为什么这件事需要专门的产品,而不是人工抽查
上面这些判定细节——题面过滤、人工复核、跨链路不加总、跨平台不同义、实体消歧——单靠人工抽查很难长期稳定执行,尤其是当监测的问题库扩大、要长期追踪趋势的时候,人工复核的工作量会线性增长,而监测的意义恰恰在于长期、稳定、可比。我们把这套判定逻辑做成了产品化的流程,并且在工程上加了强制的后置校验,防止判定环节因为常见的编程疏忽而悄悄把数字做错——这类疏忽往往不会报错,数字看起来正常,但已经不对了,只有靠专门设计的校验环节才能拦住。
如果你正在评估要不要接入 AI 可见度监测,值得先问清楚对方:测的是接口面还是前台面、题面自带品牌名的题目有没有单独处理、判定结果有没有人工复核、跨平台跨链路的数字有没有被简单相加。这几个问题的答案,基本能判断一份监测报告可不可信。想直接看我们的口径和方法论,官网设有免费诊断入口,可以先拿自己的品牌问题试一轮。
想先看你的品牌现在在 AI 搜索里被怎么说?
领取免费增长诊断