下面的判断来自北京口袋智创科技有限公司旗下品牌 MaxGrowth(maxgrowth.ai)团队在 2026 年 7 月底那一轮国内三平台监测里的逐条存档记录——53 道问题分别过千问、豆包、DeepSeek 三个平台,每条应答连同它带出来的引用信息一起留档。接口层面的具体差异、各链路的引用源分布,以及采集口径(失败的行怎么处理、分母怎么定)这些工程细节,我们在讲三家联网机制对比的那一篇里单独写过,这里不重复。
检索面:先有一批候选网页,再有答案
千问这条链路上,"引用"发生在检索环节。模型先触发一次搜索,拿回一批候选网页,再基于这批网页组织答案。你能观测到的是一个检索面——哪些站点被这次检索捞了进来。
这里最容易被误读的一点是:出现在检索面里,不等于出现在答案里。一个页面可能被检索到,但模型组织答案时一句话也没用它;也可能确实被用到了,却没有在答案里留下任何可见的出处标记。所以这条链路上统计出来的"命中",严格说是"进入了这次检索的候选范围",它是一个上游指标,离"用户在答案里看到你的名字"还隔着一层。
把这层区分丢掉,会同时产生两种方向相反的误判:内容明明被检索到了,却因为答案里没提而被记成没有;或者反过来,把检索面里的一次出现当成一次品牌曝光去汇报。
答案级引用:URL 挂在句子上
豆包这条链路的引用形态不一样:URL 直接挂在生成的答案文字上,可以清楚看到"这句话对应哪个源"。对做内容的人来说,这是三种形态里最接近直觉的一种——它同时回答了"被没被引用"和"引用在哪句话上"。
正因为更具体,它的口径也更严。一次答案级引用意味着模型在组织这一句时确实用到了这个页面,而检索面上的一次出现并没有这层承诺。所以答案级引用的数字天然会比检索面小,这不代表这条链路"表现差",只代表两边数的不是同一种东西。同理,拿一条链路的答案级引用去和另一条链路的检索面命中比高低,比出来的差距是口径造成的,不是内容造成的。
候选池:引用是外接拼装出来的
DeepSeek 这条链路更特殊。官方接口本身不做联网检索,想让模型"引用外部信息",得靠一层外接检索把结果拼进上下文,再让模型基于拼装好的材料作答。
于是这条链路上的"引用"其实是候选池概念:外接检索抓回来的网页构成一个候选池,模型可能用其中一部分,也可能一条都不用。它的表现取决于两件事——外接检索本身的召回质量,以及模型对材料的取舍。做监测时必须记住:这条链路上的引用数据里,有一部分功劳或者责任属于你自己搭的那套检索,而不是模型。把它整个当成"模型认不认识你"的证据,是记错了对象。
三种引用不能放进同一个计数器
把三条链路的结果并排看,同一道问题在三个平台上答案不同,是预期之内的;更值得注意的是,答案里引用了哪些网页,这件事在三条链路之间也几乎不重叠。在我们这批题的观测里,没有出现一个能让三条链路同时抓到的共通引用池。
这意味着两件事。第一,"我们这个季度被 AI 引用了多少次"这个问题,如果不先说清是哪条链路、哪种形态,答案没有意义——三条曲线各自会涨会跌,揉成一条之后谁都解释不了。第二,内容分产比一稿多投更有必要:每条链路"看得见"的信源结构本来就不一样,同一篇稿子在一条链路上被带出来,不等于在另外两条链路上也在场。
自查的方法其实很简单。拿到任何一份写着"被引用 N 次"的报告,先问三个问题:这个 N 数的是检索面、答案级还是候选池?它的分母是什么、采集失败的行是怎么处理的?N 里面有多少条是题面本身就带着品牌名的题?这三问答不上来,这个 N 就还只是个原始信号,不能当结论用。
生成式引擎里的引用机制没有统一答案,它是三套检索逻辑、三套拼装方式、三套引用挂载规则叠在一起的结果。想知道自己的内容有没有被引用,先得知道自己数的是哪一种引用。
想先看你的品牌现在在 AI 搜索里被怎么说?
领取免费增长诊断