出品:MaxGrowth · GeoTrack 团队 | 采集日期:2026-07-26 | 口径:官方 API 联网通路,单轮采集(详见「方法与局限」) 可复核声明:本报告的结果数字全部来自随附的 stats.json(由 analyze.py 对原始数据重跑即可再生);题面数字(题数、品类、预算句式)来自 questions.json。原始数据为逐题 JSONL,含答案全文与来源清单。我们不发布无法复核的数字。

01

摘要:四个发现(均为本次样本观察,非普遍规律)

  1. 本次样本里,AI 几乎每题都点名了品牌。 90 次采集中 84 次(93%)给出明确品牌推荐;在给出推荐的回答里,判官平均抽取 5.3-5.9 个品牌(单条最多抽 10 个,90 条中 2 条触顶)。名单位置有限——你在不在里面,是一个正在发生的竞争。
  2. 三家引擎的推荐名单重合度低。 以「答案中最先出现的至多 3 个推荐品牌」为集合(经品牌别名归并;非引擎明示排名),两两对比:逐题平均 Jaccard 仅 0.25-0.39;双方均给出 ≥3 个品牌的题里,集合完全一致的只有 0-4 题,完全零重合的有 6-7 题(约四分之一)。三家都给出 ≥3 品牌的 22 题中,存在三家共同品牌的仅 13 题。只测一家引擎,得不出「AI 怎么看你」的结论。
  3. 来源生态分层明显:豆包的答案引用注释里,知乎为零。 千问检索结果里知乎系占 34.4%(99/288);DeepSeek 检索底座(博查)里知乎系占 27.0%(63/233);而豆包答案的 113 条引用注释(按题内 URL 去重)中,知乎一条都没有,它更多标注新浪系(32)与什么值得买(23)。同一份内容,在一家引擎是核心来源,在另一家可能根本不出现。
  4. 答案形态各有偏好。 豆包与 DeepSeek 更常给带序号的排名清单(13/30、15/30),千问只有 5/30;千问平均答案约 800 字,另两家约 1500-1600 字。
02

一、方法

  • 题库:30 题 = 10 个消费品类 × 3 种问型(推荐型「哪个牌子好」/ 决策型「怎么选」/ 场景型「预算 X 买什么」)。品类:蓝牙耳机、扫地机器人、家用咖啡机、行车记录仪、防晒霜、笔记本电脑、空气炸锅、跑步鞋、儿童安全座椅、电动牙刷。全部题面见附录 B 与 questions.json。
  • 引擎、通路与「来源」的统计单位(2026-07-26 单日真实调用,共 90 次全部成功;🔴 三家的「来源」是三种不同的东西,本报告全程分列,不做同单位对比): | 引擎 | 通路 | 来源统计单位 | |---|---|---| | 通义千问 | 阿里云百炼官方 API,联网检索开启(forced_search) | 联网检索结果(API 返回 search_results) | | 豆包 | 火山方舟官方 API(/responses + web_search 插件,快思考档) | 答案引用注释(url_citation,按题内 URL 去重) | | DeepSeek | DeepSeek 官方 API(deepseek-v4-flash)+ 博查搜索检索增强 | 外部 RAG 检索输入(博查样本;非 DeepSeek 自身标注) |
  • 品牌抽取:对 90 条回答用 LLM(temperature=0)抽取「被明确列为推荐对象的品牌」(按答案出现顺序,单条最多 10 个),忽略顺带提及与平台名;跨引擎对比前经别名表归并(如 Sony/索尼)。抽取质量做了脚本化随机抽检(seed=7,4 个样本,样本 ID 与核验结果在 stats.json 的 judge_spot_check 字段):抽取品牌全部能在回答原文中找到(含中英写法对应)。
  • 「前三」的含义:引擎多数回答不给明示排名,本报告的三品牌集合=判官按答案出现顺序取的前 3 个;两两对比只纳入双方均抽出 ≥3 个品牌的题。
  • 落盘:每条记录含答案全文(非摘要)、来源清单、采集时间;判分输入设最低长度门槛。
03

二、发现 1:本次样本里,品牌名单几乎每题都在被写出来

90 次采集中 84 次给出明确品牌推荐(千问 28/30、豆包 27/30、DeepSeek 29/30);未给推荐的 6 次多为「怎么选」类问题被处理成纯参数科普。给出推荐的回答里,判官平均抽取 5.3(千问)/5.4(豆包)/5.9(DeepSeek)个品牌。

对品牌方的含义:在本次覆盖的消费品类问题上,「AI 会不会点名品牌」已经不是悬念——它几乎每题都在点名。值得核验的问题是你的品牌在不在名单里、以什么描述出现;这需要按你自己的品类逐题实测,本报告的品类样本不能代替。

04

三、发现 2:每家引擎在写自己的名单

同一道题,三家引擎的「最先出现的至多 3 个推荐品牌」集合重合度低:

引擎对 可比题数(双方均 ≥3 品牌) 逐题平均 Jaccard 汇总(micro)Jaccard 集合完全一致 集合零重合
千问 ↔ 豆包 23 0.39 0.31 4 题 6 题
千问 ↔ DeepSeek 26 0.26 0.23 0 题 6 题
豆包 ↔ DeepSeek 23 0.25 0.21 1 题 7 题

三家引擎都抽出 ≥3 个品牌的 22 道题里,存在「三家共同出现的品牌」的仅 13 道。

对品牌方的含义很直接:「我们在 AI 里表现不错」这句话,必须写明是哪家 AI。 在一家引擎的答案里稳定露出,推不出在另一家也露出;监测要分引擎做,单引擎结论拿去汇报,大概率失真。

05

四、发现 3:来源生态分层——三家倚重的池子不同

三家引擎回答同一批问题时,各自「来源」(单位见方法节,不同单位,分列呈现)的生态构成差异悬殊:

通义千问(检索结果) 豆包(答案引用注释,去重) DeepSeek(博查检索输入)
来源总条数 288 113 233
知乎系 99(34.4%) 0 63(27.0%)
新浪系 51 32 6
什么值得买 21 23 24
京东站内页 12 0 4
去重域名数 49 48 96

几个值得注意的点(均为各引擎在自己那一列内部的构成;三列的来源单位不同,不能按原始条数横向比大小):

  • 知乎在各引擎自己的来源里占比差别极大: 在千问检索结果里占 34.4%、在博查检索底座里占 27.0%,都是各自的第一大内容社区;在豆包的答案引用注释里则一条未出现(0)。也就是说,同一个内容平台在不同引擎里的地位可以从「第一」到「缺席」。
  • 什么值得买是少数在三家来源里都出现的导购站点(千问检索结果、豆包答案引用注释、博查检索底座里都能看到)。这里只说「三处都出现」这个定性事实;三处单位不同,不宜按原始条数比谁多谁少。
  • 去重域名数(千问 49 / 豆包 48 / DeepSeek-博查 96)只作各引擎内部结构参考,不做「谁更长尾」的跨引擎排名——该指标同时受各自来源单位与总条数影响(三列总条数 288/113/233 本就不同),不能据此判断哪家底座更长尾。

对内容排产的启示(作为待验证假设,不是被证实的投放效果):在哪家引擎缺席,就先查那家引擎在你品类里实际展示的来源类型,把内容优先补到对应的池子——是否真的改变推荐结果,须投放前后按同题库复测对照。

06

五、发现 4:形态差异

  • 排名式回答占比:DeepSeek 15/30、豆包 13/30、千问 5/30。豆包和 DeepSeek 更常直接给「第一名第二名」,品牌进没进前排一目了然。
  • 来源覆盖(各按自家单位):千问 30/30 条均 9.6;DeepSeek(博查输入)30/30 条均 7.8;豆包 26/30、条均 3.8——豆包有 4 个回答未返回引用注释,多为「怎么选」类科普回答。单位不同,此处不做跨引擎「谁更透明」的排名。
  • 回答长度:千问平均约 800 字;豆包、DeepSeek 约 1500-1600 字。
07

六、对品牌方的三个动作含义

  1. 监测分引擎:把「AI 可见度」拆成逐引擎指标,分开记录提及、位置与来源;单引擎结论不外推。
  2. 内容分池(假设待验证):按各引擎在你品类里实际展示的来源分布排内容优先级;知乎侧供给主要对应千问/博查类底座的口径,豆包侧要看它实际标注的池子;效果须复测对照确认。
  3. 常态复测:本报告是单轮快照,AI 答案天然波动;结论要用固定题库周期复跑维护,变化(含回落)如实记录。
08

七、口径与局限(读数前必看)

  1. API 面 ≠ App 前台:本期走官方 API 联网通路,与手机 App 前台在检索策略、答案形态(如商品卡)上存在差异;App 前台口径的观察另见我们的实测研究。
  2. 单轮采集:每题每引擎只采一轮;数字用于呈现三引擎的结构性差异,不用于品牌间精确排名,也不能推出各引擎的日常普遍行为。
  3. 品类样本:10 个消费品类不代表全部行业;B2B、服务业、高客单低频品类可能不同。
  4. 三家「来源」单位不同(检索结果/答案引用注释/外部 RAG 输入),全文分列;DeepSeek 的来源反映博查检索底座,非其自身标注。
  5. 品牌抽取为 LLM 辅助:输出按出现顺序、上限 10 个(2 条触顶);已做输入卫生与脚本化抽检(全对),但个别品牌归并(如子品牌与母品牌)可能存在边界判断。
  6. 本报告不构成对任何品牌的评价或推荐;所列品牌名均为引擎回答中的客观出现。
09

附录 A:数据文件清单(随报告存档,逐条可复核)

文件 内容
questions.json 30 题题面(品类×问型;题面数字的来源)
results_qwen / results_doubao / results_deepseek .jsonl 逐题原始记录:答案全文、来源清单、采集时间
judged.jsonl 逐题品牌抽取结果
stats.json 全部结果统计量(analyze.py 重跑可再生;本报告结果数字的唯一来源)
collect.py / judge.py / analyze.py 采集、抽取、统计脚本(抽检含样本 ID 与 seed)
10

附录 B:30 题题面

蓝牙耳机:哪个牌子好(预算500)/ 降噪怎么选 / 学生党平价推荐;扫地机器人:哪个牌子好用 / 怎么选(扫拖一体)/ 3000元以内推荐;家用咖啡机:新手买哪种 / 全自动哪个牌子好 / 千元意式推荐;行车记录仪:哪个牌子靠谱 / 怎么选看什么参数 / 500元以内推荐;防晒霜:哪个牌子好用 / 油皮夏天用什么 / 敏感肌怎么选;笔记本电脑:大学生预算6000推荐 / 轻薄本哪个牌子好 / 办公用怎么选;空气炸锅:哪个牌子好 / 怎么选容量多大 / 300元左右推荐;跑步鞋:入门推荐什么牌子 / 缓震和支撑怎么挑 / 500元以内推荐;儿童安全座椅:哪个牌子安全 / 怎么选 / 2000元左右推荐;电动牙刷:哪个牌子好 / 声波式和旋转式哪种好 / 200元左右推荐。


MaxGrowth(maxgrowth.ai)为出海与国内品牌提供 AI 可见度监测与 GEO(生成式引擎优化)服务;GeoTrack 是我们的可见度监测系统。想知道你的品牌在这三家引擎的答案里处于什么位置,可以在官网领取免费增长诊断。

想知道你的品牌在自己的品类问题里排第几?

领取免费增长诊断