出品:MaxGrowth · GeoTrack 团队 | 采集日期:2026-07-26 | 口径:官方 API 联网通路,单轮采集(详见「方法与局限」) 可复核声明:本报告的结果数字全部来自随附的
stats.json(由analyze.py对原始数据重跑即可再生);题面数字(题数、品类、预算句式)来自questions.json。原始数据为逐题 JSONL,含答案全文与来源清单。我们不发布无法复核的数字。
摘要:四个发现(均为本次样本观察,非普遍规律)
- 本次样本里,AI 几乎每题都点名了品牌。 90 次采集中 84 次(93%)给出明确品牌推荐;在给出推荐的回答里,判官平均抽取 5.3-5.9 个品牌(单条最多抽 10 个,90 条中 2 条触顶)。名单位置有限——你在不在里面,是一个正在发生的竞争。
- 三家引擎的推荐名单重合度低。 以「答案中最先出现的至多 3 个推荐品牌」为集合(经品牌别名归并;非引擎明示排名),两两对比:逐题平均 Jaccard 仅 0.25-0.39;双方均给出 ≥3 个品牌的题里,集合完全一致的只有 0-4 题,完全零重合的有 6-7 题(约四分之一)。三家都给出 ≥3 品牌的 22 题中,存在三家共同品牌的仅 13 题。只测一家引擎,得不出「AI 怎么看你」的结论。
- 来源生态分层明显:豆包的答案引用注释里,知乎为零。 千问检索结果里知乎系占 34.4%(99/288);DeepSeek 检索底座(博查)里知乎系占 27.0%(63/233);而豆包答案的 113 条引用注释(按题内 URL 去重)中,知乎一条都没有,它更多标注新浪系(32)与什么值得买(23)。同一份内容,在一家引擎是核心来源,在另一家可能根本不出现。
- 答案形态各有偏好。 豆包与 DeepSeek 更常给带序号的排名清单(13/30、15/30),千问只有 5/30;千问平均答案约 800 字,另两家约 1500-1600 字。
一、方法
- 题库:30 题 = 10 个消费品类 × 3 种问型(推荐型「哪个牌子好」/ 决策型「怎么选」/ 场景型「预算 X 买什么」)。品类:蓝牙耳机、扫地机器人、家用咖啡机、行车记录仪、防晒霜、笔记本电脑、空气炸锅、跑步鞋、儿童安全座椅、电动牙刷。全部题面见附录 B 与 questions.json。
- 引擎、通路与「来源」的统计单位(2026-07-26 单日真实调用,共 90 次全部成功;🔴 三家的「来源」是三种不同的东西,本报告全程分列,不做同单位对比): | 引擎 | 通路 | 来源统计单位 | |---|---|---| | 通义千问 | 阿里云百炼官方 API,联网检索开启(forced_search) | 联网检索结果(API 返回 search_results) | | 豆包 | 火山方舟官方 API(/responses + web_search 插件,快思考档) | 答案引用注释(url_citation,按题内 URL 去重) | | DeepSeek | DeepSeek 官方 API(deepseek-v4-flash)+ 博查搜索检索增强 | 外部 RAG 检索输入(博查样本;非 DeepSeek 自身标注) |
- 品牌抽取:对 90 条回答用 LLM(temperature=0)抽取「被明确列为推荐对象的品牌」(按答案出现顺序,单条最多 10 个),忽略顺带提及与平台名;跨引擎对比前经别名表归并(如 Sony/索尼)。抽取质量做了脚本化随机抽检(seed=7,4 个样本,样本 ID 与核验结果在 stats.json 的 judge_spot_check 字段):抽取品牌全部能在回答原文中找到(含中英写法对应)。
- 「前三」的含义:引擎多数回答不给明示排名,本报告的三品牌集合=判官按答案出现顺序取的前 3 个;两两对比只纳入双方均抽出 ≥3 个品牌的题。
- 落盘:每条记录含答案全文(非摘要)、来源清单、采集时间;判分输入设最低长度门槛。
二、发现 1:本次样本里,品牌名单几乎每题都在被写出来
90 次采集中 84 次给出明确品牌推荐(千问 28/30、豆包 27/30、DeepSeek 29/30);未给推荐的 6 次多为「怎么选」类问题被处理成纯参数科普。给出推荐的回答里,判官平均抽取 5.3(千问)/5.4(豆包)/5.9(DeepSeek)个品牌。
对品牌方的含义:在本次覆盖的消费品类问题上,「AI 会不会点名品牌」已经不是悬念——它几乎每题都在点名。值得核验的问题是你的品牌在不在名单里、以什么描述出现;这需要按你自己的品类逐题实测,本报告的品类样本不能代替。
三、发现 2:每家引擎在写自己的名单
同一道题,三家引擎的「最先出现的至多 3 个推荐品牌」集合重合度低:
| 引擎对 | 可比题数(双方均 ≥3 品牌) | 逐题平均 Jaccard | 汇总(micro)Jaccard | 集合完全一致 | 集合零重合 |
|---|---|---|---|---|---|
| 千问 ↔ 豆包 | 23 | 0.39 | 0.31 | 4 题 | 6 题 |
| 千问 ↔ DeepSeek | 26 | 0.26 | 0.23 | 0 题 | 6 题 |
| 豆包 ↔ DeepSeek | 23 | 0.25 | 0.21 | 1 题 | 7 题 |
三家引擎都抽出 ≥3 个品牌的 22 道题里,存在「三家共同出现的品牌」的仅 13 道。
对品牌方的含义很直接:「我们在 AI 里表现不错」这句话,必须写明是哪家 AI。 在一家引擎的答案里稳定露出,推不出在另一家也露出;监测要分引擎做,单引擎结论拿去汇报,大概率失真。
四、发现 3:来源生态分层——三家倚重的池子不同
三家引擎回答同一批问题时,各自「来源」(单位见方法节,不同单位,分列呈现)的生态构成差异悬殊:
| 通义千问(检索结果) | 豆包(答案引用注释,去重) | DeepSeek(博查检索输入) | |
|---|---|---|---|
| 来源总条数 | 288 | 113 | 233 |
| 知乎系 | 99(34.4%) | 0 | 63(27.0%) |
| 新浪系 | 51 | 32 | 6 |
| 什么值得买 | 21 | 23 | 24 |
| 京东站内页 | 12 | 0 | 4 |
| 去重域名数 | 49 | 48 | 96 |
几个值得注意的点(均为各引擎在自己那一列内部的构成;三列的来源单位不同,不能按原始条数横向比大小):
- 知乎在各引擎自己的来源里占比差别极大: 在千问检索结果里占 34.4%、在博查检索底座里占 27.0%,都是各自的第一大内容社区;在豆包的答案引用注释里则一条未出现(0)。也就是说,同一个内容平台在不同引擎里的地位可以从「第一」到「缺席」。
- 什么值得买是少数在三家来源里都出现的导购站点(千问检索结果、豆包答案引用注释、博查检索底座里都能看到)。这里只说「三处都出现」这个定性事实;三处单位不同,不宜按原始条数比谁多谁少。
- 去重域名数(千问 49 / 豆包 48 / DeepSeek-博查 96)只作各引擎内部结构参考,不做「谁更长尾」的跨引擎排名——该指标同时受各自来源单位与总条数影响(三列总条数 288/113/233 本就不同),不能据此判断哪家底座更长尾。
对内容排产的启示(作为待验证假设,不是被证实的投放效果):在哪家引擎缺席,就先查那家引擎在你品类里实际展示的来源类型,把内容优先补到对应的池子——是否真的改变推荐结果,须投放前后按同题库复测对照。
五、发现 4:形态差异
- 排名式回答占比:DeepSeek 15/30、豆包 13/30、千问 5/30。豆包和 DeepSeek 更常直接给「第一名第二名」,品牌进没进前排一目了然。
- 来源覆盖(各按自家单位):千问 30/30 条均 9.6;DeepSeek(博查输入)30/30 条均 7.8;豆包 26/30、条均 3.8——豆包有 4 个回答未返回引用注释,多为「怎么选」类科普回答。单位不同,此处不做跨引擎「谁更透明」的排名。
- 回答长度:千问平均约 800 字;豆包、DeepSeek 约 1500-1600 字。
六、对品牌方的三个动作含义
- 监测分引擎:把「AI 可见度」拆成逐引擎指标,分开记录提及、位置与来源;单引擎结论不外推。
- 内容分池(假设待验证):按各引擎在你品类里实际展示的来源分布排内容优先级;知乎侧供给主要对应千问/博查类底座的口径,豆包侧要看它实际标注的池子;效果须复测对照确认。
- 常态复测:本报告是单轮快照,AI 答案天然波动;结论要用固定题库周期复跑维护,变化(含回落)如实记录。
七、口径与局限(读数前必看)
- API 面 ≠ App 前台:本期走官方 API 联网通路,与手机 App 前台在检索策略、答案形态(如商品卡)上存在差异;App 前台口径的观察另见我们的实测研究。
- 单轮采集:每题每引擎只采一轮;数字用于呈现三引擎的结构性差异,不用于品牌间精确排名,也不能推出各引擎的日常普遍行为。
- 品类样本:10 个消费品类不代表全部行业;B2B、服务业、高客单低频品类可能不同。
- 三家「来源」单位不同(检索结果/答案引用注释/外部 RAG 输入),全文分列;DeepSeek 的来源反映博查检索底座,非其自身标注。
- 品牌抽取为 LLM 辅助:输出按出现顺序、上限 10 个(2 条触顶);已做输入卫生与脚本化抽检(全对),但个别品牌归并(如子品牌与母品牌)可能存在边界判断。
- 本报告不构成对任何品牌的评价或推荐;所列品牌名均为引擎回答中的客观出现。
附录 A:数据文件清单(随报告存档,逐条可复核)
| 文件 | 内容 |
|---|---|
| questions.json | 30 题题面(品类×问型;题面数字的来源) |
| results_qwen / results_doubao / results_deepseek .jsonl | 逐题原始记录:答案全文、来源清单、采集时间 |
| judged.jsonl | 逐题品牌抽取结果 |
| stats.json | 全部结果统计量(analyze.py 重跑可再生;本报告结果数字的唯一来源) |
| collect.py / judge.py / analyze.py | 采集、抽取、统计脚本(抽检含样本 ID 与 seed) |
附录 B:30 题题面
蓝牙耳机:哪个牌子好(预算500)/ 降噪怎么选 / 学生党平价推荐;扫地机器人:哪个牌子好用 / 怎么选(扫拖一体)/ 3000元以内推荐;家用咖啡机:新手买哪种 / 全自动哪个牌子好 / 千元意式推荐;行车记录仪:哪个牌子靠谱 / 怎么选看什么参数 / 500元以内推荐;防晒霜:哪个牌子好用 / 油皮夏天用什么 / 敏感肌怎么选;笔记本电脑:大学生预算6000推荐 / 轻薄本哪个牌子好 / 办公用怎么选;空气炸锅:哪个牌子好 / 怎么选容量多大 / 300元左右推荐;跑步鞋:入门推荐什么牌子 / 缓震和支撑怎么挑 / 500元以内推荐;儿童安全座椅:哪个牌子安全 / 怎么选 / 2000元左右推荐;电动牙刷:哪个牌子好 / 声波式和旋转式哪种好 / 200元左右推荐。
MaxGrowth(maxgrowth.ai)为出海与国内品牌提供 AI 可见度监测与 GEO(生成式引擎优化)服务;GeoTrack 是我们的可见度监测系统。想知道你的品牌在这三家引擎的答案里处于什么位置,可以在官网领取免费增长诊断。
想知道你的品牌在自己的品类问题里排第几?
领取免费增长诊断