☰
手把手:给品牌做一次 12 个大模型的提及率基线测试
2026/10/1 9:58:00 网站建设 项目流程

更正(2026-09-30):① 原文写「我们给苏州一家电子元器件制造商……做过一轮」;现更正为:这一轮监测是这家制造商自己跑的,我们只提供工具。② 原文(含摘要)写 2026-06-21 至 07-10、344 条监测问题、525 次有效实测;现更正为 2026-06-30 至 07-10(11 天窗口)、43 条监测问题、524 次有效实测。③ 原文写综合提及率 50%(下文「50% 这个均值」同此);现更正为 49.2%(258/524,只算这家厂商的国内品牌;524 次里有 22 次回答不完整,正文不足 100 字,其中豆包 13 次,一律按未提及计入)。④ 原文分引擎表与下文写通义千问 85%、Claude 74%、文心一言 67%、豆包 41%、ChatGPT 17%、DeepSeek 12%、Gemini 4%;现更正为 87%、70%、68%、39%、15%、11%、2%(同一口径,其余 3 格不变)。⑤ 原文写「厂家推荐」类命中 54%–75%;现更正为 52.7%(238/452)。⑥ 原文写「选型知识」类 19 问只命中 1 次(5%);现更正为:实测最多的一道选型题跑了 19 次,只被提到 1 次。⑦ 原文写新榜「对 47.4 万篇次豆包引用的实证」、「唯一显著的变量是标题与提问意图的匹配度(0.23)」;现更正为:47.4 万篇次是新榜累计采集的信源(其中豆包引用 17.6 万篇次),0.23 是已被豆包引用的今日头条文章里相关性相对最高的一项,新榜原文称这只是弱相关。

用户在豆包里问「网络变压器厂家推荐」,AI 的回答就是你的新首页——但多数品牌从没实测过 AI 到底怎么答。规模摆在那里:CNNIC 第 57 次报告(2026-02)显示,国内生成式 AI 用户已达 6.02 亿,普及率 42.8%,年增 141.7%;知乎研究院白皮书(经中新网报道)的数字更直接——81% 的消费者会部分采纳 AI 建议完成购买。

所谓提及率基线测试,就是在固定时间窗内、用固定问题集对多个 AI 引擎实测品牌被提及情况,得到一组可对比、可复测的基准数据。这篇给一套可复现的流程:问题集设计、记录表结构、执行规范、指标计算。全程可手工执行,文末算一笔自动化的账。

一、确定测试矩阵:12 个引擎

国内 8 个:豆包、DeepSeek、Kimi、通义千问、文心一言、腾讯混元、智谱清言、阶跃星辰。海外 4 个:ChatGPT、Claude、Gemini、Perplexity。

优先级按真实流量排。QuestMobile 2026Q1:AI 原生 App 月活合计 4.46 亿,豆包 3.45 亿、通义千问 1.66 亿、DeepSeek 1.27 亿。资源有限就按月活从高到低保覆盖:豆包、通义千问、DeepSeek——用户在哪,测试就在哪。

二、设计问题集:三类问题,别只测一类

  • A 类·品牌直查:「XX 公司怎么样」「XX 的产品质量如何」。测的是 AI 对品牌的基础认知。
  • B 类·厂家推荐:「国内网络变压器厂家推荐」「RJ45 连接器供应商哪家靠谱」。测竞争位次,是转化最近的一类。
  • C 类·选型知识:「网络变压器怎么选」「千兆网口该用什么规格」。测内容渗透——用户决策前一定会问,答案里引没引你的内容,差别巨大。

问题来源:客服与销售的问题日志、搜索词报告、竞品官网 FAQ。每类不少于 15 问,总量 40 问起步。

措辞按真实用户口吻写,别堆关键词。新榜 2026 年 5 月发布的一项抽样研究(165 个提问词,累计采集信源 47.4 万篇次,其中豆包引用 17.6 万篇次)发现:在已被豆包引用的今日头条文章里,引用次数与账号粉丝数的相关性近乎为零;相关性相对最高的是标题与提问关键词、意图是否对得上(系数 0.23),但新榜原文也说这只是弱相关——AI 匹配的是意图,不是名气。测试问题越贴近真实提问,测出的基线才越接近真实场景。

三、记录表:一行一个观测点

建一张 CSV,字段如下:

test_date,engine,question_id,category,mentioned,cited,position,competitors,notes 2026-07-01,doubao,B-03,厂家推荐,1,0,2,"品牌X;品牌Y",列表第2位 2026-07-01,deepseek,B-03,厂家推荐,0,0,-,"品牌X;品牌Z",推荐竞品、本品牌缺席

判定规则要提前写死,否则多人执行口径会漂:

  • mentioned:回答正文出现品牌全称、常用简称或产品线名记 1;仅出现在引用链接里不算。
  • cited:引用来源指向品牌自有域名记 1。提及和引用是两件事,必须分开记。
  • position:出现在推荐列表第几位。
  • 无效样本:拒答、超时、明显答非所问——剔出分母,单独标注,不许静默丢弃。
  • 每次回答全文存档(截图或文本)。后续做内容优化,靠的是回读原文,不是看分数。

四、执行规范:控制变量

  1. 每个问题新开会话,避免上下文污染。
  2. 保持日常登录态、记录是否开启联网检索——这才是真实用户看到的版本。
  3. 同一问题至少跑 3 轮(建议连续 3 天各一次)。大模型输出非确定性,联网检索结果也每天在变,单次抽测没有统计意义。
  4. 固定时段执行,记全日期与引擎版本。

五、指标计算

  • 综合提及率 = Σmentioned ÷ 有效实测次数
  • 分引擎提及率、分类别提及率,以及最有信息量的引擎 × 类别交叉表
  • 竞品声量:聚合competitors字段,看谁在替你回答

六、一份真实基线长什么样

苏州一家电子元器件制造商(网络变压器 / RJ45 连接器)自己用监测工具跑过一轮:2026-06-30 至 07-10(11 天窗口),43 条监测问题、524 次有效实测,综合提及率 49.2%(258/524,只算这家厂商的国内品牌;单一厂商读数,非行业代表性抽样)。分引擎:

引擎提及率引擎提及率
通义千问87%Kimi53%
腾讯混元83%豆包39%
Claude70%ChatGPT15%
文心一言68%DeepSeek11%
智谱清言63%Gemini2%

49.2% 这个均值没什么用,交叉之后才见真相:「厂家推荐」类命中 52.7%(238/452),「选型知识」类实测最多的一道题跑了 19 次,只被提到 1 次——AI 正在用别人的内容教育它的客户。DeepSeek 在同类问题里点名推荐了其他品牌,该品牌缺席;而豆包(提及率 39%)恰是月活最大的 AI 原生 App(3.45 亿),DeepSeek(11%)月活也有 1.27 亿(QuestMobile 2026Q1)——短板正好砸在用户最多的入口上。这就是基线测试的价值:告诉你短板具体在哪个引擎、哪类问题。

七、手工与自动化的成本账

12 引擎 × 40 问 × 3 轮 = 1440 次对话,按每次含记录 2 分钟算,约 48 小时。基线测一次,手工可行;按日追踪就不现实了。我们后来把这套流程做成了桌面应用:自定义问题集、按日自动实测、Visibility Score 打分、竞品声量对比、引用来源追溯,逻辑与本文一致,只是把 1440 次对话交给机器。

利益相关:上面这款桌面应用为作者所在团队的产品。方法本身是开放的,手工执行同样成立。

本文数据来自作者所属公司自建 GEO 监测工具的生产环境实测,文字由 AI 辅助创作、作者审校发布。

需要专业的网站建设服务?

联系我们获取免费的网站建设咨询和方案报价,让我们帮助您实现业务目标

立即咨询