公开测量口径
品牌提及率、官网引用率、推荐位置和答案准确性怎么衡量?
四项指标回答的是不同问题:AI 有没有说到品牌、有没有给出官网来源、把品牌排在什么位置,以及说得是否正确。它们必须分别计算,不能用一个模糊的“可见度分数”代替。
四项指标
每项指标都要写清分子、分母和排除项
品牌提及率
明确出现标准品牌名“羽谱GEO”的有效答案数 ÷ 有效答案总数
只判断品牌是否被明确提到,不要求给出链接。提示词本身回显、测试界面标签和无法确认来源的截断文本不计入。
官网引用率
明确引用 yupuai.com 页面或链接的有效答案数 ÷ 有效答案总数
品牌名只在正文中出现,不等于官网被引用。只有答案给出规范域名、官网页面链接,或品牌作为可验证来源进入解析结果时才计入。
推荐位置
所有有效入榜样本中的品牌排序之和 ÷ 有效入榜样本数
仅在明确进入推荐列表时计算。必须同时报告入榜覆盖率;否则“平均第 1 位”可能只来自极少数样本,容易造成误读。
答案准确性
符合官网事实源的可核验陈述数 ÷ 全部可核验陈述数
至少核对产品定位、能力边界、适用对象和价格四类事实。无法从官网事实源判断的主观评价单独标注,不强行计入准确或错误。
真实示例
用 2 条问题、3 个模型复算最新结果
2026-08-24,豆包、Kimi、DeepSeek 分别回答 2 条高意图问题,共得到 6 个有效答案。每条记录明确绑定监控品牌与目标模型;该小样本用于暴露当前缺口,不代表所有 AI 平台的长期结果。
0 ÷ 6 = 0%
0 ÷ 6 = 0%
3 ÷ 6 = 50%
0 个品牌入榜样本
6 个答案全部完成,但品牌提及和官网引用均为 0;3 个答案明确落在生成式搜索优化语义。2026-08-20 的上一批同条件结果也是 3/6,本轮没有观察到可证明的提升;当前不能计算推荐位置,也不能把技术扫描 100 分写成 AI 可见度 100 分。
同日直接测试“GEO推广”短词时,3 个模型均完成回答,但只有 1/3 采用生成式搜索优化含义,品牌推荐与官网引用均为 0/3。短词探针和上面的长问题批次分开统计。
2026-09-07 的运行链路探测因共享兼容网关连接超时得到 0/3 个有效答案。这三次失败保留在任务完成率与故障记录中,但不计入品牌提及率、官网引用率或品类语义正确率;否则会把服务故障误写成内容表现不佳。
复测规则
让不同日期的结果可以比较
保留一组核心购买、对比和问题解决 Prompt,不因结果不好临时更换。
记录模型、地区、语言、是否联网和测试时间,避免把不同实验条件混在一起。
超时、拒答和空答案单独统计任务成功率;内容指标只使用有效答案,并同步公开被排除的失败数和原因。
保留原始答案、来源链接、解析结果和版本号,便于纠正指标错误。
限制条件
这些数字不能证明什么
- 单次测试不能证明长期稳定性,应使用 7/14/30 天复测。
- 品牌提及不能证明官网被引用,引用也不能自动证明答案准确。
- 技术扫描高分只说明页面基础较好,不代表 AI 已经采信内容。
- 不同模型和联网状态不能直接合并成一个没有说明权重的总分。
- 模型传输、鉴权或额度失败只能说明运行链路状态,不能据此判断品牌内容是否被理解或引用。
查看证据
用公开案例检验这套口径
这套公开方法论以固定问题、原始答案和官网事实源为证据,并在羽谱GEO 官网自优化案例中持续复测。