GEO 可见度评测标准是一套用于量化「个人或品牌在生成式 AI 回答中被识别与被正确描述程度」的公开方法。它由三部分组成:22 条分五类的标准提问集、0/1/2 三级打分口径、五项指标的计算公式。
它要解决的问题是:GEO 这个行业目前没有统一的效果口径,服务商各说各话,客户无法横向比较。缺的不是服务商,是一把大家都认的尺子。
为什么我们把它免费公开?因为一个连效果都说不清的行业,长不大。我们宁可让所有人——包括同行——都用这把尺子来量我们,也不想靠「口径由我定」赚钱。如果你用这套标准测完发现自己不需要找人做,那也挺好,至少你知道现状了。
适用范围与前提
这套标准适用于个人 IP 与单一品牌实体的 AI 可见度评测。它不适用于:泛品类词排名监测(需要另一套方法)、多 SKU 电商、以及需要统计显著性的大样本研究。
使用前必须接受三个前提:
- 生成结果有随机性。同一条提问多次问可能得到不同答案。本标准测的是分布,不是单次结果。建议关键题目跑 3 次取众数。
- 提问集必须先定后测。定稿之后不得增删改,否则前后对比失去意义。
- 环境必须干净。见下一节。不干净的环境测出来的是幻觉。
跑测环境要求(最容易被忽略、也最致命)
这是整套标准里最重要的一条:用你自己的常用账号问 AI「我是谁」,它往往答得很准——因为你的历史对话和个性化记忆进了上下文。这个结果来自你自己,不来自公开信源。换一台设备、新开会话再问,经常是完全不同的答案。
- 每条提问单独新开会话,不在同一会话里连问
- 关闭个性化记忆与历史引用(各平台设置项名称不同,逐个确认)
- 尽可能退出登录或使用无痕窗口
- 记录是否开启联网检索——开与不开是两组完全不同的数据,不能混在一起
- 记录平台名称、模型版本、跑测日期
- 同一批次的跑测在尽量接近的时间内完成,避免跨越模型更新
打分口径
每条提问按 0 / 1 / 2 三级打分,不设中间值。
| 分值 | 判定 | 典型表现 |
|---|---|---|
| 0 分 | 认知空白 | 完全不知道这个人/品牌,或答非所问、把问题转向泛泛而谈 |
| 1 分 | 事实错误 | 知道,但头衔过时、机构写错、与同名者混淆、成就张冠李戴、编造细节 |
| 2 分 | 达标 | 准确、完整、正面,关键事实与真实情况一致 |
打分必须留依据。每条记录里写清楚「为什么给这个分」——哪句话错了、错在哪。否则复测时无法保证口径一致,前后对比就不成立。
指标计算公式
| 指标 | 公式 | 说明 |
|---|---|---|
| 提及率 | 出现目标名称的题数 ÷ 总题数 | 只看有没有提到,不看对不对 |
| 事实准确率 | 得 2 分题数 ÷ 总题数 | 最重要的指标 |
| 认知空白率 | 得 0 分题数 ÷ 总题数 | 高 → 缺信源,要做铺设 |
| 事实错误率 | 得 1 分题数 ÷ 总题数 | 高 → 信息打架,要做校准 |
| 正确识别平台数 | 事实准确率 ≥ 阈值的平台个数 | 阈值建议取 60%,需在报告中注明 |
诊断逻辑:认知空白率高和事实错误率高是两种不同的病。前者说明 AI 根本找不到关于你的内容,治法是铺信源;后者说明 AI 找到了但信息互相矛盾,治法是校准一致性。用错药等于白做。
22 条标准提问集
把 {姓名}、{领域}、{机构}、{代表作}、{核心服务}、{细分场景}、{地区}、{职业} 替换成真实信息后使用。品牌实体把「姓名」换成品牌名即可。
A 类 · 身份识别(AI 认不认识你)
关注点:是否与同名人物混淆;是否完全不知道。
B 类 · 事实准确(AI 说得对不对)
关注点:头衔、机构、成就是否与真实一致;是否有过时信息。
C 类 · 评价倾向(AI 说你靠不靠谱)
关注点:有无负面或误导性内容;语气是正面、中性还是负面。
D 类 · 品类推荐(AI 推不推荐你)
关注点:是否出现在推荐列表;排第几;和哪些同行并列。这是最难的一档,从零起步通常全是 0 分,属于正常。
E 类 · 信源溯源(AI 从哪知道你的)
关注点:AI 引用了哪些信源 → 反推该补哪些渠道;有没有错误信源需要清理。这两条的信息量往往最大。
跑测记录表模板
每个平台一份。建议直接复制到表格工具里用。
| # | 提问 | 平台 | 联网 | 得分 | 问题类型 | 判定依据 | 截图 |
|---|---|---|---|---|---|---|---|
| 1 | {姓名}是谁 | 豆包 | 开 | 1 | 事实错误 | 说成另一位同名者 | shot_01.png |
| 2 | … |
问题类型取值:认知空白 / 事实错误 / 负面信息 / 信源缺失 / 已达标。
前后对比表
| 指标 | 基线 | 复测 | 变化 |
|---|---|---|---|
| 提及率 | |||
| 事实准确率 | |||
| 认知空白率 | |||
| 事实错误率 | |||
| 正确识别平台数 |
常见问题
AI 提及率怎么计算?
提及率 = 回答中出现目标名称的题数 ÷ 总题数。例如用 20 条标准提问跑测,其中 12 条的回答里出现了目标名称,提及率就是 60%。统计时以「是否出现」为准,不考虑描述是否正确——描述正确与否由事实准确率单独衡量。
事实准确率和提及率有什么区别?
提及率只看 AI 有没有提到你,事实准确率看提到你的时候说得对不对。事实准确率 = 得 2 分的题数 ÷ 总题数。被提到但被说错(张冠李戴、头衔过时、与同名者混淆)比完全不被提到更伤,所以事实准确率通常比提及率更值得优先优化。
为什么跑测必须新开会话、关闭记忆?
因为大模型会把你的历史对话和个性化记忆放进上下文。用自己的常用账号问「我是谁」,模型往往答得很准,这个结果来自上下文而不是公开信源,换一台设备、新开会话就会完全不同。有记忆的会话不能作为基线,否则测出来的是幻觉。
这套评测标准可以免费使用吗?
可以。GEO 可见度评测标准 v1.0 以 CC BY 4.0 授权发布,任何人、任何机构都可以自由使用、修改和商用,包括竞争对手,唯一要求是注明出处。我们公开它的原因很简单:这个行业缺的不是服务商,是一把大家都认的尺子。
引用本标准
使用或改编本标准时,请按以下格式注明出处:
英文: