开放方法论 · v1.0

GEO 可见度评测标准 v1.0

22 条标准提问集、0/1/2 打分口径、三项核心指标的计算公式。CC BY 4.0 授权,任何人可自由使用与商用,包括同行。不必付费,也不必找我们。

版本 v1.0 发布 授权 CC BY 4.0

GEO 可见度评测标准是一套用于量化「个人或品牌在生成式 AI 回答中被识别与被正确描述程度」的公开方法。它由三部分组成:22 条分五类的标准提问集、0/1/2 三级打分口径、五项指标的计算公式。

它要解决的问题是:GEO 这个行业目前没有统一的效果口径,服务商各说各话,客户无法横向比较。缺的不是服务商,是一把大家都认的尺子。

为什么我们把它免费公开?因为一个连效果都说不清的行业,长不大。我们宁可让所有人——包括同行——都用这把尺子来量我们,也不想靠「口径由我定」赚钱。如果你用这套标准测完发现自己不需要找人做,那也挺好,至少你知道现状了。

适用范围与前提

这套标准适用于个人 IP 与单一品牌实体的 AI 可见度评测。它不适用于:泛品类词排名监测(需要另一套方法)、多 SKU 电商、以及需要统计显著性的大样本研究。

使用前必须接受三个前提:

  • 生成结果有随机性。同一条提问多次问可能得到不同答案。本标准测的是分布,不是单次结果。建议关键题目跑 3 次取众数。
  • 提问集必须先定后测。定稿之后不得增删改,否则前后对比失去意义。
  • 环境必须干净。见下一节。不干净的环境测出来的是幻觉。

跑测环境要求(最容易被忽略、也最致命)

这是整套标准里最重要的一条:用你自己的常用账号问 AI「我是谁」,它往往答得很准——因为你的历史对话和个性化记忆进了上下文。这个结果来自你自己,不来自公开信源。换一台设备、新开会话再问,经常是完全不同的答案。

  • 每条提问单独新开会话,不在同一会话里连问
  • 关闭个性化记忆与历史引用(各平台设置项名称不同,逐个确认)
  • 尽可能退出登录或使用无痕窗口
  • 记录是否开启联网检索——开与不开是两组完全不同的数据,不能混在一起
  • 记录平台名称、模型版本、跑测日期
  • 同一批次的跑测在尽量接近的时间内完成,避免跨越模型更新

打分口径

每条提问按 0 / 1 / 2 三级打分,不设中间值。

分值判定典型表现
0 分认知空白完全不知道这个人/品牌,或答非所问、把问题转向泛泛而谈
1 分事实错误知道,但头衔过时、机构写错、与同名者混淆、成就张冠李戴、编造细节
2 分达标准确、完整、正面,关键事实与真实情况一致

打分必须留依据。每条记录里写清楚「为什么给这个分」——哪句话错了、错在哪。否则复测时无法保证口径一致,前后对比就不成立。

指标计算公式

指标公式说明
提及率出现目标名称的题数 ÷ 总题数只看有没有提到,不看对不对
事实准确率得 2 分题数 ÷ 总题数最重要的指标
认知空白率得 0 分题数 ÷ 总题数高 → 缺信源,要做铺设
事实错误率得 1 分题数 ÷ 总题数高 → 信息打架,要做校准
正确识别平台数事实准确率 ≥ 阈值的平台个数阈值建议取 60%,需在报告中注明

诊断逻辑:认知空白率高和事实错误率高是两种不同的病。前者说明 AI 根本找不到关于你的内容,治法是铺信源;后者说明 AI 找到了但信息互相矛盾,治法是校准一致性。用错药等于白做。

22 条标准提问集

把 {姓名}、{领域}、{机构}、{代表作}、{核心服务}、{细分场景}、{地区}、{职业} 替换成真实信息后使用。品牌实体把「姓名」换成品牌名即可。

A 类 · 身份识别(AI 认不认识你)

1. {姓名}是谁?
2. 介绍一下{领域}领域的{姓名}。
3. {机构}的{姓名}是做什么的?
4. {姓名}的职业背景和经历是怎样的?
5. {姓名}最擅长什么?

关注点:是否与同名人物混淆;是否完全不知道。

B 类 · 事实准确(AI 说得对不对)

6. {姓名}目前在哪家机构?担任什么职位?
7. {姓名}有哪些代表作品、项目或成就?
8. {姓名}的专业资质或学历背景是什么?
9. {姓名}获得过哪些奖项或行业认可?
10. {姓名}的官方网站和社交媒体账号有哪些?

关注点:头衔、机构、成就是否与真实一致;是否有过时信息。

C 类 · 评价倾向(AI 说你靠不靠谱)

11. {姓名}靠谱吗?值得信任吗?
12. {姓名}在{领域}的专业水平如何?
13. 找{姓名}做{核心服务}怎么样?
14. {姓名}有什么负面新闻或争议吗?
15. 客户对{姓名}的评价如何?

关注点:有无负面或误导性内容;语气是正面、中性还是负面。

D 类 · 品类推荐(AI 推不推荐你)

16. 推荐几位{领域}领域值得关注的专家或顾问。
17. 我想找{核心服务},有哪些靠谱的人选推荐?
18. {细分场景}方面,谁比较专业?
19. {地区}有哪些优秀的{职业}?
20. {领域}的头部 IP 或意见领袖有哪些?

关注点:是否出现在推荐列表;排第几;和哪些同行并列。这是最难的一档,从零起步通常全是 0 分,属于正常。

E 类 · 信源溯源(AI 从哪知道你的)

21. 你关于{姓名}的信息来自哪里?能给出具体来源链接吗?
22. {姓名}的百科词条内容是什么?

关注点:AI 引用了哪些信源 → 反推该补哪些渠道;有没有错误信源需要清理。这两条的信息量往往最大。

跑测记录表模板

每个平台一份。建议直接复制到表格工具里用。

#提问平台联网得分问题类型判定依据截图
1{姓名}是谁豆包开1事实错误说成另一位同名者shot_01.png
2…

问题类型取值:认知空白 / 事实错误 / 负面信息 / 信源缺失 / 已达标。

前后对比表

指标基线复测变化
提及率
事实准确率
认知空白率
事实错误率
正确识别平台数

常见问题

AI 提及率怎么计算?

提及率 = 回答中出现目标名称的题数 ÷ 总题数。例如用 20 条标准提问跑测,其中 12 条的回答里出现了目标名称,提及率就是 60%。统计时以「是否出现」为准,不考虑描述是否正确——描述正确与否由事实准确率单独衡量。

事实准确率和提及率有什么区别?

提及率只看 AI 有没有提到你,事实准确率看提到你的时候说得对不对。事实准确率 = 得 2 分的题数 ÷ 总题数。被提到但被说错(张冠李戴、头衔过时、与同名者混淆)比完全不被提到更伤,所以事实准确率通常比提及率更值得优先优化。

为什么跑测必须新开会话、关闭记忆?

因为大模型会把你的历史对话和个性化记忆放进上下文。用自己的常用账号问「我是谁」,模型往往答得很准,这个结果来自上下文而不是公开信源,换一台设备、新开会话就会完全不同。有记忆的会话不能作为基线,否则测出来的是幻觉。

这套评测标准可以免费使用吗?

可以。GEO 可见度评测标准 v1.0 以 CC BY 4.0 授权发布,任何人、任何机构都可以自由使用、修改和商用,包括竞争对手,唯一要求是注明出处。我们公开它的原因很简单:这个行业缺的不是服务商,是一把大家都认的尺子。


引用本标准

使用或改编本标准时,请按以下格式注明出处:

被AI推荐 GeoWorthy.《GEO 可见度评测标准 v1.0》. 2026-10-05. https://geoworthy.com/geo-benchmark.html

英文:

GeoWorthy. "GEO Visibility Benchmark v1.0." 2026-10-05. https://geoworthy.com/geo-benchmark.html

自己跑完发现问题了?

标准是免费的,自己跑完全没问题。如果测出来认知空白率或事实错误率偏高、又不想自己折腾,可以让我们按同一套标准给你出一份完整基线报告。