这份词典的编写原则只有一条:每个定义都必须能脱离上下文单独成立。因为大模型在引用时,摘走的往往就是孤立的一两句话——如果定义依赖前文才能读懂,它就不会被引用。
全部 35 条以 CC BY 4.0 授权发布,注明出处即可自由使用,包括商用。
核心概念6 条
- GEOGenerative Engine Optimization · 生成引擎优化
- 让一个品牌、个人或内容,在 ChatGPT、Claude、Gemini、DeepSeek、豆包等生成式 AI 的回答中被正确识别、准确描述并被引用推荐的优化实践。它优化的不是搜索结果排名,而是 AI 生成答案时引用了谁、怎么说。术语出自 Aggarwal、Murahari 等人 2023 年论文《GEO: Generative Engine Optimization》(arXiv:2311.09735),发表于 KDD 2024。
- AEOAnswer Engine Optimization · 答案引擎优化
- 与 GEO 基本同义,强调优化对象是「一个直接答案」而不是「一列链接」。在中文语境中常与 GEO 混用,两者都有可追溯的出处,可放心写进合同。
- LLMO / LLM SEOLarge Language Model Optimization
- 强调优化对象是大语言模型的叫法,属营销造词,没有可追溯的学术或行业标准出处。含义与 GEO 高度重叠,对外沟通建议优先用 GEO。
- AISO / AI SEOAI Search Optimization
- 强调场景是 AI 搜索的叫法,同样属营销造词。遇到只会用这个词、且讲不清它与 GEO 区别的服务商,建议降低预期。
- 生成式引擎Generative Engine
- 以生成一段自然语言答案作为主要输出形态的信息系统,而不是返回一列链接。包括 ChatGPT、Claude、Gemini、Perplexity、豆包、DeepSeek、Kimi 等,也包括 Google AI Overviews 这类嵌在传统搜索里的生成模块。
- SEOSearch Engine Optimization · 搜索引擎优化
- 针对传统搜索引擎结果页排名的优化实践。与 GEO 不是替代关系而是叠加关系——站点可抓取、结构化数据、内容质量这些基础工作两者共用,但目标函数不同:SEO 争排名位置,GEO 争答案里的那句话。
衡量指标6 条
- 提及率Mention Rate
- 用一套固定提问跑测 AI 后,回答中出现目标名称的题数占总题数的比例。公式:出现目标名称的题数 ÷ 总题数。例如 20 条提问中出现 12 次,提及率为 60%。只看是否出现,不看描述是否正确。
- 事实准确率Factual Accuracy
- AI 提到目标对象时,关键事实(身份、头衔、机构、业务、成就)描述正确的题数占比。公式:得 2 分的题数 ÷ 总题数。被提到但被说错比完全不被提到更伤,因此该指标通常比提及率更值得优先优化。
- 认知空白率Blank Rate
- AI 完全不知道目标对象、或答非所问的题数占比。公式:得 0 分的题数 ÷ 总题数。该指标高说明公开信源不足,治法是铺设信源。
- 事实错误率Error Rate
- AI 知道目标对象但描述有误(头衔过时、机构写错、与同名者混淆、成就张冠李戴)的题数占比。公式:得 1 分的题数 ÷ 总题数。该指标高说明全网信息互相矛盾,治法是做一致性校准,与认知空白率是两种不同的病。
- 正确识别平台数Platform Coverage
- 事实准确率达到约定阈值的 AI 平台个数,衡量覆盖广度。阈值需在报告中明确注明,通常取 60%。
技术要素10 条
- llms.txt
- 放在网站根目录、专门写给大语言模型看的纯文本摘要文件,用 Markdown 书写。由 Jeremy Howard 于 2024 年 9 月 3 日在 Answer.AI 提出,规范见 llmstxt.org。规范只要求一个 H1,摘要引用块、正文与 H2 链接区块均为可选。
- llms-full.txt
- llms.txt 的完整版本,把站点核心内容全文展开放在一个文件里,供模型一次性取用。与 llms.txt 是摘要与全文的关系,并非替代。
- Schema.org结构化数据词汇表
- 由 Google、Microsoft、Yahoo、Yandex 联合维护的结构化数据词汇表,用来告诉机器页面上哪段是定义、哪段是问答、谁是作者。GEO 中最常用的类型包括 Organization、WebPage、Article、FAQPage、HowTo、DefinedTerm、BreadcrumbList。
- JSON-LDJavaScript Object Notation for Linked Data
- 在网页里嵌入结构化数据的推荐格式,写在 <script type="application/ld+json"> 标签里,与页面展示层解耦。相比 Microdata 与 RDFa 更易维护,是当前主流做法。
- DefinedTermSchema.org 术语类型
- Schema.org 中用于标记「一个被定义的术语」的类型,配合 DefinedTermSet 可以把整个术语表结构化。对于希望被 AI 当作权威定义来源引用的内容,这是性价比很高的一项标记。
- FAQPageSchema.org 问答页类型
- Schema.org 中用于标记常见问答的类型。关键约束:标记的问答必须与页面可见内容逐条一致,否则违反结构化数据政策,有被降权风险。
- canonical规范链接
- 告诉搜索引擎与爬虫「这个页面的权威地址是哪个」的声明。必须与站点实际托管域名一致——canonical 指向 A 而站点实际跑在 B,会被判定为配置异常。
- hreflang语言与地区定向
- 多语言站点用来声明「同一内容的其他语言版本在哪」的标记。必须双向互指,并配置 x-default 指向默认版本,单向声明无效。
- robots.txt爬虫协议文件
- 放在站点根目录、声明哪些爬虫可以抓取哪些路径的文本文件。GEO 场景下需特别注意:Google-Extended 与 Applebot-Extended 是「AI 训练用途」的独立开关,不显式写出等于默认不授权。
- 服务端渲染SSR · Server-Side Rendering
- 由服务器直接输出完整 HTML,而不是靠浏览器执行 JavaScript 再拼出内容。对 GEO 至关重要——相当一部分 AI 爬虫不执行 JavaScript,纯前端渲染的内容在它们眼里等于空白页。
AI 爬虫7 条
- GPTBotOpenAI 训练爬虫
- OpenAI 用于抓取公开网页作为模型训练语料的爬虫。放行它影响的是未来模型版本中的知识,不影响当下的联网检索结果。
- OAI-SearchBotOpenAI 检索爬虫
- OpenAI 用于构建 ChatGPT 搜索索引的爬虫。与 GPTBot 不同,它直接影响 ChatGPT 联网检索时能否找到你,是 GEO 最该优先放行的爬虫之一。
- ClaudeBotAnthropic 爬虫
- Anthropic 用于抓取公开网页的爬虫。另有 Claude-User(用户主动触发的取页)与 Claude-SearchBot(检索索引)两类用途不同的 UA。
- PerplexityBotPerplexity 检索爬虫
- Perplexity 用于构建其答案引擎索引的爬虫。Perplexity 的回答高度依赖实时检索并显式标注来源,是观察 GEO 效果最直观的平台之一。
- Google-ExtendedGoogle AI 训练开关
- Google 用于控制站点内容是否可用于 Gemini 等生成式 AI 产品训练与接地的独立标识。它不影响常规 Googlebot 的收录与排名,是一个单独的授权开关。
- CCBotCommon Crawl 爬虫
- Common Crawl 这一公开网页语料库的爬虫。由于大量模型的训练语料直接或间接来自 Common Crawl,放行 CCBot 是进入未来模型知识的重要通道之一。
- Bytespider字节跳动爬虫
- 字节跳动的网页爬虫,与豆包等产品的内容生态相关。面向中文市场做 GEO 时需要显式放行。
方法与风险6 条
- 信源工程Source Engineering
- 把真实资料改写成模型易读取、易引用的结构化事实(一句话定义、问答对、带日期出处的数据点、Schema 标记),并铺设到 AI 实际会检索的权威渠道的工作。是 GEO 中最难外包、也最决定上限的环节。
- 基线诊断Baseline Diagnosis
- 在做任何优化动作之前,用一套提前锁定的标准提问集跑测并打分,得到服务前的指标快照。没有基线就没有效果可言——所有「提升了多少」的说法都必须以基线为参照。
- 实体消歧Entity Disambiguation
- 当目标对象与他人同名、或品牌名与其他事物撞名时,通过补充区分性事实(领域、机构、地域、代表作)帮助模型把两个实体区分开的工作。同名混淆是中文 GEO 中最高频的事实错误来源。
- 幻觉Hallucination
- 大模型生成看似合理但与事实不符的内容。在 GEO 语境中特指模型编造目标对象的头衔、经历或成就。治理幻觉的有效手段不是辩解,而是提供足够密度的、互相一致的公开事实。
- 标准提问集Standard Prompt Set
- 用于跑测的一组固定提问。必须先定稿再跑测,定稿后不得增删改,否则前后对比失去意义。事后挑选表现好的题目来做对比,是这个行业最常见的数据造假手法。
- 刷号灌水Astroturfing
- 通过批量注册账号发布内容来伪造声量的做法。短期可能提升提及率,但会触发平台反垃圾机制,导致账号封禁、词条回退、被判营销号,最终反噬品牌。属于 GEO 的明确红线。
常见问题
GEO 和 AEO 有什么区别?
基本是同一件事的不同叫法。GEO(Generative Engine Optimization,生成引擎优化)是学术界最早使用、也最通用的说法,出自 KDD 2024 论文;AEO(Answer Engine Optimization,答案引擎优化)强调优化对象是「一个直接答案」而不是「一列链接」。两者都有可追溯的出处,可以放心写进合同。相比之下 LLMO、AISO 属于营销造词,没有标准出处。
AI 提及率和事实准确率哪个更重要?
事实准确率更重要。提及率只看 AI 有没有提到你,事实准确率看提到你时说得对不对。被提到但被说错——头衔过时、机构写错、和同名者混淆——比完全不被提到更伤品牌,因为错误信息一旦被反复引用会自我强化。优化顺序上通常先把准确率拉上去,再谈提及率。
认知空白率高和事实错误率高,分别说明什么?
这是两种完全不同的病。认知空白率高(AI 压根不知道你)说明公开信源不足,治法是铺设信源;事实错误率高(AI 知道但说错)说明全网信息互相矛盾,治法是做一致性校准。用错药等于白做,所以诊断阶段必须把这两个指标分开统计。
robots.txt 里为什么要单独写 Google-Extended 和 Applebot-Extended?
因为它们是「AI 训练用途」的独立授权开关,不写等于默认不授权。Google-Extended 控制站点内容是否可用于 Gemini 等生成式 AI 产品,不影响常规 Googlebot 的收录与排名;Applebot-Extended 同理。希望内容进入模型知识的站点,必须显式放行这两个标识。