GEO — 生成式引擎优化
Docsbook GEO 是一组页面级信号,可帮助生成式引擎——Perplexity、ChatGPT 搜索、Google AI 概览、Claude——引用您的文档并将引用归因于您。在管理后台的SEO / GEO选项卡中开启GEO,或通过 MCP 调用 update_geo,工作区中的每个页面都会在下次渲染时携带这些信号。它不受套餐限制——每个套餐都包含此功能。
GEO 关注的是在生成的答案中被引用。它的两个相邻概念面向不同的场景:SEO 关注在蓝色链接列表中的排名,而 AEO 关注答案框和语音助手,它们基于明确的 FAQPage 和 HowTo 标记构建。
生成式引擎究竟会如何处理你的页面?#
不是一件事,而是一条流水线,其中每个阶段都可能让你被淘汰。爬虫抓取页面。检索器评估的是段落,而不是整篇文档:Google 将其段落排名系统描述为一种用于识别“网页中的各个部分或‘段落’,以更好地理解网页与搜索的相关性”的系统(Google Search Central,排名系统指南)。随后,少量成功保留下来的来源会被放入上下文窗口——GEO 论文的设置是“针对每个查询,仅使用从 Google 搜索引擎抓取的排名前 5 个来源”(GEO,KDD 2024)——然后模型基于这些来源撰写答案,决定引用什么内容以及将功劳归于谁。
由此会产生两个后果,下面的一切都源于此。任何阻止你被抓取或检索的因素,都会让写作变得毫无意义。任何让被检索到的段落更容易被提取和归因的因素,才是 GEO 真正能够改变的地方。
启用 GEO 后,Docsbook 会向页面添加什么?#
共有三项,全部都能在页面的 HTML 中看到,此外还有围绕它们的语义包装元素。
H1 后的 TL;DR 块#
Docsbook 会在开头的 H1 后立即注入一段简短摘要,呈现为 <aside class="tldr" role="note" aria-label="Summary">。文本按以下顺序选择:
- 页面 frontmatter 中明确指定的
tldr:字段。 - 否则使用文档中的第一段真正的段落。查找时会跳过标题、引用块、列表项、围栏代码块以及仅包含图片的行。
无论哪一项最终胜出,都会先经过清理再输出:链接语法、行内代码、强调标记和原始 HTML 标签会被移除,空白字符会被合并。结果上限为 280 个字符;如果最后一个单词边界位于中点之后,则在最后一个单词边界处截断,同时移除末尾标点并追加一个省略号。
有两种行为值得了解,因为它们可以避免该块变得杂乱无用:
- 少于 40 个字符的第一段不会生成任何 TL;DR。 残缺的内容还不如没有。
- 当 TL;DR 来自导语时,导语会从正文中移除。 同一句话不会连续出现两次;当 TL;DR 来自 frontmatter 时,开头段落会完全按照你的原样保留。
可见的最后修改时间#
启用 GEO 后,文章末尾会显示一行更新于 2026 年 5 月 25 日,日期包含在真正的 <time dateTime="…"> 元素中,因此解析器既能获取机器值,也能获取人类可读的值。该日期是仓库中修改此文件的最新提交的提交者日期,如果没有则回退到作者日期。Docsbook 会将查询结果缓存一小时;如果 GitHub 未作出响应,则省略该行,而不是进行猜测——错误的日期比没有日期更糟。
同一提交历史还会从修改此文件的最近 100 次提交中最早的一次开始,填充 JSON-LD 中的 datePublished。
JSON-LD 中的 Person 作者#
每个页面都包含一个 TechArticle 对象。在未启用 GEO 时,其 author 是对工作区 Organization 的引用。启用 GEO 后,它会变成一个人物:
{
"@type": "Person",
"name": "Jane Doe",
"url": "https://github.com/janedoe",
"sameAs": ["https://github.com/janedoe"]
}名称来自 author: frontmatter(如果已设置),否则来自该文件的最后一次提交作者。url 和 sameAs 的值来自 authorUrl: frontmatter 或作者的 GitHub 个人资料;如果两者都不存在,则不会包含这两个字段。如果这两个来源都没有提供名称,则该对象会回退到 Organization 引用,而不是输出空的 Person。
语义包装器#
正文会在 <article> 中渲染,而 TL;DR 块带有 role="note" 和可访问标签——辅助技术和解析器都可以读取这些内容。启用 AEO 后,.tldr 是页面 speakable 规范中的第一个选择器,因此模型最先读取的块,也正是语音助手朗读的块。
如何检查 GEO 是否在发挥作用?#
询问 MCP 工具 audit_geo。它完全不运行模型——其中的每个数字都是抓取结果——因此不可能凭空编造发现。一次调用会执行以下操作:
- 读取你的
robots.txt,并将其与七个已命名的助手代理进行核对(这是一个带日期的列表,目前截至 2026-08-29),将搜索索引代理与训练爬虫分开,因为阻止训练是一项决策,而在期待获得引用的同时阻止搜索索引代理通常是一次意外; - 在同一分钟内对每个抽样页面抓取两次——一次使用浏览器,一次使用
OAI-SearchBot——以捕捉 CDN 向用户提供页面、却向助手提供质询的情况; - 检查正文内容是否存在于原始 HTML 中(至少 200 个单词,且不执行 JavaScript);
- 检查页面是否声明了日期;
- 检查
/llms.txt、/llms-full.txt和/sitemap.xml是否存在。
超时或遇到 404 的探测会记录为带原因的 null,而不是失败——无法访问的检查会减少检查数量,但不会降低你的得分。
为什么是这些信号,而不是其他信号#
| 规则 | 堆栈为何如此运行 | 来源 |
|---|---|---|
| 让每个部分都能独立存在 | 检索针对的是段落,而不是页面 | Google 排名系统指南 |
| 添加引语、统计数据和引用来源 | 经测量,这些做法能提高生成答案中归因于某一来源的内容占比。引语添加、来源引用和统计数据添加是该论文列出的三种首要方法;在一个包含 1 万个查询的基准测试中,相较于位置调整词数指标,论文报告称其“相对提升了 30%–40%”,其中表现最佳的方法达到 41% | GEO,KDD 2024 |
| 说明由谁撰写 | Google 会询问页面是否“包含署名,而按理说这里应当有署名”,并“强烈建议添加准确的作者信息” | 创建有帮助的内容 |
使用 Person,并通过 url 标识作者 |
Google 的 Article 指南指出:“对于人员,请使用 Person 类型”,并链接到“能够唯一标识作者的网页” |
Article 结构化数据 |
| 不要期待某个神奇文件 | “要出现在 AI 概览或 AI 模式中,并没有额外要求,也不需要其他特殊优化” | Google AI 功能 |
| 不要堆砌关键词 | 同一基准测试将关键词堆砌归入“未发挥作用”的方法,其得分低于未经修改的基线;而在实际运行的引擎中,其表现“比基线差 10%” | GEO,KDD 2024 |
限制与未决问题#
这种影响幅度很小,而且是有条件的。 一项针对 45 项 GEO 研究的 2026 年批判性调查得出结论:其基础性收益“在其研究实验环境中有效,但前提是固定语境中已经存在相关来源”,并且“所审查的技术均未显示出对自然发现性或下游行为具有稳定、长期、跨平台的因果影响”(arXiv 2607.14035,2023 年 11 月至 2026 年 7 月期间)。Docsbook 不会向你承诺引用率提升,因为目前尚无任何提升得到确立。
尚待验证:新鲜度是否会提高引用率? 可以验证的是,Google 针对搜索排名运行着“各种‘查询值得保持新鲜度’系统”(排名系统指南),而没有日期的页面不会给模型留下任何可用于判断内容时效性的依据。无法验证的是那个常见说法:显示日期会提高助手引用你的频率;没有一手来源对此进行衡量。在有人发布测量结果之前,应将日期视为维护规范,而不是可操纵的杠杆。
答案还不够稳定,无法手动进行 A/B 测试。 同一调查中总结的独立审计显示:Schulte 等人(2026 年)在四个引擎、45 天的范围内“观察到每日来源级 Jaccard 分数约为 0.34–0.42”;Kirsten 等人(2026 年)针对美国和德国的 4,706 个查询发现,“两个月内的页面重叠率在 AI Overviews 中为 18%,而 Google 自然搜索为 45%”。在确定是获胜还是失败之前,请多次运行检查。
取决于版本的细节。 无论页面使用何种语言,可见日期都会以美式英语格式呈现(May 25, 2026)。datePublished 最多根据触及该文件的最近 100 次提交生成,因此对于存续时间很长的页面,它是该范围内最早的提交,而不是真正的首次提交。从 git 获取的作者是最后修改该文件的人,而此人可能只是修正了一个拼写错误——当署名很重要时,请明确设置 author:。
GEO 开关不会影响自定义域名。 此页面上的全部三个信号都由 Docsbook 托管的渲染路径发出。在你自己的域名上提供服务的页面不会有 TL;DR 块,也不会有可见的 Updated 行,并且只有一个 TechArticle 节点,其作者始终是一个名为仓库所有者 GitHub 登录名的 Person——无论 GEO 开启还是关闭,也不受 author: frontmatter 影响。如今,在自定义域名上启用 GEO 不会改变读者或爬虫所看到的任何内容。有关这里其他差异,请参阅 SEO 限制。
GEO 无法做到的事情。 它无法让未编入索引的页面被编入索引,无法解除你的 robots.txt 对爬虫的禁止,也无法让客户端渲染的页面变得可读。这些都是 SEO 问题,而 audit_geo 正是因此将它们报告为关键问题。
开启#
- 打开您的工作区管理面板(FloatWidget)→ SEO / GEO 标签页。
- 开启 GEO。无套餐限制,也无需逐页设置(定价)。
- 在您最希望被引用的五个页面中添加一行
tldr:。这两项修改就是第一轮的全部工作。