Docsbook
概览

如何让 ChatGPT 在 2026 年引用你的文档

当开发者询问 ChatGPT“如何在产品 Y 中使用功能 X”时,通常会出现两种情况之一:ChatGPT 要么引用你的文档并准确地引用你的原话,要么凭空编造一个并不存在的 API。这两种情况中哪一种会发生,取决于你所做的工作。

这是我们在 Docsbook 为自有文档和客户整理的实用检查清单。

摘要#

  1. 在根目录发布一个干净的 llms.txt
  2. 提供无需 JavaScript 即可显示内容的干净 HTML
  3. 撰写事实性、陈述性的文字,而不是营销文案
  4. 在每个页面顶部添加摘要或概要块
  5. 使用 JSON-LD:TechArticleFAQPageSoftwareApplication
  6. 将页面响应时间控制在 1 秒以内
  7. 确保 robots.txt 允许正确的 AI 爬虫访问

本文其余部分将说明每一项的原因和实现方法。

1. llms.txt 是新的 robots.txt#

ChatGPT、Claude 和 Perplexity 现在首次访问域名时会查找 __CODE_BLOCK_0。格式规范的 llms.txt 能大幅降低幻觉率,因为代理会使用你的精选列表,而不是猜测 URL。

请参阅完整的 llms.txt 指南。Docsbook 会自动为每个工作区生成一个。

2. 无需 JavaScript 渲染内容#

AI 爬虫使用轻量级 HTML 解析器。大多数不会执行 JavaScript。如果你的文档是一个在 DOMContentLoaded 之后获取内容的单页应用,AI 看到的将是一片空白。

需要进行三项检查:

curl -s https://yourdomain.com/docs/page | grep -c "your unique phrase"

如果计数为 0,AI 将无法看到你的内容。

  • 使用服务器端渲染或静态生成
  • 避免对主要内容仅采用 hydration 模式
  • 使用 curllynx 进行测试,而不仅仅是 Chrome

3. 撰写事实性文字,而非营销文案#

AI 模型更偏好陈述句,而不是含糊其辞的营销语言。比较一下:

“Docsbook 是一个领先的平台,帮助团队彻底革新其文档工作流程。”

与:

“Docsbook 可在五秒内从 GitHub 仓库发布文档网站。翻译支持 15 种语言。定价根据 AI 使用量计费,而不是按层级套餐销售。”

第二个句子值得引用。第一个只是填充内容。值得引用的句子最终会出现在答案中;填充内容不会。

4. 每个页面顶部的 TL;DR#

AI 代理是信息提取机器。为它们提供一个明确的提取目标。

一种实用的模式:使用一个 ## TL;DR 标题,后面列出 3–5 个要点,其中包含最重要的事实。AI 模型几乎会原样将这些内容融入答案。

Docsbook 在每篇博客文章中都采用了这种做法。每个引用规范的 Stripe 文档页面也同样如此。

5. AI 实际使用的 JSON-LD#

对于文档,有三种类型很重要:

  • TechArticle — 用于操作指南和教程页面
  • FAQPage — 用于包含 Q&A 区块的任何页面
  • SoftwareApplication — 用于产品概览页面(价格、操作系统、评分)

Docsbook 会自动添加这些内容。如果您使用的是自行构建的网站,请参阅文档 SEO 指南了解实现方法。

6. 速度对爬虫同样重要#

AI 爬虫的超时时间比 Googlebot 更严格。首字节响应时间达到 3 秒的页面会被放弃抓取。

  • 运行 PageSpeed Insights,目标达到 90 分以上
  • 避免在 head 中阻塞分析脚本
  • 在 CDN 处积极进行缓存

Docsbook 页面默认在 PageSpeed Insights 上获得 95 分以上。静态生成、最少的 JavaScript、Vercel 边缘网络。

7. 面向 AI 爬虫的 Robots.txt#

2026 年主要的 AI 爬虫:

爬虫 User-agent 使用方
GPTBot GPTBot ChatGPT 浏览和训练
OAI-SearchBot OAI-SearchBot ChatGPT 搜索
ClaudeBot ClaudeBot Claude.ai 和 Anthropic 搜索
PerplexityBot PerplexityBot Perplexity
Google-Extended Google-Extended Gemini、Google AI 概览
CCBot CCBot Common Crawl(许多模型的训练数据)

对于文档,通常应允许所有这些爬虫访问。Docsbook 发布时附带的默认 robots.txt 就是如此。如果你屏蔽了其中一些,请检查这是否是有意为之。

8. 额外福利:成为被引用的权威来源#

ChatGPT 更倾向于引用其他网站已经链接到的 URL。如果你的文档被首页、更新日志、博客和 GitHub README 链接,AI 模型会更有信心认定你是自己产品的权威来源。

内部链接的价值常被低估。将 docs.yourcompany.com 放入 GitHub 仓库的 About 链接也是如此。

常见错误#

  • 隐匿 — 向爬虫展示与用户不同的内容。AI 模型会对此进行测试,并降低不一致内容的排名。
  • 顶部营销文案过多 — 第一个 H2 标题上方的所有内容权重都很高。请在那里放置事实信息。
  • 隐藏的前置条件 — 页面假设“你已经设置好 X”,却没有链接到 X,这会让 AI 陷入只能给出不完整答案的困境。
  • 没有代码示例 — 开发者查询通常高度围绕代码展开。没有代码的页面被引用的次数会更少。

如何衡量引用#

值得跟踪的三个信号:

  1. 来自 chat.openai.comperplexity.aiclaude.ai 的直接引荐 — 可在您的分析数据中查看
  2. AI 问题日志 — 如果您运行文档 AI 聊天,用户的问题会告诉您他们希望找到什么
  3. 提及监控 — 每月搜索一次您的产品名称 + "ChatGPT",以查看传闻中的引用

Docsbook 提供 AI 使用分析(get_ai_questionsget_ai_unansweredget_failed_searches),让您了解用户提出了哪些您未能很好回答的问题。


Docsbook 会自动处理 llms.txt、JSON-LD、服务器端渲染以及 AI 爬虫 robots.txt。发布您的文档 →

此页面对您有帮助吗?