Docsbook
Visão geral

llms.txt

llms.txt é um índice em texto simples de um site escrito para modelos, em vez de navegadores: um título, um resumo de uma linha e uma lista com links para as páginas que vale a pena ler. O Docsbook gera llms.txt e llms-full.txt automaticamente para cada espaço de trabalho — sem configuração, sem etapa de compilação e sem nada para manter sincronizado manualmente.

Esta página explica exatamente o que o Docsbook coloca nesses arquivos e, em seguida — como a página trata de afirmações legíveis por máquinas e honestas — quão forte é, de fato, a evidência para llms.txt. A versão curta da segunda parte: publique-o, o custo é zero, não atribua nenhum resultado a ele.

Onde o Docsbook disponibiliza estes ficheiros?#

Ficheiro URL O que contém
Índice da plataforma https://docsbook.io/llms.txt O próprio Docsbook: o que é o produto, os seus planos, o seu servidor MCP e o seu catálogo de competências
Texto completo da plataforma https://docsbook.io/llms-full.txt O corpo das próprias páginas de documentação do Docsbook
Índice do espaço de trabalho https://<your-workspace>/llms.txt Todas as páginas Markdown publicadas desse espaço de trabalho, como ligações
Texto completo do espaço de trabalho https://<your-workspace>/llms-full.txt O Markdown completo de cada uma dessas páginas

Os quatro são disponibilizados como text/plain; charset=utf-8 e não requerem autenticação. Um espaço de trabalho publicado num caminho do domínio raiz — incluindo uma demonstração de apresentação, já que uma demonstração é um espaço de trabalho — recebe o mesmo par nesse caminho, limitado ao único projeto indicado no URL, para que um crawler que obtenha o índice de um produto nunca receba as páginas de outro produto.

Cada página é listada no seu URL canónico. Um espaço de trabalho cujas páginas são canónicas no domínio raiz nunca é anunciado no seu subdomínio espelho, porque esse host redireciona e responde Disallow: / em robots.txt. Entregar a um crawler uma lista de URLs que ele é instruído a não obter é pior do que não lhe entregar lista alguma.

O que exatamente entra no llms.txt do workspace?#

Markdown, nesta ordem: um H1 com o nome do workspace ou produto, um blockquote resumindo o que é a documentação e onde ela está, um H2 por repositório conectado e, sob cada H2, uma lista com marcadores de [page title](canonical URL) para cada página Markdown publicada. Em seguida, uma seção Sobre este workspace — a parte escrita para agentes, e não para rastreadores:

## About this workspace
 
- Hosted by: [Docsbook](https://docsbook.io) — AI-native documentation platform
- MCP server (manage this workspace via AI agent): https://docsbook.io/api/mcp/server
- Skills catalog (AI agent instructions for docs tasks): https://docsbook.io/skills
- Last generated: 2026-09-05T09:14:22.104Z
 
> To connect an AI agent to this workspace: `claude mcp add --transport http docsbook https://docsbook.io/api/mcp/server`

Vale a pena conhecer três comportamentos:

  • O H1 nomeia o produto, não a conta. Um arquivo com escopo de um único repositório recebe o nome de exibição desse workspace; somente um arquivo de toda a conta recebe o login da conta como título. O H1 é a primeira coisa que um assistente cita quando perguntado sobre o que é um produto, e o login da conta geralmente é a resposta errada.
  • Um workspace vazio ainda retorna um arquivo válido — o H1, uma linha informando que ainda não há documentos públicos indexados e um link para a página inicial. Um índice vazio é um fato; um 404 é um mistério.
  • Uma página que falha ao ser buscada é ignorada, não causa uma falha. llms-full.txt é montado página por página; um único arquivo inacessível registra um erro e deixa essa página de fora, em vez de fazer toda a solicitação falhar.

Em llms-full.txt, cada página chega sob seu próprio H2 com uma linha Source: contendo sua URL canônica, e seu frontmatter YAML é removido. A linha de origem é o que permite que um assistente cite a página de onde veio uma frase, em vez de citar o conjunto.

llms.txt ou llms-full.txt — qual deles um agente quer?#

llms.txt       — compact index: page titles and links, one line each
llms-full.txt  — the full Markdown body of every page, concatenated

Use o índice quando o agente precisar de um mapa e buscar páginas sob demanda; use o arquivo completo quando quiser toda a base de conhecimento em uma única solicitação e tiver uma janela de contexto suficiente para isso. Há uma terceira opção para o caso intermediário: qualquer página individual está disponível como Markdown bruto em /api/md/<owner>/<repo>/<page path>, e a mesma rota sem um caminho de página retorna todos os arquivos Markdown do repositório concatenados. Essa é a rota usada pelo item Ver como Markdown no menu da página.

Qual é a diferença entre llms.txt e sitemap.xml?#

Eles respondem a perguntas diferentes e nenhum substitui o outro.

sitemap.xml llms.txt
Escrito para Rastreadores de mecanismos de pesquisa Modelos e agentes que leem um site pela primeira vez
Formato XML, URLs e metadados Markdown: H1, resumo, listas de links com títulos
Transmite significado Não — uma URL e um carimbo de data e hora Sim — um resumo do projeto e um título por link
Padronizado por sitemaps.org, com suporte dos mecanismos de pesquisa llmstxt.org, uma proposta
Consumido em produção por Mecanismos de pesquisa, comprovadamente Veja abaixo

O Docsbook gera ambos, e audit_geo verifica ambos.

Com que frequência ele é atualizado?#

O Docsbook regenera o arquivo a partir das suas páginas publicadas quando solicitado e armazena o resultado em cache por uma hora (Cache-Control: public, s-maxage=3600, stale-while-revalidate=86400). Uma página que você envia para o GitHub aparece dentro de uma hora após a próxima busca. Não há etapa de compilação, arquivo para confirmar nem cota — um agente pode buscá-lo quantas vezes quiser.

O que posso alterar sobre o que um agente vê?#

Três coisas, e somente três:

  1. Dê bons nomes aos seus arquivos. O texto do link em llms.txt vem do caminho do arquivo, não do title do frontmatter da página. api-rate-limits.md se torna "Limites de taxa da API"; um README.md na raiz do repositório se torna "Visão geral"; page2.md se torna "Página2", e nenhum modelo o escolherá.
  2. Publique a página. Somente arquivos Markdown confirmados no branch padrão são listados. Rascunhos e edições não enviadas não estão em nenhum dos dois arquivos.
  3. Escreva o primeiro parágrafo como uma resposta. llms-full.txt contém o corpo literalmente, portanto, o que quer que apareça no início da página é o que um assistente lê primeiro.

Quão fortes são as evidências sobre o llms.txt?#

Fracas, e o Docsbook não vai fingir o contrário. Aqui está o caso completo, nos dois sentidos.

Pergunta O que está de fato estabelecido Fonte
Existe uma especificação? Sim — uma proposta de Jeremy Howard, publicada em 3 de setembro de 2024 e revisada desde então; a página agora se chama "The /llms.txt file, v2", modificada em 10 de agosto de 2026. Apenas o H1 é obrigatório: "Um H1 com o nome do projeto ou site. Esta é a única seção obrigatória" llmstxt.org
llms-full.txt está nessa especificação? Não. Verificado na página como ela está atualmente: a string não aparece nela nenhuma vez. É uma convenção da comunidade, que o Docsbook segue porque os agentes a solicitam llmstxt.org
O Google usa isso? Não. John Mueller, em 17 de junho de 2025: "Para sua informação, nenhum sistema de IA usa atualmente o llms.txt". A própria documentação do Google sobre recursos de IA diz: "Você não precisa criar novos arquivos legíveis por máquina, arquivos de texto para IA ou marcação para aparecer nesses recursos" Search Engine Roundtable, Recursos de IA do Google
OpenAI, Anthropic e Perplexity leem isso? Não comprovado em nenhum dos sentidos. Elas publicam seus próprios arquivos — developers.openai.com/llms.txt e docs.perplexity.ai/llms.txt respondem 200 text/plain — mas publicar um arquivo não significa consumi-lo, e a documentação de rastreadores de nenhum dos três fornecedores descreve a busca pelo seu arquivo bots da OpenAI, bots da Perplexity
Ele é solicitado na prática? Medido pela Ahrefs em 137.000 domínios: 28% publicaram um llms.txt válido e, desses, "97% não receberam nenhuma solicitação por ele" em maio de 2026 Ahrefs, atualizado em 15 de junho de 2026
Tê-lo aumenta as citações? Nenhum estudo publicado e replicado demonstra que isso aconteça

O que o arquivo ainda proporciona. Um agente ao qual você fornece a URL — em um prompt, em um cliente MCP ou em um fluxo de suporte — obtém um mapa completo e atual da sua documentação em uma única busca, em vez de rastreá-la. Seu servidor MCP e seu catálogo de skills podem ser descobertos por meio dele. Ele pode ser comparado por diferenças, portanto é um inventário barato do que está realmente publicado. E não custa nada, porque o Docsbook o gera.

O que ele não proporciona. Qualquer afirmação sobre tráfego de assistentes. Se você quiser saber se os assistentes leem sua documentação, meça o que deixa um rastro: acessos de rastreadores provenientes de agentes de usuário de assistentes e tráfego de referência proveniente de domínios de assistentes. Ambos ficam visíveis nas suas análises; um arquivo em uma URL, por si só, não é evidência de nada.

Limites e questões em aberto#

  • O texto do link ignora seu title. Uma página intitulada "Limites de taxa e cotas" no frontmatter é listada como "Limites de taxa da API" se esse for o nome do arquivo. Renomeie o arquivo ou aceite o título derivado.
  • llms-full.txt não tem limite de tamanho. Um workspace grande produz um arquivo que pode exceder a janela de contexto de um agente; não há paginação nem truncamento. Prefira llms.txt com buscas por página acima de algumas dezenas de páginas.
  • O Docsbook não disponibiliza as variantes de página .md da especificação. A proposta solicita "uma versão limpa em Markdown dessas páginas no mesmo URL da página original … com .md anexado". Em vez disso, o Docsbook disponibiliza Markdown bruto em /api/md/…, que contém o mesmo conteúdo em um endereço diferente e não é o que um cliente que segue a especificação procuraria.
  • O cache de uma hora não é configurável, assim como o conteúdo do arquivo. Isso é deliberado — não há uma segunda cópia legível por máquina da sua documentação que possa ficar dessincronizada — mas significa que você não pode selecionar o que um agente vê.
  • Questão em aberto: isso é lido pelos assistentes relevantes? A documentação do bot do fornecedor descreve rastreadores que buscam páginas; nada nela descreve a busca de llms.txt. Até que um fornecedor documente o consumo ou alguém publique evidências nos logs do servidor que contradigam a medição da Ahrefs acima, trate o arquivo como uma prática de higiene gratuita, e não como um canal.
  • GEO — os sinais no nível da página: bloco de resumo, datas visíveis, atribuição do autor.
  • Sinais de citação — as regras de escrita que determinam se uma passagem recuperada é citada.
  • SEO — mapa do site, URLs canônicas, noindex.
  • Servidor MCP — a interface para máquinas usada por agentes que escrevem e também leem.
  • Fonte da verdade — o grafo de documentos local, para um agente com seu repositório no disco.

Esta página foi útil?