llms.txt
llms.txt é um índice em texto simples de um site escrito para modelos, em vez de navegadores: um título, um resumo de uma linha e uma lista com links para as páginas que vale a pena ler. O Docsbook gera llms.txt e llms-full.txt automaticamente para cada espaço de trabalho — sem configuração, sem etapa de compilação e sem nada para manter sincronizado manualmente.
Esta página explica exatamente o que o Docsbook coloca nesses arquivos e, em seguida — como a página trata de afirmações legíveis por máquinas e honestas — quão forte é, de fato, a evidência para llms.txt. A versão curta da segunda parte: publique-o, o custo é zero, não atribua nenhum resultado a ele.
Onde o Docsbook disponibiliza estes ficheiros?#
| Ficheiro | URL | O que contém |
|---|---|---|
| Índice da plataforma | https://docsbook.io/llms.txt |
O próprio Docsbook: o que é o produto, os seus planos, o seu servidor MCP e o seu catálogo de competências |
| Texto completo da plataforma | https://docsbook.io/llms-full.txt |
O corpo das próprias páginas de documentação do Docsbook |
| Índice do espaço de trabalho | https://<your-workspace>/llms.txt |
Todas as páginas Markdown publicadas desse espaço de trabalho, como ligações |
| Texto completo do espaço de trabalho | https://<your-workspace>/llms-full.txt |
O Markdown completo de cada uma dessas páginas |
Os quatro são disponibilizados como text/plain; charset=utf-8 e não requerem autenticação. Um espaço de trabalho publicado num caminho do domínio raiz — incluindo uma demonstração de apresentação, já que uma demonstração é um espaço de trabalho — recebe o mesmo par nesse caminho, limitado ao único projeto indicado no URL, para que um crawler que obtenha o índice de um produto nunca receba as páginas de outro produto.
Cada página é listada no seu URL canónico. Um espaço de trabalho cujas páginas são canónicas no domínio raiz nunca é anunciado no seu subdomínio espelho, porque esse host redireciona e responde Disallow: / em robots.txt. Entregar a um crawler uma lista de URLs que ele é instruído a não obter é pior do que não lhe entregar lista alguma.
O que exatamente entra no llms.txt do workspace?#
Markdown, nesta ordem: um H1 com o nome do workspace ou produto, um blockquote resumindo o que é a documentação e onde ela está, um H2 por repositório conectado e, sob cada H2, uma lista com marcadores de [page title](canonical URL) para cada página Markdown publicada. Em seguida, uma seção Sobre este workspace — a parte escrita para agentes, e não para rastreadores:
## About this workspace
- Hosted by: [Docsbook](https://docsbook.io) — AI-native documentation platform
- MCP server (manage this workspace via AI agent): https://docsbook.io/api/mcp/server
- Skills catalog (AI agent instructions for docs tasks): https://docsbook.io/skills
- Last generated: 2026-09-05T09:14:22.104Z
> To connect an AI agent to this workspace: `claude mcp add --transport http docsbook https://docsbook.io/api/mcp/server`Vale a pena conhecer três comportamentos:
- O H1 nomeia o produto, não a conta. Um arquivo com escopo de um único repositório recebe o nome de exibição desse workspace; somente um arquivo de toda a conta recebe o login da conta como título. O H1 é a primeira coisa que um assistente cita quando perguntado sobre o que é um produto, e o login da conta geralmente é a resposta errada.
- Um workspace vazio ainda retorna um arquivo válido — o H1, uma linha informando que ainda não há documentos públicos indexados e um link para a página inicial. Um índice vazio é um fato; um 404 é um mistério.
- Uma página que falha ao ser buscada é ignorada, não causa uma falha.
llms-full.txté montado página por página; um único arquivo inacessível registra um erro e deixa essa página de fora, em vez de fazer toda a solicitação falhar.
Em llms-full.txt, cada página chega sob seu próprio H2 com uma linha Source: contendo sua URL canônica, e seu frontmatter YAML é removido. A linha de origem é o que permite que um assistente cite a página de onde veio uma frase, em vez de citar o conjunto.
llms.txt ou llms-full.txt — qual deles um agente quer?#
llms.txt — compact index: page titles and links, one line each
llms-full.txt — the full Markdown body of every page, concatenated
Use o índice quando o agente precisar de um mapa e buscar páginas sob demanda; use o arquivo completo quando quiser toda a base de conhecimento em uma única solicitação e tiver uma janela de contexto suficiente para isso. Há uma terceira opção para o caso intermediário: qualquer página individual está disponível como Markdown bruto em /api/md/<owner>/<repo>/<page path>, e a mesma rota sem um caminho de página retorna todos os arquivos Markdown do repositório concatenados. Essa é a rota usada pelo item Ver como Markdown no menu da página.
Qual é a diferença entre llms.txt e sitemap.xml?#
Eles respondem a perguntas diferentes e nenhum substitui o outro.
sitemap.xml |
llms.txt |
|
|---|---|---|
| Escrito para | Rastreadores de mecanismos de pesquisa | Modelos e agentes que leem um site pela primeira vez |
| Formato | XML, URLs e metadados | Markdown: H1, resumo, listas de links com títulos |
| Transmite significado | Não — uma URL e um carimbo de data e hora | Sim — um resumo do projeto e um título por link |
| Padronizado por | sitemaps.org, com suporte dos mecanismos de pesquisa | llmstxt.org, uma proposta |
| Consumido em produção por | Mecanismos de pesquisa, comprovadamente | Veja abaixo |
O Docsbook gera ambos, e audit_geo verifica ambos.
Com que frequência ele é atualizado?#
O Docsbook regenera o arquivo a partir das suas páginas publicadas quando solicitado e armazena o resultado em cache por uma hora (Cache-Control: public, s-maxage=3600, stale-while-revalidate=86400). Uma página que você envia para o GitHub aparece dentro de uma hora após a próxima busca. Não há etapa de compilação, arquivo para confirmar nem cota — um agente pode buscá-lo quantas vezes quiser.
O que posso alterar sobre o que um agente vê?#
Três coisas, e somente três:
- Dê bons nomes aos seus arquivos. O texto do link em
llms.txtvem do caminho do arquivo, não dotitledo frontmatter da página.api-rate-limits.mdse torna "Limites de taxa da API"; umREADME.mdna raiz do repositório se torna "Visão geral";page2.mdse torna "Página2", e nenhum modelo o escolherá. - Publique a página. Somente arquivos Markdown confirmados no branch padrão são listados. Rascunhos e edições não enviadas não estão em nenhum dos dois arquivos.
- Escreva o primeiro parágrafo como uma resposta.
llms-full.txtcontém o corpo literalmente, portanto, o que quer que apareça no início da página é o que um assistente lê primeiro.
Quão fortes são as evidências sobre o llms.txt?#
Fracas, e o Docsbook não vai fingir o contrário. Aqui está o caso completo, nos dois sentidos.
| Pergunta | O que está de fato estabelecido | Fonte |
|---|---|---|
| Existe uma especificação? | Sim — uma proposta de Jeremy Howard, publicada em 3 de setembro de 2024 e revisada desde então; a página agora se chama "The /llms.txt file, v2", modificada em 10 de agosto de 2026. Apenas o H1 é obrigatório: "Um H1 com o nome do projeto ou site. Esta é a única seção obrigatória" | llmstxt.org |
llms-full.txt está nessa especificação? |
Não. Verificado na página como ela está atualmente: a string não aparece nela nenhuma vez. É uma convenção da comunidade, que o Docsbook segue porque os agentes a solicitam | llmstxt.org |
| O Google usa isso? | Não. John Mueller, em 17 de junho de 2025: "Para sua informação, nenhum sistema de IA usa atualmente o llms.txt". A própria documentação do Google sobre recursos de IA diz: "Você não precisa criar novos arquivos legíveis por máquina, arquivos de texto para IA ou marcação para aparecer nesses recursos" | Search Engine Roundtable, Recursos de IA do Google |
| OpenAI, Anthropic e Perplexity leem isso? | Não comprovado em nenhum dos sentidos. Elas publicam seus próprios arquivos — developers.openai.com/llms.txt e docs.perplexity.ai/llms.txt respondem 200 text/plain — mas publicar um arquivo não significa consumi-lo, e a documentação de rastreadores de nenhum dos três fornecedores descreve a busca pelo seu arquivo |
bots da OpenAI, bots da Perplexity |
| Ele é solicitado na prática? | Medido pela Ahrefs em 137.000 domínios: 28% publicaram um llms.txt válido e, desses, "97% não receberam nenhuma solicitação por ele" em maio de 2026 |
Ahrefs, atualizado em 15 de junho de 2026 |
| Tê-lo aumenta as citações? | Nenhum estudo publicado e replicado demonstra que isso aconteça | — |
O que o arquivo ainda proporciona. Um agente ao qual você fornece a URL — em um prompt, em um cliente MCP ou em um fluxo de suporte — obtém um mapa completo e atual da sua documentação em uma única busca, em vez de rastreá-la. Seu servidor MCP e seu catálogo de skills podem ser descobertos por meio dele. Ele pode ser comparado por diferenças, portanto é um inventário barato do que está realmente publicado. E não custa nada, porque o Docsbook o gera.
O que ele não proporciona. Qualquer afirmação sobre tráfego de assistentes. Se você quiser saber se os assistentes leem sua documentação, meça o que deixa um rastro: acessos de rastreadores provenientes de agentes de usuário de assistentes e tráfego de referência proveniente de domínios de assistentes. Ambos ficam visíveis nas suas análises; um arquivo em uma URL, por si só, não é evidência de nada.
Limites e questões em aberto#
- O texto do link ignora seu
title. Uma página intitulada "Limites de taxa e cotas" no frontmatter é listada como "Limites de taxa da API" se esse for o nome do arquivo. Renomeie o arquivo ou aceite o título derivado. llms-full.txtnão tem limite de tamanho. Um workspace grande produz um arquivo que pode exceder a janela de contexto de um agente; não há paginação nem truncamento. Prefirallms.txtcom buscas por página acima de algumas dezenas de páginas.- O Docsbook não disponibiliza as variantes de página
.mdda especificação. A proposta solicita "uma versão limpa em Markdown dessas páginas no mesmo URL da página original … com.mdanexado". Em vez disso, o Docsbook disponibiliza Markdown bruto em/api/md/…, que contém o mesmo conteúdo em um endereço diferente e não é o que um cliente que segue a especificação procuraria. - O cache de uma hora não é configurável, assim como o conteúdo do arquivo. Isso é deliberado — não há uma segunda cópia legível por máquina da sua documentação que possa ficar dessincronizada — mas significa que você não pode selecionar o que um agente vê.
- Questão em aberto: isso é lido pelos assistentes relevantes? A documentação do bot do fornecedor descreve rastreadores que buscam páginas; nada nela descreve a busca de
llms.txt. Até que um fornecedor documente o consumo ou alguém publique evidências nos logs do servidor que contradigam a medição da Ahrefs acima, trate o arquivo como uma prática de higiene gratuita, e não como um canal.
Relacionado#
- GEO — os sinais no nível da página: bloco de resumo, datas visíveis, atribuição do autor.
- Sinais de citação — as regras de escrita que determinam se uma passagem recuperada é citada.
- SEO — mapa do site, URLs canônicas,
noindex. - Servidor MCP — a interface para máquinas usada por agentes que escrevem e também leem.
- Fonte da verdade — o grafo de documentos local, para um agente com seu repositório no disco.