Sinais de citação
Esta página é a parte de redação do GEO. Ativar o GEO adiciona um bloco de TL;DR, uma data e um autor às suas páginas; nada em um botão de alternância determina se uma frase pode ser extraída. Isso é determinado pela forma como a seção ao redor dela é escrita, e as regras abaixo são aquelas que têm um mecanismo por trás.
Todas as regras são apresentadas da mesma forma: a regra, por que a pilha de recuperação e geração se comporta dessa maneira e uma fonte que você pode consultar. Onde as evidências são escassas, a regra deixa isso claro.
As regras em resumo#
| Regra | Por que o sistema se comporta dessa maneira | Fonte |
|---|---|---|
| Faça com que cada seção seja autossuficiente | A recuperação atribui pontuação a passagens individuais, não a páginas inteiras | Sistemas de classificação do Google |
| Nomeie o assunto por extenso em cada seção | Um fragmento é incorporado sem seus vizinhos; adicionar novamente o contexto ausente melhora mensuravelmente a recuperação | Anthropic, recuperação contextual |
| Responda na primeira frase após o título | O extrator TL;DR do próprio Docsbook e a marcação speakable destacam a abertura; nenhum benchmark público isola esse fator por si só |
Mecanismo, abaixo |
| Adicione uma citação direta | Adição de Citações é o melhor método do benchmark: "os melhores métodos superam a linha de base em 41%" na Contagem de Palavras Ajustada por Posição, em mais de 10 mil consultas | GEO, KDD 2024 |
| Adicione uma estatística | Adição de Estatísticas é um dos três métodos reportados com "uma melhoria relativa de 30–40%" na mesma métrica | GEO, KDD 2024 |
| Cite suas próprias fontes | Citar Fontes faz parte do mesmo grupo de 30–40% | GEO, KDD 2024 |
| Escreva de forma clara | Otimização da Fluência e Fácil de Entender são relatados juntos como "um aumento significativo de visibilidade de 15–30%" | GEO, KDD 2024 |
| Inclua o nome do autor e a data na página | As perguntas de autoavaliação do Google perguntam se as páginas "contêm o nome do autor, quando seria esperado" | Criação de conteúdo útil |
| Não encha o texto de palavras-chave | Excesso de Palavras-chave é classificado entre os métodos "Sem Desempenho" e pontua abaixo da linha de base inalterada; em um mecanismo ativo, ele "tem desempenho 10% pior que a linha de base" | GEO, KDD 2024 |
| Não remova a prosa para tornar uma página "citável" | A otimização apenas do corpo reduziu a presença entre os 20 primeiros resultados em ~9% e a citação final em ~6% em 171.003 documentos (Kim et al., 2026, resumido na pesquisa) | Pesquisa, arXiv 2607.14035 |
| Não bloqueie os agentes que fazem citações | Um site que optou por não participar "não será exibido nas respostas de pesquisa do ChatGPT, embora ainda possa aparecer como link de navegação" | Bots da OpenAI |
Por que passagens, não páginas#
O Google descreve seu sistema de classificação de passagens como um sistema que identifica "seções individuais ou 'passagens' de uma página da Web para entender melhor o quanto uma página é relevante para uma busca" (guia dos sistemas de classificação). Assistentes com recuperação aumentada fazem a mesma coisa de forma mais agressiva: o documento é dividido em fragmentos, cada fragmento recebe um embedding e uma pontuação própria, e somente os vencedores chegam ao modelo.
A Anthropic afirma claramente o modo de falha. Um fragmento que diz "A receita da empresa cresceu 3% em relação ao trimestre anterior" "não especifica a qual empresa está se referindo nem o período relevante", portanto não pode ser recuperado para uma pergunta que mencione a empresa. Reanexar esse contexto antes de gerar o embedding "reduziu a taxa de falha na recuperação dos 20 principais fragmentos em 35%" e, combinado com o BM25 contextual, "em 49%" (Anthropic, recuperação contextual).
Isso é um fornecedor contornando uma prosa que não nomeia seu próprio assunto. Uma prosa que nomeia seu assunto não precisa desse reparo. O que nos leva às duas regras que importam mais do que todas as outras:
- Nomeie o assunto por extenso dentro de cada seção. "Para girá-la, chame o endpoint" não pode ser recuperado — nada nesse trecho diz qual produto está envolvido ou que aquilo que está sendo girado é uma chave de API.
- Responda na primeira frase após o título, depois desenvolva. "Antes de entrarmos na rotação, vale a pena entender…" é uma resposta que chega tarde demais para ser a passagem selecionada.
O teste da citação. Cole uma seção em um arquivo vazio. Se ela já não disser sobre o que trata, reescreva-a. Essa é exatamente a operação que um recuperador executa na sua página.
O que o Docsbook faz mecanicamente com essas regras#
Três partes do Docsbook leem diretamente as estruturas acima, portanto seguir as regras altera a saída real, e não apenas as suas probabilidades:
- Seu primeiro parágrafo se torna o resumo para máquinas. Se uma página não tiver
tldr:no frontmatter, o bloco TL;DR de GEO será criado a partir do primeiro parágrafo real do documento — títulos, citações em bloco, listas, blocos de código e linhas que contenham apenas imagens são ignorados — com limite de 280 caracteres. Um lead com menos de 40 caracteres não produz nenhum bloco. - Um título em forma de pergunta se torna dados estruturados. Com o AEO ativado, qualquer título
###que termine com um ponto de interrogação será emitido como umQuestionemFAQPageJSON-LD, com os parágrafos abaixo dele como resposta, até 20 perguntas por página e 1.000 caracteres por resposta. Formular um título como a pergunta do leitor, portanto, não é uma preferência de estilo — é a entrada para um detector. audit_geoverifica os pré-requisitos mecânicos, incluindo se há pelo menos 200 palavras de prosa no corpo presentes no HTML bruto sem que nenhum JavaScript seja executado e se a página informa alguma data.
Regras com tamanho de efeito medido#
O artigo sobre GEO (KDD 2024) criou o GEO-bench, que “consiste em 10 mil consultas”, e testou nove transformações de conteúdo em uma configuração de mecanismo generativo usando “apenas as 5 principais fontes obtidas do mecanismo de busca do Google para cada consulta”. Sua métrica de visibilidade, Contagem de Palavras Ajustada à Posição, pondera quanto da resposta gerada é atribuído à sua fonte com base na posição em que a citação aparece.
Estas são as cifras apresentadas pelo próprio artigo. Ele relata intervalos e um resultado principal, não uma tabela de porcentagens por método; nós também não:
| O que o artigo relata | Suas próprias palavras |
|---|---|
| O melhor método, em Contagem de Palavras Ajustada à Posição | “Os melhores métodos superam a linha de base em 41% e 28% na Contagem de Palavras Ajustada à Posição e na Impressão Subjetiva, respectivamente” (o melhor é Quotation Addition) |
| Cite Sources, Quotation Addition, Statistics Addition | “alcançaram uma melhoria relativa de 30–40% na métrica de Contagem de Palavras Ajustada à Posição e de 15–30% na métrica de Impressão Subjetiva” |
| Fluency Optimization e Easy-to-Understand | “mudanças estilísticas, como melhorar a fluência e a legibilidade do texto-fonte … também resultaram em um aumento significativo de visibilidade de 15–30%” |
| Keyword Stuffing e Unique Words | Agrupados na tabela de resultados sob “Métodos de Otimização para Mecanismos Generativos que não apresentam desempenho”. Keyword Stuffing obtém uma pontuação inferior à linha de base inalterada |
| Os mesmos nove métodos em um mecanismo ativo (Perplexity.ai) | “Quotation Addition apresenta o melhor desempenho em Contagem de Palavras Ajustada à Posição, com uma melhoria de 22% em relação à linha de base”, e Keyword Stuffing “tem um desempenho 10% pior que a linha de base” |
| Geral | “GEO pode aumentar a visibilidade em até 40% nas respostas de mecanismos generativos” |
Leia esses intervalos como “quais frases um modelo reutiliza quando sua página já está diante dele”, e não como uma previsão de tráfego — veja as limitações abaixo. O artigo também relata que os efeitos variam conforme o domínio: suas tags de melhor desempenho para Statistics Addition são Law & Government, Debate and Opinion, e para Quotation Addition, People & Society, Explanation and History.
Na prática: dê a cada página algo que possa ser extraído — um limite, um tempo limite, uma versão, uma definição em uma frase ou um número com sua fonte identificada. Fatos concretos são o que um modelo reproduz literalmente. E nunca invente um: um número errado repetido por um assistente é pior do que nenhuma resposta e sobreviverá à sua correção.
Regras sobre o que não fazer#
Não faça keyword stuffing. É a única transformação no benchmark que obteve uma pontuação abaixo de deixar a página como está.
Não reduza sua prosa para torná-la "citável". A pesquisa crítica de 2026 sobre 45 estudos de GEO relata um resultado controlado (Kim et al., 2026; 171.003 documentos, 2.700 consultas) no qual otimizar apenas o corpo de uma página "reduz a presença média no top 20 em aproximadamente 9%, a presença no top 10 após o reranking em 16% e a citação final em 6%" (arXiv 2607.14035). A explicação da pesquisa é a que você deve lembrar: uma reescrita pode aumentar a probabilidade de ser citada dado que houve recuperação, ao mesmo tempo que reduz a probabilidade de ser recuperada, e o efeito total se torna negativo. A prosa carrega a variedade de sinônimos que corresponde a perguntas variadas. Adicione a definição e o número junto a ela, nunca em vez dela.
Não bloqueie os agentes que fazem as citações. Os fornecedores executam rastreadores diferentes para finalidades diferentes, e bloquear um não bloqueia os outros:
| Agente | Descrição do próprio fornecedor | Finalidade |
|---|---|---|
OAI-SearchBot |
"usado para exibir sites nos resultados de pesquisa nos recursos de pesquisa do ChatGPT" — os sites que optarem por não participar "não serão mostrados nas respostas de pesquisa do ChatGPT" | Pesquisa |
GPTBot |
"rastreia conteúdo que pode ser usado no treinamento dos nossos modelos fundamentais de IA generativa" | Treinamento |
Claude-SearchBot |
"navega pela web para melhorar a qualidade dos resultados de pesquisa para os usuários" | Pesquisa |
ClaudeBot |
"coleta conteúdo da web que poderia potencialmente contribuir para o treinamento deles" | Treinamento |
PerplexityBot |
"exibe e vincula sites nos resultados de pesquisa do Perplexity. Não é usado para rastrear conteúdo destinado aos modelos fundamentais de IA" | Pesquisa |
Fontes: OpenAI, Anthropic, Perplexity. Bloquear o treinamento enquanto permite a pesquisa é uma decisão empresarial coerente. Bloquear o agente de pesquisa enquanto se espera receber citações é a decisão incoerente, e quase sempre isso acontece acidentalmente — audit_geo relata isso como crítico.
Não espere que um arquivo ou esquema especial substitua a redação. O Google afirma que não há "requisitos adicionais para aparecer nas Visões gerais de IA ou no Modo IA, nem outras otimizações especiais necessárias", e que "você não precisa criar novos arquivos legíveis por máquina, arquivos de texto de IA ou marcação" (Recursos de IA do Google). Consulte llms.txt para ver a mesma pergunta feita especificamente sobre esse arquivo.
Limitações e questões em aberto#
- Os ganhos medidos são condicionais ao fato de já ter sido recuperado. A pesquisa de 2026 conclui que os resultados fundamentais são "válidos dentro de seu contexto experimental, mas condicionais à presença prévia de uma fonte em um contexto fixo", e que "nenhuma técnica analisada demonstra um efeito causal estável, longitudinal e multiplataforma sobre a descoberta orgânica ou o comportamento subsequente". Tudo o que foi descrito acima melhora suas chances depois que você está na janela de contexto. Entrar nela é trabalho de SEO.
- Questão em aberto: a atualidade aumenta a taxa de citações? O Google documenta sistemas de "a consulta merece atualidade" para classificação da Pesquisa, e uma página sem data não fornece ao modelo nada que possa atribuir à atualidade. Nenhuma fonte primária mede um aumento na taxa de citações decorrente de uma data visível. Trate a atualidade como higiene até que alguém publique uma medição.
- Uma única execução não prova nada. Auditorias resumidas na pesquisa: Schulte et al. (2026) "observam pontuações diárias de Jaccard no nível da fonte de aproximadamente 0,34–0,42" em quatro mecanismos e 45 dias, e propõem "sete a oito repetições por solicitação como ponto de partida"; Kirsten et al. (2026) relatam que "a sobreposição de páginas ao longo de dois meses é de 18% para as Visões gerais de IA, em comparação com 45% para o Google orgânico". Repita qualquer verificação antes e depois várias vezes antes de acreditar nela.
- Os números acima vêm de um único benchmark e de uma única época. O GEO-bench foi avaliado em 2024 em uma configuração fixa de mecanismos. A direção das descobertas se manteve nas revisões; as magnitudes não devem ser citadas como seu resultado esperado.
- O Docsbook não mede nada disso para você. O que suas análises podem mostrar é o rastreamento: acessos de rastreadores provenientes de agentes de usuário de assistentes e tráfego de referência proveniente de domínios de assistentes. Uma citação que você não observou não é uma métrica.
Relacionado#
- GEO — o que o Docsbook injeta na página e como verificar.
- llms.txt — o índice de máquina no nível do site e suas evidências.
- AEO — títulos de perguntas,
FAQPagee marcaçãoHowTo. - SEO — indexação e capacidade de rastreamento, a etapa anterior à citação.
- Analytics — onde aparecem os acessos dos rastreadores de assistentes e as referências.