Docsbook
Visão geral

Uso e custo de IA

A IA medida é a única parte de um produto de documentação em que um número errado custa dinheiro real ao proprietário. Esta página explica o mecanismo: o que é medido, como uma chamada é precificada, de qual saldo ela é descontada, o que você pode ver depois e onde os valores em duas telas diferentes podem legitimamente divergir.

O que você obtém#

Cada chamada de IA feita pelo seu projeto — a pergunta de um leitor, sua própria pergunta no painel, uma tradução, uma execução de embedding, uma etapa de agente — grava uma linha identificando a interface que a utilizou, o modelo executado, os tokens de entrada e saída, o que o provedor cobrou e o que foi descontado do seu saldo. Cada chamada de ferramenta MCP tarifada grava sua própria linha, identificando a ferramenta e sua classe de cobrança.

A partir dessas linhas, você pode consultar os gastos por modelo, por interface, por categoria de orçamento, por conversa, por idioma e página traduzidos e por ferramenta MCP — além de uma série diária para cada um deles. O bloco de destaque Gastos na visão geral das análises é a soma dos mesmos dois livros-razão.

Consultar qualquer um desses dados é gratuito. Responder a um leitor não é.

O que consome o saldo e o que não consome#

O uso é medido em dinheiro, não em solicitações: cada chamada consome o valor pelo qual foi precificada, portanto escolher um modelo mais barato faz o mesmo saldo render mais. É para isso que serve o seletor de modelos, disponível em todos os planos.

Consome o saldo do projeto Não custa nada
Uma resposta de IA exibida a um leitor no chat Ler qualquer relatório de análise
Uma pergunta feita ao assistente no painel Hospedar e disponibilizar sua documentação
Sugestões de acompanhamento e títulos de conversas Disponibilizar uma página já traduzida
Traduzir uma página Configurações de marca, tema, navegação e SEO
Construir o índice semântico e seus embeddings Registrar um webhook e receber entregas
Uma execução de agente em segundo plano Chamadas de descoberta do MCP — descobrir o que o servidor pode fazer
Uma chamada de ferramenta MCP medida Eventos de leitores no seu site de documentação

Os eventos de leitores são precificados, mas nunca cobrados. A visão de Uso exibe um valor ao lado de cada classe de evento para que você veja o que o seu tráfego implica, e nada é deduzido de lugar algum. O dinheiro cobrado e o dinheiro apenas medido são mantidos em totais separados precisamente para que uma tela nunca possa apresentar o segundo como uma fatura.

As chamadas que usam sua própria chave de provedor são medidas, mas não cobradas. A linha ainda é registrada — com o custo real do provedor, seu modelo e suas contagens de tokens — e precificada em zero em vez de ser descartada, porque um modelo ausente na discriminação apenas por estar na sua chave dá a entender que "nunca o chamamos". Essas chamadas também são contabilizadas separadamente, portanto um $0 ao lado do volume real é explicado em vez de parecer estar quebrado. Usar sua própria chave não altera o que o seu plano inclui.

Como é construído#

Dois livros contábeis cobrados, deliberadamente não uma única tabela#

Livro contábil Uma linha por Campos principais
Fatura de tokens Chamada ao LLM superfície (ai-chat, agent-chat, translate, embed, followups, title, other), categoria de orçamento (users, admin, translations, embeddings), modelo, tokens do prompt/conclusão/total, custo do provedor, margem congelada no momento da chamada, duração, ID da conversa, indicador de chave própria, indicador de preço estimado; as traduções adicionam o idioma, a página e quantos blocos foram retraduzidos em vez de reutilizados
Fatura de chamadas MCP Chamada de ferramenta nome da ferramenta, classe de cobrança congelada no momento da chamada, preço de tabela, duração, se a chamada foi bem-sucedida, a execução em segundo plano que a realizou

Elas são tabelas separadas porque uma chamada MCP não tem uma fatura de tokens — ela tem um nome, uma classe e um preço de tabela fixo — e porque uma grande parte das chamadas MCP (descoberta, listagem dos seus projetos) não pertence a nenhum projeto. Registrar essas chamadas em um projeto arbitrário seria uma atribuição inventada que o gráfico de uso apresentaria então como fato.

Como o custo de uma chamada é calculado#

  1. O custo informado pelo próprio provedor prevalece. Quando o provedor retorna quanto a chamada custou, esse valor é usado literalmente e a linha não é marcada como estimada. Ele é autoritativo de uma forma que um cálculo local não pode ser, pois já leva em conta descontos de cache de prompts e alterações de preço durante a execução.
  2. Caso contrário, a tarifa de catálogo do modelo. As contagens reais de tokens de prompt e conclusão da resposta são multiplicadas pela tarifa de entrada e saída desse modelo por milhão de tokens. Doze modelos de chat estão no catálogo, cada um com suas próprias tarifas, além de um catálogo separado de embeddings.
  3. Um modelo não reconhecido usa uma tarifa de fallback deliberadamente pessimista e a linha é marcada como estimated, para que toda interface possa identificá-la como uma estimativa em vez de apresentá-la como um fato. A busca do modelo exige correspondência exata, nunca aproximada: a correspondência por substring certa vez calculou o preço de um modelo -mini como se fosse o de seu equivalente de tamanho completo.

Em seguida, uma margem é aplicada e fixada na linha, para que as linhas históricas continuem corretas caso a tarifa algum dia mude.

As contagens de tokens vêm do próprio relatório de uso da API do modelo. O Docsbook não as estima com base no comprimento do texto.

Milicêntimos e o arredondamento que importa#

O custo do provedor é armazenado em milicêntimos — um milésimo de centavo — porque uma única resposta barata custa uma pequena fração de centavo, e centavos inteiros arredondariam quase todas as linhas para zero, fazendo o gráfico detalhado mentir.

O que sai da carteira são centavos inteiros. A dedução é arredondada para baixo para centavos inteiros e carrega o restante no projeto, para que cem respostas abaixo de um centavo eventualmente gastem um centavo, em vez de serem perdoadas ou cobradas a mais. O dinheiro é gasto em uma ordem: primeiro o crédito de teste, depois o limite mensal, e então qualquer saldo avulso.

Uma consequência que você pode ver na tela. A coluna que registra o que de fato saiu da carteira naquela chamada é 0 em quase todas as linhas, porque chamadas abaixo de um centavo apenas movem o restante acumulado. As interfaces mais recentes — o bloco de Gastos e a visualização de Uso — portanto reconstroem o preço de tabela de cada linha a partir do custo do provedor e da margem fixa, em vez de somar essa coluna, enquanto duas telas mais antigas ainda a somam. Quando essas duas discordam, o valor reconstruído é o mais honesto.

O que acontece quando o saldo acaba#

O Docsbook funciona no modelo de pagamento conforme o uso. O saldo não é recarregado automaticamente, e nada no seu site muda quando ele acaba — apenas o trabalho de IA é interrompido, no ponto que consegue explicar o motivo:

Superfície O que acontece
Chat do leitor A solicitação é recusada antes que o modelo seja executado, com um código de motivo em vez de uma resposta inválida
Loop do agente administrativo Verificado antes do loop e antes de cada iteração, para que uma única interação longa não consuma o restante do saldo durante a execução
Execuções do agente A execução é registrada como falha com uma frase compreensível — o saldo acabou; recarregue-o e ela será executada novamente no próximo acionamento
Tradução em lote O trabalho é interrompido e informa o motivo; as páginas restantes não são traduzidas, nem ignoradas silenciosamente
Índice semântico Recusado antes mesmo que a linha do trabalho seja aberta
Ferramentas MCP Uma recusa estruturada que informa a ferramenta, sua classe de cobrança, o projeto, o preço por chamada, o saldo restante e um link para recarga. As ferramentas de descoberta continuam funcionando

Como essas são verificações, e não reservas, uma carteira pode ficar no máximo uma chamada além do saldo esgotado; a próxima falha de forma segura.

Excedente é uma alternativa à interrupção imediata, e é opcional e disponível apenas em planos pagos. Ele tem um limite, é cobrado em um intervalo fixo e avisa você durante o aumento em 75%, 85%, 90%, 95% e 100% do seu limite por meio dos webhooks de uso. As traduções e o índice semântico deliberadamente nunca usam esse recurso: uma execução de índice é uma ação grande, deliberada e cancelável, e transformá-la silenciosamente em uma cobrança de excedente seria uma prática hostil.

A página Chat#

A página Chat informa o que foi perguntado ao seu assistente e quanto custou responder, em um único conjunto de conversas sem controle de intervalo — portanto, os cartões e a lista abaixo deles nunca podem descrever conjuntos diferentes.

Cartão O que é
Receita Quanto valem os leitores que usaram o chat, contabilizados uma vez por leitor, na mesma escala usada por Metas e pela coluna Potencial
Custo O valor cobrado pela execução do chat durante o mesmo período, conforme o registro de uso
Economia Custo de suporte evitado, a partir das conversas respondidas — uma estimativa, com uma única taxa padrão do setor por chamado, não o seu custo medido
Perguntas Tópicos de chat iniciados pelos leitores
Respondidas A proporção de conversas em que um modelo, ao reler a transcrição, julga que o leitor realmente recebeu uma resposta

“Respondidas” é lido, não inferido. O sinal anterior — um clique em uma citação, uma curtida ou um clique externo — é um indicador indireto que erra nas duas direções: um leitor que recebeu uma resposta perfeita e não clicou em nada é classificado como não avaliado, enquanto um leitor que clicou em uma página citada sem lê-la é classificado como respondido. Uma passagem separada do modelo lê cada transcrição. As conclusões são registradas uma vez e reutilizadas, e apenas algumas conversas novas são avaliadas a cada carregamento da página, para que o valor seja preenchido ao longo de algumas visitas, em vez de fazer a primeira expirar por tempo limite. Com menos de cinco conversas avaliadas, o cartão recorre à leitura anterior e informa isso. Uma conversa que ainda aguarda avaliação aparece como não avaliada, nunca como sem resposta.

Ao passar o mouse sobre um cartão, é exibido o valor das últimas 24 horas quando disponível; “Respondidas” mostra uma contagem ("2 de 3") em vez de uma porcentagem, porque, em um único dia, uma porcentagem varia em pontos percentuais inteiros por conversa. Receita e Custo não têm um valor diário separado — ambos são lidos no intervalo já exibido.

Por que esta é a maneira certa#

Regra Por que funciona Fonte
Prefira o custo informado pelo provedor ao custo derivado localmente O OpenRouter retorna o campo de custo como "O valor total cobrado da sua conta", juntamente com cost_details.upstream_inference_cost — "O custo real cobrado pelo provedor de IA upstream". Uma redeterminação local não pode saber nenhum dos dois OpenRouter: contabilização de uso
Um preço recalculado a partir das contagens de tokens está errado sempre que o armazenamento em cache se aplica A OpenAI cobra os tokens de prompt reutilizados pela "taxa reduzida de entrada em cache do modelo para tokens reutilizados, com desconto de até 90%", informada separadamente nos detalhes de uso da resposta OpenAI: armazenamento em cache de prompts
Contabilize as chamadas de ferramentas por chamada e registre também as falhas A especificação do MCP atribui a limitação de taxa ao servidor — os servidores "DEVEM … Limitar a taxa de invocações de ferramentas" — e solicita que os clientes "Registrem o uso de ferramentas para fins de auditoria". Um livro-razão que registrasse apenas os sucessos não seria nenhum dos dois Especificação do MCP: ferramentas
Armazene valores inferiores a um centavo com precisão inferior a um centavo Todo valor honesto por chamada aqui é uma fração de centavo; arredondar na entrada é como um dia real de gastos se torna $0 Mecanismo, esta página

Limites e questões em aberto#

  • Você não pode detalhar os gastos por provedor. O livro-razão registra o modelo, não o fornecedor por trás dele, portanto a pergunta "quanto foi para a Anthropic" não tem resposta no produto atualmente.
  • Você ainda não pode ver os gastos por execução de agente no livro-razão de tokens. As linhas do MCP contêm a execução que as realizou; as linhas de tokens contêm apenas um ID de conversa livre, então a cobrança do modelo de um agente é agrupada por conversa em vez de por execução.
  • As linhas marcadas com estimated são estimativas, e a taxa de fallback é deliberadamente alta. Um modelo fora do catálogo recebe, de propósito, um preço pessimista — cobrar menos de um cliente por um modelo que ninguém precificou é o pior erro — portanto, uma linha estimada é um limite superior, não uma medição.
  • Duas telas mais antigas ainda somam a coluna de centavos deduzidos e, portanto, subestimam projetos cujas chamadas são, em sua maioria, inferiores a um centavo. O bloco de Gastos e a visão de Uso recalculam o preço de tabela. Se dois valores de gastos divergirem, esse é o motivo.
  • A economia é uma estimativa e é identificada como tal. Ela multiplica as conversas respondidas pelo custo padrão de mercado de um chamado de suporte. Esse não é o seu custo de suporte, e o Docsbook não mediu o seu.
  • Os gastos com chave própria são invisíveis como dinheiro. Essas chamadas mostram volume, combinação de modelos e contagens de tokens, e $0. O custo real para você está na fatura do seu provedor.
  • Os relatórios e a janela de retenção não têm a mesma duração. O painel nunca mostra mais de 30 dias de uso, correspondendo ao ponto em que as análises dos leitores terminam. O próprio livro-razão de IA é mantido por 90 dias — essa margem extra existe para que uma cobrança contestada ainda possa ser reconstruída — e é eliminado diariamente. As linhas de chamadas do MCP atualmente não são eliminadas, por isso a visão por ferramenta cobre todo o período.
  • Questão em aberto: "Economia" e "Receita" são modelos; "Custo" é uma medição. O que pode ser verificado é o livro-razão: qual modelo foi executado, quanto o provedor cobrou, quanto saiu do saldo. O que não pode ser verificado a partir desses dados é se uma pergunta respondida teria se tornado um chamado de suporte ou se um leitor que usou o chat não teria comprado de outra forma. Leia os dois valores de entrada de dinheiro como classificações entre leitores, nunca como dinheiro.

Qual plano#

O assistente voltado ao leitor, as execuções de agentes e as traduções automáticas são as funcionalidades que gastam dinheiro da chave do provedor da Docsbook e são as funcionalidades pagas. Todo o restante desta página — os livros-caixa, os detalhamentos, o seletor de modelos, usar sua própria chave, MCP — está disponível em todos os planos, e o MCP em particular não tem nenhuma restrição de plano: o dinheiro é o único limite. Os planos e as tarifas atuais estão na página de preços.

Onde procurar#

  1. Gastos ao longo do tempo, ao lado do seu tráfego — o bloco Gastos na visão geral de análises.
  2. Em que o dinheiro foi gasto — a visualização Uso: IA por superfície, categoria e modelo; MCP por ferramenta e classe; eventos com preço, mas não cobrados. As janelas são de 24 horas, 7 dias e 30 dias.
  3. O que foi solicitado no seu chat e quanto custou — a linha Chat na barra lateral de administração; abra uma conversa para ver sua transcrição e seu próprio detalhamento de custos.
  4. De um agenteget_ai_usage por meio do MCP.

Updated

Esta página foi útil?