Uso e custo de IA
A IA medida é a única parte de um produto de documentação em que um número errado custa dinheiro real ao proprietário. Esta página explica o mecanismo: o que é medido, como uma chamada é precificada, de qual saldo ela é descontada, o que você pode ver depois e onde os valores em duas telas diferentes podem legitimamente divergir.
O que você obtém#
Cada chamada de IA feita pelo seu projeto — a pergunta de um leitor, sua própria pergunta no painel, uma tradução, uma execução de embedding, uma etapa de agente — grava uma linha identificando a interface que a utilizou, o modelo executado, os tokens de entrada e saída, o que o provedor cobrou e o que foi descontado do seu saldo. Cada chamada de ferramenta MCP tarifada grava sua própria linha, identificando a ferramenta e sua classe de cobrança.
A partir dessas linhas, você pode consultar os gastos por modelo, por interface, por categoria de orçamento, por conversa, por idioma e página traduzidos e por ferramenta MCP — além de uma série diária para cada um deles. O bloco de destaque Gastos na visão geral das análises é a soma dos mesmos dois livros-razão.
Consultar qualquer um desses dados é gratuito. Responder a um leitor não é.
O que consome o saldo e o que não consome#
O uso é medido em dinheiro, não em solicitações: cada chamada consome o valor pelo qual foi precificada, portanto escolher um modelo mais barato faz o mesmo saldo render mais. É para isso que serve o seletor de modelos, disponível em todos os planos.
| Consome o saldo do projeto | Não custa nada |
|---|---|
| Uma resposta de IA exibida a um leitor no chat | Ler qualquer relatório de análise |
| Uma pergunta feita ao assistente no painel | Hospedar e disponibilizar sua documentação |
| Sugestões de acompanhamento e títulos de conversas | Disponibilizar uma página já traduzida |
| Traduzir uma página | Configurações de marca, tema, navegação e SEO |
| Construir o índice semântico e seus embeddings | Registrar um webhook e receber entregas |
| Uma execução de agente em segundo plano | Chamadas de descoberta do MCP — descobrir o que o servidor pode fazer |
| Uma chamada de ferramenta MCP medida | Eventos de leitores no seu site de documentação |
Os eventos de leitores são precificados, mas nunca cobrados. A visão de Uso exibe um valor ao lado de cada classe de evento para que você veja o que o seu tráfego implica, e nada é deduzido de lugar algum. O dinheiro cobrado e o dinheiro apenas medido são mantidos em totais separados precisamente para que uma tela nunca possa apresentar o segundo como uma fatura.
As chamadas que usam sua própria chave de provedor são medidas, mas não cobradas. A linha ainda é
registrada — com o custo real do provedor, seu modelo e suas contagens de tokens — e
precificada em zero em vez de ser descartada, porque um modelo ausente na
discriminação apenas por estar na sua chave dá a entender que "nunca o chamamos". Essas chamadas
também são contabilizadas separadamente, portanto um $0 ao lado do volume real é explicado em vez de
parecer estar quebrado. Usar sua própria chave não altera o que o seu plano
inclui.
Como é construído#
Dois livros contábeis cobrados, deliberadamente não uma única tabela#
| Livro contábil | Uma linha por | Campos principais |
|---|---|---|
| Fatura de tokens | Chamada ao LLM | superfície (ai-chat, agent-chat, translate, embed, followups, title, other), categoria de orçamento (users, admin, translations, embeddings), modelo, tokens do prompt/conclusão/total, custo do provedor, margem congelada no momento da chamada, duração, ID da conversa, indicador de chave própria, indicador de preço estimado; as traduções adicionam o idioma, a página e quantos blocos foram retraduzidos em vez de reutilizados |
| Fatura de chamadas MCP | Chamada de ferramenta | nome da ferramenta, classe de cobrança congelada no momento da chamada, preço de tabela, duração, se a chamada foi bem-sucedida, a execução em segundo plano que a realizou |
Elas são tabelas separadas porque uma chamada MCP não tem uma fatura de tokens — ela tem um nome, uma classe e um preço de tabela fixo — e porque uma grande parte das chamadas MCP (descoberta, listagem dos seus projetos) não pertence a nenhum projeto. Registrar essas chamadas em um projeto arbitrário seria uma atribuição inventada que o gráfico de uso apresentaria então como fato.
Como o custo de uma chamada é calculado#
- O custo informado pelo próprio provedor prevalece. Quando o provedor retorna quanto a chamada custou, esse valor é usado literalmente e a linha não é marcada como estimada. Ele é autoritativo de uma forma que um cálculo local não pode ser, pois já leva em conta descontos de cache de prompts e alterações de preço durante a execução.
- Caso contrário, a tarifa de catálogo do modelo. As contagens reais de tokens de prompt e conclusão da resposta são multiplicadas pela tarifa de entrada e saída desse modelo por milhão de tokens. Doze modelos de chat estão no catálogo, cada um com suas próprias tarifas, além de um catálogo separado de embeddings.
- Um modelo não reconhecido usa uma tarifa de fallback deliberadamente pessimista
e a linha é marcada como
estimated, para que toda interface possa identificá-la como uma estimativa em vez de apresentá-la como um fato. A busca do modelo exige correspondência exata, nunca aproximada: a correspondência por substring certa vez calculou o preço de um modelo-minicomo se fosse o de seu equivalente de tamanho completo.
Em seguida, uma margem é aplicada e fixada na linha, para que as linhas históricas continuem corretas caso a tarifa algum dia mude.
As contagens de tokens vêm do próprio relatório de uso da API do modelo. O Docsbook não as estima com base no comprimento do texto.
Milicêntimos e o arredondamento que importa#
O custo do provedor é armazenado em milicêntimos — um milésimo de centavo — porque uma única resposta barata custa uma pequena fração de centavo, e centavos inteiros arredondariam quase todas as linhas para zero, fazendo o gráfico detalhado mentir.
O que sai da carteira são centavos inteiros. A dedução é arredondada para baixo para centavos inteiros e carrega o restante no projeto, para que cem respostas abaixo de um centavo eventualmente gastem um centavo, em vez de serem perdoadas ou cobradas a mais. O dinheiro é gasto em uma ordem: primeiro o crédito de teste, depois o limite mensal, e então qualquer saldo avulso.
Uma consequência que você pode ver na tela. A coluna que registra o que de fato
saiu da carteira naquela chamada é 0 em quase todas as linhas, porque chamadas abaixo de um centavo
apenas movem o restante acumulado. As interfaces mais recentes — o bloco de Gastos e a visualização de Uso —
portanto reconstroem o preço de tabela de cada linha a partir do custo do provedor e da margem fixa,
em vez de somar essa coluna, enquanto duas telas mais antigas ainda a somam.
Quando essas duas discordam, o valor reconstruído é o mais honesto.
O que acontece quando o saldo acaba#
O Docsbook funciona no modelo de pagamento conforme o uso. O saldo não é recarregado automaticamente, e nada no seu site muda quando ele acaba — apenas o trabalho de IA é interrompido, no ponto que consegue explicar o motivo:
| Superfície | O que acontece |
|---|---|
| Chat do leitor | A solicitação é recusada antes que o modelo seja executado, com um código de motivo em vez de uma resposta inválida |
| Loop do agente administrativo | Verificado antes do loop e antes de cada iteração, para que uma única interação longa não consuma o restante do saldo durante a execução |
| Execuções do agente | A execução é registrada como falha com uma frase compreensível — o saldo acabou; recarregue-o e ela será executada novamente no próximo acionamento |
| Tradução em lote | O trabalho é interrompido e informa o motivo; as páginas restantes não são traduzidas, nem ignoradas silenciosamente |
| Índice semântico | Recusado antes mesmo que a linha do trabalho seja aberta |
| Ferramentas MCP | Uma recusa estruturada que informa a ferramenta, sua classe de cobrança, o projeto, o preço por chamada, o saldo restante e um link para recarga. As ferramentas de descoberta continuam funcionando |
Como essas são verificações, e não reservas, uma carteira pode ficar no máximo uma chamada além do saldo esgotado; a próxima falha de forma segura.
Excedente é uma alternativa à interrupção imediata, e é opcional e disponível apenas em planos pagos. Ele tem um limite, é cobrado em um intervalo fixo e avisa você durante o aumento em 75%, 85%, 90%, 95% e 100% do seu limite por meio dos webhooks de uso. As traduções e o índice semântico deliberadamente nunca usam esse recurso: uma execução de índice é uma ação grande, deliberada e cancelável, e transformá-la silenciosamente em uma cobrança de excedente seria uma prática hostil.
A página Chat#
A página Chat informa o que foi perguntado ao seu assistente e quanto custou responder, em um único conjunto de conversas sem controle de intervalo — portanto, os cartões e a lista abaixo deles nunca podem descrever conjuntos diferentes.
| Cartão | O que é |
|---|---|
| Receita | Quanto valem os leitores que usaram o chat, contabilizados uma vez por leitor, na mesma escala usada por Metas e pela coluna Potencial |
| Custo | O valor cobrado pela execução do chat durante o mesmo período, conforme o registro de uso |
| Economia | Custo de suporte evitado, a partir das conversas respondidas — uma estimativa, com uma única taxa padrão do setor por chamado, não o seu custo medido |
| Perguntas | Tópicos de chat iniciados pelos leitores |
| Respondidas | A proporção de conversas em que um modelo, ao reler a transcrição, julga que o leitor realmente recebeu uma resposta |
“Respondidas” é lido, não inferido. O sinal anterior — um clique em uma citação, uma curtida ou um clique externo — é um indicador indireto que erra nas duas direções: um leitor que recebeu uma resposta perfeita e não clicou em nada é classificado como não avaliado, enquanto um leitor que clicou em uma página citada sem lê-la é classificado como respondido. Uma passagem separada do modelo lê cada transcrição. As conclusões são registradas uma vez e reutilizadas, e apenas algumas conversas novas são avaliadas a cada carregamento da página, para que o valor seja preenchido ao longo de algumas visitas, em vez de fazer a primeira expirar por tempo limite. Com menos de cinco conversas avaliadas, o cartão recorre à leitura anterior e informa isso. Uma conversa que ainda aguarda avaliação aparece como não avaliada, nunca como sem resposta.
Ao passar o mouse sobre um cartão, é exibido o valor das últimas 24 horas quando disponível; “Respondidas” mostra uma contagem ("2 de 3") em vez de uma porcentagem, porque, em um único dia, uma porcentagem varia em pontos percentuais inteiros por conversa. Receita e Custo não têm um valor diário separado — ambos são lidos no intervalo já exibido.
Por que esta é a maneira certa#
| Regra | Por que funciona | Fonte |
|---|---|---|
| Prefira o custo informado pelo provedor ao custo derivado localmente | O OpenRouter retorna o campo de custo como "O valor total cobrado da sua conta", juntamente com cost_details.upstream_inference_cost — "O custo real cobrado pelo provedor de IA upstream". Uma redeterminação local não pode saber nenhum dos dois |
OpenRouter: contabilização de uso |
| Um preço recalculado a partir das contagens de tokens está errado sempre que o armazenamento em cache se aplica | A OpenAI cobra os tokens de prompt reutilizados pela "taxa reduzida de entrada em cache do modelo para tokens reutilizados, com desconto de até 90%", informada separadamente nos detalhes de uso da resposta | OpenAI: armazenamento em cache de prompts |
| Contabilize as chamadas de ferramentas por chamada e registre também as falhas | A especificação do MCP atribui a limitação de taxa ao servidor — os servidores "DEVEM … Limitar a taxa de invocações de ferramentas" — e solicita que os clientes "Registrem o uso de ferramentas para fins de auditoria". Um livro-razão que registrasse apenas os sucessos não seria nenhum dos dois | Especificação do MCP: ferramentas |
| Armazene valores inferiores a um centavo com precisão inferior a um centavo | Todo valor honesto por chamada aqui é uma fração de centavo; arredondar na entrada é como um dia real de gastos se torna $0 |
Mecanismo, esta página |
Limites e questões em aberto#
- Você não pode detalhar os gastos por provedor. O livro-razão registra o modelo, não o fornecedor por trás dele, portanto a pergunta "quanto foi para a Anthropic" não tem resposta no produto atualmente.
- Você ainda não pode ver os gastos por execução de agente no livro-razão de tokens. As linhas do MCP contêm a execução que as realizou; as linhas de tokens contêm apenas um ID de conversa livre, então a cobrança do modelo de um agente é agrupada por conversa em vez de por execução.
- As linhas marcadas com
estimatedsão estimativas, e a taxa de fallback é deliberadamente alta. Um modelo fora do catálogo recebe, de propósito, um preço pessimista — cobrar menos de um cliente por um modelo que ninguém precificou é o pior erro — portanto, uma linha estimada é um limite superior, não uma medição. - Duas telas mais antigas ainda somam a coluna de centavos deduzidos e, portanto, subestimam projetos cujas chamadas são, em sua maioria, inferiores a um centavo. O bloco de Gastos e a visão de Uso recalculam o preço de tabela. Se dois valores de gastos divergirem, esse é o motivo.
- A economia é uma estimativa e é identificada como tal. Ela multiplica as conversas respondidas pelo custo padrão de mercado de um chamado de suporte. Esse não é o seu custo de suporte, e o Docsbook não mediu o seu.
- Os gastos com chave própria são invisíveis como dinheiro. Essas chamadas mostram volume, combinação de modelos
e contagens de tokens, e
$0. O custo real para você está na fatura do seu provedor. - Os relatórios e a janela de retenção não têm a mesma duração. O painel nunca mostra mais de 30 dias de uso, correspondendo ao ponto em que as análises dos leitores terminam. O próprio livro-razão de IA é mantido por 90 dias — essa margem extra existe para que uma cobrança contestada ainda possa ser reconstruída — e é eliminado diariamente. As linhas de chamadas do MCP atualmente não são eliminadas, por isso a visão por ferramenta cobre todo o período.
- Questão em aberto: "Economia" e "Receita" são modelos; "Custo" é uma medição. O que pode ser verificado é o livro-razão: qual modelo foi executado, quanto o provedor cobrou, quanto saiu do saldo. O que não pode ser verificado a partir desses dados é se uma pergunta respondida teria se tornado um chamado de suporte ou se um leitor que usou o chat não teria comprado de outra forma. Leia os dois valores de entrada de dinheiro como classificações entre leitores, nunca como dinheiro.
Qual plano#
O assistente voltado ao leitor, as execuções de agentes e as traduções automáticas são as funcionalidades que gastam dinheiro da chave do provedor da Docsbook e são as funcionalidades pagas. Todo o restante desta página — os livros-caixa, os detalhamentos, o seletor de modelos, usar sua própria chave, MCP — está disponível em todos os planos, e o MCP em particular não tem nenhuma restrição de plano: o dinheiro é o único limite. Os planos e as tarifas atuais estão na página de preços.
Onde procurar#
- Gastos ao longo do tempo, ao lado do seu tráfego — o bloco Gastos na visão geral de análises.
- Em que o dinheiro foi gasto — a visualização Uso: IA por superfície, categoria e modelo; MCP por ferramenta e classe; eventos com preço, mas não cobrados. As janelas são de 24 horas, 7 dias e 30 dias.
- O que foi solicitado no seu chat e quanto custou — a linha Chat na barra lateral de administração; abra uma conversa para ver sua transcrição e seu próprio detalhamento de custos.
- De um agente —
get_ai_usagepor meio do MCP.
Relacionado#
- Visão geral de análises — o bloco Spend e como ele se comporta com filtros
- Como funciona a medição — retenção e onde os dados ficam
- Eventos rastreados — os eventos de chat por trás dessas conversas
- Chat de IA — escolhendo um modelo e um provedor
- Como funcionam as traduções por IA — a outra coisa que consome este saldo
- Webhooks — sendo avisado de que você está se aproximando de um limite em vez de descobrir isso