Docsbook
Aperçu

Utilisation et coût de l’IA

L’IA facturée à l’usage est la seule partie d’un produit de documentation où un chiffre erroné coûte réellement de l’argent au propriétaire. Cette page explique le mécanisme : ce qui est mesuré, comment un appel est tarifé, quel solde est débité, ce que vous pouvez voir ensuite et pourquoi les chiffres affichés sur deux écrans différents peuvent légitimement différer.

Ce que vous obtenez#

Chaque appel d’IA effectué par votre projet — une question d’un lecteur, votre propre question dans le panneau, une traduction, une opération d’embedding, une étape d’agent — écrit une ligne indiquant la surface qui l’a dépensé, le modèle exécuté, les jetons entrants et sortants, ce que le fournisseur a facturé et ce qui a été débité de votre solde. Chaque appel d’outil MCP facturé à l’usage écrit sa propre ligne indiquant l’outil et sa catégorie de facturation.

À partir de ces lignes, vous pouvez consulter les dépenses par modèle, par surface, par catégorie budgétaire, par conversation, par langue et page traduites et par outil MCP — ainsi qu’une série quotidienne pour chacune d’elles. La tuile principale Dépenses de la vue d’ensemble des analyses correspond à la somme des deux registres.

La consultation de ces données est gratuite. Répondre à un lecteur ne l’est pas.

Qu'est-ce qui dépense le solde et qu'est-ce qui ne le dépense pas#

La consommation est mesurée en argent, pas en requêtes : chaque appel consomme le montant auquel il a été facturé, de sorte que choisir un modèle moins cher permet d'aller plus loin avec le même solde. C'est à cela que sert le sélecteur de modèle, et il est disponible avec tous les forfaits.

Dépense le solde du projet Ne coûte rien
Une réponse d'IA donnée à un lecteur dans le chat La consultation de n'importe quel rapport d'analyse
Une question que vous posez à l'assistant dans le panneau L'hébergement et la diffusion de votre documentation
Les suggestions de suivi et les titres des conversations La diffusion d'une page déjà traduite
La traduction d'une page Les paramètres de marque, de thème, de navigation et de SEO
La création de l'index sémantique et de ses embeddings L'enregistrement d'un webhook et la réception de ses livraisons
L'exécution d'un agent en arrière-plan Les appels de découverte MCP — déterminer ce que le serveur peut faire
Un appel d'outil MCP mesuré Les événements des lecteurs sur votre site de documentation

Les événements des lecteurs sont tarifés, mais jamais facturés. La vue Utilisation affiche un chiffre à côté de chaque catégorie d'événements afin que vous puissiez voir ce qu'implique votre trafic, et rien ne le déduit de quoi que ce soit. L'argent facturé et l'argent uniquement mesuré sont conservés dans des totaux distincts, précisément pour qu'un écran ne puisse jamais présenter le second comme une facture.

Les appels effectués avec votre propre clé de fournisseur sont mesurés, mais pas facturés. La ligne est tout de même enregistrée — avec le coût réel du fournisseur, votre modèle et votre nombre de jetons — et tarifée à zéro plutôt que supprimée, car l'absence d'un modèle dans le détail simplement parce qu'il utilise votre clé donnerait l'impression que « nous ne l'avons jamais appelé ». Ces appels sont également comptabilisés séparément, de sorte qu'un $0 à côté d'un volume réel est expliqué plutôt que de sembler défectueux. Utiliser votre propre clé ne modifie pas ce qui est inclus dans votre forfait.

Comment c’est construit#

Deux grands livres facturés, délibérément pas une seule table#

Grand livre Une ligne par Champs clés
Facture de tokens Appel LLM surface (ai-chat, agent-chat, translate, embed, followups, title, other), catégorie budgétaire (users, admin, translations, embeddings), modèle, tokens de prompt/de complétion/au total, coût fournisseur, majoration figée au moment de l’appel, durée, identifiant de conversation, indicateur de clé propre, indicateur de prix estimé ; les traductions ajoutent la langue, la page et le nombre de blocs retraduits par rapport à ceux réutilisés
Facture d’appel MCP Appel d’outil nom de l’outil, classe de facturation figée au moment de l’appel, prix catalogue, durée, indication de la réussite de l’appel, exécution en arrière-plan qui l’a effectué

Il s’agit de tables distinctes, car un appel MCP ne génère aucune facture de tokens — il possède un nom, une classe et un prix catalogue fixe — et parce qu’une grande partie des appels MCP (découverte, listage de vos projets) n’appartient à aucun projet. Enregistrer ces appels sur un projet arbitraire constituerait une attribution inventée que le graphique d’utilisation présenterait ensuite comme un fait.

Comment le coût d'un appel est calculé#

  1. Le coût déclaré par le fournisseur prévaut. Lorsque le fournisseur indique le coût de l'appel, ce montant est utilisé tel quel et la ligne n'est pas marquée comme estimée. Il fait autorité d'une manière qu'un calcul local ne peut pas garantir, car il prend déjà en compte les remises liées au cache de prompts et les changements de prix en cours de route.
  2. Sinon, le tarif catalogue du modèle. Les nombres réels de tokens d'entrée et de sortie provenant de la réponse sont multipliés par le tarif d'entrée et de sortie de ce modèle par million de tokens. Douze modèles de chat figurent dans le catalogue avec leurs propres tarifs, auxquels s'ajoute un catalogue distinct pour les embeddings.
  3. Un modèle non reconnu utilise un tarif de repli délibérément pessimiste et la ligne est marquée estimated, afin que chaque interface puisse l'indiquer comme une estimation plutôt que de le présenter comme un fait. La recherche de modèle utilise uniquement une correspondance exacte, jamais floue : la correspondance par sous-chaîne a un jour tarifé un modèle -mini comme s'il s'agissait de son homonyme de taille normale.

Une majoration est ensuite appliquée et figée sur la ligne, afin que les lignes historiques restent exactes si le tarif venait à changer.

Les nombres de tokens proviennent du propre rapport d'utilisation de l'API du modèle. Docsbook ne les approxime pas à partir de la longueur du texte.

Les millicents et l’arrondi qui compte#

Le coût du fournisseur est stocké en millicents — un millième de centime — car une réponse bon marché ne coûte qu’une petite fraction de centime et les centimes entiers arrondiraient presque chaque ligne à zéro, ce qui fausserait le graphique de ventilation.

Ce qui sort du portefeuille est exprimé en centimes entiers. La déduction est arrondie à l’entier inférieur en centimes et conserve le reste dans le projet, afin qu’une centaine de réponses coûtant moins d’un centime finissent par dépenser un centime au lieu d’être soit offertes, soit surfacturées. L’argent est dépensé dans un ordre précis : d’abord le crédit d’essai, puis le quota mensuel, puis tout solde ponctuel.

Une conséquence visible à l’écran. La colonne qui indique ce qui a réellement quitté le portefeuille lors de cet appel contient 0 sur presque chaque ligne, car les appels coûtant moins d’un centime ne font que déplacer le report. Les interfaces plus récentes — la tuile Dépenses et la vue Utilisation — reconstituent donc le prix catalogue de chaque ligne à partir du coût du fournisseur et de la majoration figée au lieu de totaliser cette colonne, tandis que deux anciens écrans la totalisent encore. Lorsque ces deux valeurs divergent, le montant reconstitué est le plus honnête.

Que se passe-t-il lorsque le solde est épuisé#

Docsbook fonctionne selon un modèle de paiement à l’usage. Le solde ne se recharge pas automatiquement, et rien ne change sur votre site lorsqu’il est épuisé — seul le travail de l’IA s’arrête, et il s’arrête à l’endroit qui peut l’expliquer :

Surface Ce qui se passe
Chat lecteur La requête est refusée avant l’exécution du modèle, avec un code motif plutôt qu’une réponse défaillante
Boucle de l’agent d’administration Le solde est vérifié avant la boucle et avant chaque itération, afin qu’un long tour ne puisse pas épuiser le solde en cours d’exécution
Exécutions d’agent L’exécution est enregistrée comme ayant échoué avec une phrase compréhensible — le solde est épuisé, rechargez-le et elle s’exécutera à nouveau lors de son prochain déclenchement
Traduction par lots La tâche s’arrête et l’indique ; les pages restantes ne sont pas traduites, et non ignorées silencieusement
Index sémantique Refusé avant même l’ouverture de la ligne de tâche
Outils MCP Un refus structuré indiquant l’outil, sa catégorie de facturation, le projet, le prix par appel, le solde restant et un lien de recharge. Les outils de découverte continuent de fonctionner

Comme il s’agit de vérifications et non de réservations, un portefeuille peut dépasser le solde nul de tout au plus un appel ; le suivant est refusé par mesure de sécurité.

Le dépassement est une alternative à l’arrêt strict, et il est activé volontairement et réservé aux forfaits payants. Il est plafonné, facturé à intervalles fixes et vous avertit à mesure que vous approchez du plafond à 75 %, 85 %, 90 %, 95 % et 100 % de celui-ci via les webhooks d’utilisation. Les traductions et l’index sémantique ne l’utilisent délibérément jamais : une exécution d’index est une action importante, délibérée et annulable, et la transformer discrètement en facture de dépassement serait abusif.

La page Chat#

La page Chat indique ce qui a été demandé à votre assistant et le coût des réponses, sur un même ensemble de conversations sans contrôle d’intervalle — les tuiles et la liste qui se trouve dessous ne peuvent donc jamais décrire des ensembles différents.

Tuile Description
Chiffre d’affaires Valeur des lecteurs qui ont utilisé le chat, comptabilisés une seule fois par lecteur, selon la même échelle que celle utilisée par Objectifs et la colonne Potentiel
Coût Montant facturé pour l’exécution du chat sur la même période, selon le registre d’utilisation
Économies Coût du support évité, calculé à partir des conversations auxquelles une réponse a été apportée — une estimation, basée sur un tarif de ticket par défaut du secteur, et non sur votre coût mesuré
Questions Fils de discussion lancés par les lecteurs
Répondu Part des conversations dans lesquelles un modèle, après relecture de la transcription, estime que le lecteur a effectivement obtenu une réponse

« Répondu » est déterminé par lecture, et non déduit. L’ancien signal — clic sur une citation, mention « J’aime », clic sortant — est un indicateur indirect qui se trompe dans les deux sens : un lecteur qui a obtenu une réponse parfaite mais n’a rien cliqué est considéré comme non évalué, tandis qu’un lecteur qui a cliqué sur une page citée sans la lire est considéré comme ayant obtenu une réponse. Un modèle distinct relit chaque transcription. Les verdicts sont enregistrés une fois puis réutilisés, et seules quelques nouvelles conversations sont évaluées à chaque chargement de page ; la valeur se précise donc au fil de quelques visites au lieu de faire expirer la première. Avec moins de cinq conversations évaluées, la tuile revient à l’ancienne méthode de lecture et l’indique. Une conversation encore en attente apparaît comme non évaluée, jamais comme restée sans réponse.

Survolez une tuile pour afficher sa valeur des dernières 24 heures lorsqu’elle est disponible ; « Répondu » affiche un nombre (« 2 sur 3 ») plutôt qu’un pourcentage, car sur une seule journée, un pourcentage varie par points entiers pour chaque conversation. Le chiffre d’affaires et le coût n’ont pas de valeur journalière distincte — tous deux sont calculés sur la période déjà affichée à l’écran.

Pourquoi est-ce la bonne méthode#

Règle Pourquoi cela fonctionne Source
Privilégier le coût indiqué par le fournisseur plutôt qu'un coût calculé localement OpenRouter renvoie le champ de coût comme étant « Le montant total facturé sur votre compte », avec cost_details.upstream_inference_cost — « Le coût réel facturé par le fournisseur d'IA en amont ». Un recalcul local ne peut connaître ni l'un ni l'autre OpenRouter : comptabilisation de l'utilisation
Un prix recalculé à partir du nombre de jetons est incorrect dès qu'une mise en cache s'applique OpenAI facture les jetons de prompt réutilisés au « tarif réduit des entrées mises en cache du modèle pour les jetons réutilisés, avec une remise pouvant atteindre 90 % », ce qui est indiqué séparément dans les détails d'utilisation de la réponse OpenAI : mise en cache des prompts
Comptabiliser les appels d'outils individuellement et enregistrer également les échecs La spécification MCP confie la limitation du débit au serveur — les serveurs « DOIVENT … limiter le débit des invocations d'outils » — et demande aux clients de « consigner l'utilisation des outils à des fins d'audit ». Un registre qui n'enregistrerait que les réussites ne respecterait aucune de ces exigences Spécification MCP : outils
Stocker les montants inférieurs au centime avec une précision inférieure au centime Chaque montant honnête par appel présenté ici est une fraction de centime ; arrondir dès l'enregistrement est la manière dont une dépense réelle d'une journée devient $0 Mécanisme, cette page

Limites et questions ouvertes#

  • Vous ne pouvez pas ventiler les dépenses par fournisseur. Le registre enregistre le modèle, et non le fournisseur qui se trouve derrière, de sorte qu'une question comme « combien a été versé à Anthropic » n'a actuellement aucune réponse dans le produit.
  • Vous ne pouvez pas encore voir les dépenses par exécution d'agent dans le registre des jetons. Les lignes MCP contiennent l'exécution qui les a déclenchées ; les lignes de jetons ne contiennent qu'un identifiant de conversation libre, de sorte que la facture de modèle d'un agent est regroupée par conversation plutôt que par exécution.
  • Les lignes marquées estimated sont des estimations, et le taux de repli est délibérément élevé. Un modèle absent du catalogue est tarifé de manière pessimiste à dessein — facturer trop peu à un client pour un modèle dont personne n'a fixé le prix serait une erreur plus grave — de sorte qu'une ligne estimée constitue une limite supérieure, et non une mesure.
  • Deux écrans plus anciens additionnent encore la colonne des centimes déduits et sous-estiment donc les projets dont les appels coûtent principalement moins d'un centime. La tuile Dépenses et la vue Utilisation recalculent plutôt le prix catalogue. Si deux montants de dépenses diffèrent, c'est la raison.
  • Les économies sont une estimation et sont présentées comme telles. Elles multiplient le nombre de conversations ayant reçu une réponse par le coût par défaut d'un ticket d'assistance dans le secteur. Ce n'est pas votre coût d'assistance, et Docsbook n'a pas mesuré le vôtre.
  • Les dépenses liées à vos propres clés sont invisibles en tant que montant. Ces appels affichent le volume, la répartition des modèles et le nombre de jetons, ainsi que $0. Leur coût réel figure sur la facture de votre fournisseur.
  • Les rapports et la fenêtre de conservation n'ont pas la même durée. Le panneau n'affiche jamais plus de 30 jours d'utilisation, conformément à la période couverte par les analyses des lecteurs. Le registre d'IA lui-même est conservé pendant 90 jours — cette marge supplémentaire permet de reconstituer une facture contestée — et il est élagué quotidiennement. Les lignes d'appels MCP ne sont actuellement jamais élaguées, c'est pourquoi la vue par outil couvre toute la période.
  • Point à nuancer : les « économies » et les « revenus » sont des modèles, le « coût » est une mesure. Ce qui est vérifiable, c'est le registre : quel modèle a été exécuté, ce que le fournisseur a facturé, ce qui a été débité du solde. Ce qui n'est pas vérifiable à partir de ces données, c'est de savoir si une question ayant reçu une réponse aurait autrement donné lieu à un ticket d'assistance, ou si un lecteur ayant utilisé le chat n'aurait autrement pas acheté. Considérez les deux montants entrants comme des classements entre lecteurs, jamais comme des liquidités.

Quel forfait#

L'assistant destiné aux lecteurs, les exécutions d'agents et les traductions automatiques sont les fonctionnalités qui dépensent de l'argent via la clé de fournisseur de Docsbook, et ce sont celles qui sont payantes. Tout le reste de cette page — les registres, les ventilations, le sélecteur de modèle, l'utilisation de votre propre clé, MCP — est disponible avec tous les forfaits, et MCP en particulier n'est soumis à aucune restriction de forfait : l'argent est la seule limite. Les forfaits et tarifs actuels sont disponibles sur la page des tarifs.

Où regarder#

  1. Dépenses au fil du temps, à côté de votre trafic — la tuile Dépenses de la vue d’ensemble des analyses.
  2. À quoi l’argent a été consacré — la vue Utilisation : l’IA par surface, catégorie et modèle ; MCP par outil et classe ; événements tarifés mais non facturés. Les périodes sont de 24 heures, 7 jours et 30 jours.
  3. Ce qui a été demandé à votre chat et son coût — la ligne Chat dans la barre latérale d’administration ; ouvrez une conversation pour afficher sa transcription et sa propre ventilation des coûts.
  4. Depuis un agentget_ai_usage via MCP.

Updated

Cette page vous a-t-elle été utile ?