KI-Chat für Dokumentation: selbst entwickeln oder kaufen?
Sie haben entschieden, dass Ihre Dokumentation einen KI-Chat benötigt. Die nächste Entscheidung ist wichtiger, als viele erwarten – sie bestimmt 3–6 Wochen Entwicklungsaufwand und die nächsten 18 Monate der Optimierung der Modellkosten.
Hier ist die ehrliche Kostenaufstellung für 2026.
Kurz gesagt#
| Selbst entwickeln | Kaufen | |
|---|---|---|
| Initialkosten | 3–6 Ingenieurswochen Entwicklungsaufwand | Einrichtungszeit, gemessen in Stunden |
| Monatliche Kosten | Vektorspeicher, Embeddings, Modellaufrufe und die zuständige Person | Ein Abonnement oder nutzungsabhängige Abrechnung, je nach Anbieter |
| Zeit bis zum Einsatz | Wochen bis Monate | Stunden |
| Anpassbarkeit | Vollständig | Hooks, System-Prompt, Anbieter |
| Wartung | Kontinuierlich — die Qualität des Abrufs nimmt ab, wenn sich die Dokumente ändern | Das Problem des Anbieters |
| Am besten geeignet für | Spezifische RAG-Anforderungen, Anwendungsfälle außerhalb von Dokumenten | Dokumentation im Speziellen |
Speziell für Dokumentation sollten Sie es kaufen. Entwickeln Sie es nur selbst, wenn Ihre Anforderungen an den KI-Chat über Dokumente hinausgehen — Wissensdatenbank + Produkthilfe + Support-Entlastung über mehrere Oberflächen hinweg.
Was „build it“ tatsächlich erfordert#
Eine produktionsreife RAG-Pipeline (Retrieval-Augmented Generation) für Dokumentationen besteht aus sechs Komponenten:
1. Inhaltsaufnahme#
- Überwache deine Dokumentationsquelle (GitHub, MDX-Ordner, CMS)
- In Abschnitte zerlegen (typischerweise 500–1500 Token)
- Markdown, Codeblöcke, Tabellen und Frontmatter verarbeiten
- Bei jeder Änderung neu indizieren, ohne alles neu zu erstellen
Technischer Aufwand: 1 Woche, wenn du es schon einmal gemacht hast, 2 Wochen, wenn nicht.
2. Einbettung#
- Ein Einbettungsmodell auswählen (OpenAI text-embedding-3-small, Cohere oder Open Source)
- Jeden Chunk einbetten
- Bei Änderungen an der Quelle erneut einbetten
- Ratenlimits und Batch-Verarbeitung handhaben
Engineering: 3–5 Tage.
3. Vektorspeicher#
- Speicher auswählen (Pinecone, Weaviate, pgvector, Qdrant, Turbopuffer)
- Schema-Design (Metadaten, Namespaces pro Arbeitsbereich)
- Abfrageleistung
- Backup- und Migrationsplan
Technische Umsetzung: 1 Woche. Laufende Infrastruktur: 50–300 $/Monat.
4. Abfrage-Pipeline#
- Die Benutzerabfrage einbetten
- Die Top-K-Chunks abrufen
- Ein Re-Ranking durchführen (oft ein zweiter Modellaufruf)
- Mit Kontext in einen Prompt formatieren
- Das LLM aufrufen
- Die Antwort parsen und zurückgeben
Engineering: 1–2 Wochen.
5. Frontend#
- Chat-UI-Komponente
- Verarbeitung von Streaming-Antworten
- Verknüpfungen von Zitaten mit den Quellseiten
- Konversationsgedächtnis
- Feedback-Widget (Daumen hoch/runter)
Entwicklung: 1 Woche.
6. Beobachtbarkeit und Analysen#
- Jede Abfrage und Antwort protokollieren
- Unbeantwortete Abfragen erfassen (Ihre zukünftigen Inhaltslücken)
- Negatives Feedback erfassen
- Kosten pro Abfrage
- Latenz P50/P95/P99
Entwicklung: 1 Woche.
Gesamt: mindestens 6 Entwicklerwochen, oft mehr als 10, sobald Sonderfälle hinzukommen.
Laufende Kosten von „selbst bauen“#
Pro Monat bei moderater Nutzung (1.000 Abfragen):
| Kosten | |
|---|---|
| Vektorspeicher | $50–300 |
| Einbettungs-API | $10–50 |
| LLM-API (GPT-4-Klasse) | $100–400 |
| Protokollierung/Beobachtbarkeit | $20–100 |
| Wartung durch das Engineering-Team (2 Stunden/Woche × $100/Std.) | $800 |
| Gesamt | $980–1.650/Monat |
Bei 10.000 Abfragen dominieren die Modellkosten. Bei 100.000 Abfragen benötigen Sie Caching, Ratenbegrenzung und möglicherweise ein kleineres Modell für kostengünstige Abfragen.
Wie „buy it“ aussieht#
Es gibt drei Kategorien von „buy it“:
Eigenständiges Dokumentations-Chat-Produkt#
Gib deine Dokumentations-URL ein und erhalte ein Chat-Widget. Beispiele: kapa.ai, Intercom Fin, benutzerdefinierte GPTs.
- Kosten: 30–500 $/Monat, abhängig vom Volumen
- Vorteile: unabhängig von deiner Dokumentationsplattform
- Nachteile: separates Dashboard, separate Abrechnung, separate Analysen, hat oft keinen Lesezugriff auf deine Quelldateien
Dokumentationsplattform mit integrierter KI#
Docsbook, Mintlify und GitBook bieten KI-Chat als Funktion an. Der Chat wird mit Ihren Inhalten trainiert und in die Benutzeroberfläche der Dokumentation integriert.
- Kosten: ein Abonnement bei Mintlify und GitBook, nutzungsabhängige KI-Kosten bei Docsbook — lesen Sie die jeweilige Preisseite des Anbieters
- Vorteile: eine Plattform, eine Rechnung, native Integration, eine Analyseansicht
- Nachteile: Ihre Wahl des Anbieters ist die Wahl der Plattform
Selbst gehostetes Open-Source-RAG#
Beispiele: Anything LLM, Chainlit, benutzerdefinierter LangChain-Stack. Sie hosten selbst und integrieren.
- Kosten: nur Hosting + Ihre Zeit
- Vorteile: vollständige Kontrolle
- Nachteile: derselbe Entwicklungsaufwand wie bei „Selbst entwickeln“, abzüglich Prompt Engineering
Wann Sie tatsächlich selbst entwickeln sollten#
Entwickeln Sie nur selbst, wenn einer oder mehrere dieser Punkte zutreffen:
- RAG aus mehreren Quellen — Sie möchten einen einzigen Chat, der Dokumente + Ihr CRM + Ihre Wissensdatenbank + den Slack-Verlauf durchsucht
- Strenge Anforderungen an den Speicherort — Jedes Byte muss in Ihrer VPC und unter Ihrer DPA bleiben
- Benutzerdefinierte Abruflogik — Ihre Inhalte haben eine Struktur (Graph, Hierarchie), die eine Standardlösung für den Abruf nicht nutzen kann
- Bereits vorhandene Plattform — Sie haben eine kundenorientierte KI-Oberfläche, die auf Dokumente erweitert werden muss
Wenn Dokumentation die einzige Oberfläche ist, kaufen Sie eine Lösung.
Was Sie im Docsbook-KI-Chat anpassen können#
Docsbook bietet Ihnen mehr Kontrolle als die meisten verwalteten Optionen:
- Anbieter — OpenAI, Anthropic, Gemini, OpenRouter. Verwenden Sie Ihren eigenen API-Schlüssel und wählen Sie Ihr Modell.
- System-Prompt — vollständiger Textersatz
- Pre-/Post-Hooks — fangen eine Anfrage vor dem Modellaufruf ab und verarbeiten die Antwort nach
- Nutzung — wird in Dollar gegen das Guthaben des Projekts abgerechnet; wenn das Guthaben aufgebraucht ist, hört der Assistent auf zu antworten, statt weitere Kosten zu berechnen
Wenn diese Stellschrauben nicht mehr ausreichen, ändert sich die Rechnung für „selbst bauen“ – aber die meisten Teams tun das nicht.
Die tatsächliche Entscheidung#
Drei Fragen, in dieser Reihenfolge:
- Sind Dokumentationen die einzige KI-Oberfläche, die Sie benötigen? Ja → kaufen. Nein → die Entwicklung in Betracht ziehen, da die Pipeline dann über mehrere Oberflächen hinweg gemeinsam genutzt wird.
- Haben Sie jemanden, der in den nächsten achtzehn Monaten für die Qualität der Suche verantwortlich sein wird? Nein → kaufen. Die Pipeline ist nicht der schwierige Teil; schwierig ist es, die Qualität ihrer Antworten bei Änderungen an der Dokumentation aufrechtzuerhalten.
- Sind die Abonnementkosten im Vergleich zur Zeit eines Entwicklers erheblich? Vergleichen Sie die Kosten der Plattform für einen Monat mit den Kosten für einen Tag der Person, die sie andernfalls warten müsste, und verwenden Sie dabei Ihre eigenen Zahlen.
Für die meisten Teams ist der Kauf aus einem strukturellen Grund die richtige Entscheidung: KI für Dokumentationen ist eine Verpflichtung zur Wartung, kein Entwicklungsprojekt. Die Teams, die selbst entwickeln sollten, sind diejenigen, die ein umfassenderes KI-Produkt entwickeln, bei dem die Dokumentation nur eine von mehreren Oberflächen ist.
Weiterführende Lektüre#
- KI-Dokumentationsplattformen im Vergleich (2026)
- Dokumentationsanalysen: Was Sie 2026 erfassen sollten
- Best Practices für API-Dokumentation im Jahr 2026
Docsbook-KI-Chat: Verwenden Sie Ihren eigenen Anbieter, legen Sie Ihren eigenen System-Prompt fest und greifen Sie vor und nach dem Modellaufruf in die Anfrage ein. Die Kosten werden in US-Dollar vom Guthaben des Projekts abgezogen, statt als Tarif verkauft zu werden — aktuelle Zahlen unter docsbook.io/pricing.