Halluzinationen in der Unternehmens-KI lassen sich nicht eliminieren, aber architektonisch begrenzen. Fünf Maßnahmen wirken in der Praxis: Quellen-Zitierpflicht im Prompt und UI, Retrieval-Qualität durch bereinigte Indizes, ein expliziter „Ich weiß es nicht”-Pfad bei schwachem Treffer-Score, Datenbereinigung vor dem Index und ein Feedback-Loop im Betrieb. Zusammen senken sie die Rate selbstsicherer Falschaussagen von Demo-Niveau auf betriebstaugliche Zuverlässigkeit. Nentix implementiert das standardmäßig in KnowBase auf IONOS, weil Verlässlichkeit für uns als Entwicklungspartner aus Oberhausen wichtiger ist als beeindruckende Demo-Chats ohne Beleg.
Warum Skepsis berechtigt ist
LLMs sind Sprachmodelle, keine Datenbanken. Ohne Retrieval erfinden sie Antworten. Selbst mit Retrieval kann schlechte Datenlage zu falscher Synthese führen. Jeder Discovery-Call enthält deshalb die Frage: „Wie stellen Sie sicher, dass mein Team nicht Quatsch liest?”
Die ehrliche Antwort ist Architektur, nicht Marketing.
Maßnahme 1: Quellen-Zitierpflicht
Was: Jede Antwort enthält Verweise auf Dokument, Seite oder Abschnitt.
Wirkung: hoch für Vertrauen und Prüfbarkeit
Aufwand: mittel (UI + Prompt-Design)
Mitarbeitende müssen in zwei Klicks prüfen, ob die Quelle stimmt. Antworten ohne Quellen werden im UI als unvollständig markiert oder blockiert.
Maßnahme 2: Retrieval-Qualität
Was: Chunk-Größe, Top-K-Auswahl, Re-Ranking, Berechtigungs-Filter
Wirkung: sehr hoch auf inhaltliche Korrektheit
Aufwand: hoch in der Implementierung, laufend optimierbar
Schlechtes Retrieval ist die häufigste Ursache für „fast richtige” Falsche. Technische Dokumentation braucht andere Chunk-Strategien als Kurz-FAQs.
Maßnahme 3: „Ich weiß es nicht”-Pfad
Was: Bei niedrigem Similarity-Score antwortet das System mit Verweigerung statt Raterei
Wirkung: hoch für Risiko-Reduktion
Aufwand: gering
Lieber „dazu liegen keine Dokumente vor” als eine erfundene Reklamationsfrist. Geschäftsführung und DSB akzeptieren das eher als kreative Antworten.
Maßnahme 4: Datenbereinigung
Was: Cleaner-Agents, Duplikat-Entfernung, Versionslogik, OCR
Wirkung: sehr hoch, unterschätzt
Aufwand: mittel bis hoch
Details: Warum RAG-Projekte an Datenqualität scheitern.
Maßnahme 5: Feedback-Loop im Betrieb
Was: Daumen runter → Ticket → Fachowner prüft → Dokument oder Index korrigiert
Wirkung: mittel langfristig, hoch kumulativ
Aufwand: organisatorisch, nicht nur technisch
Ohne Loop wiederholt sich derselbe Fehler bei jeder ähnlichen Frage. Retainer ab 800 Euro monatlich bei Nentix enthält Support-Stunden für genau diese Optimierung.
Wirksamkeit auf einen Blick
| Maßnahme | Risiko-Reduktion | User-Vertrauen | Typischer Fehler ohne sie |
|---|---|---|---|
| Quellenpflicht | mittel | sehr hoch | blindes Vertrauen |
| Retrieval-Qualität | sehr hoch | hoch | „fast richtig” falsch |
| Verweigerungspfad | hoch | mittel | selbstsichere Lügen |
| Datenbereinigung | sehr hoch | hoch | widersprüchliche Antworten |
| Feedback-Loop | kumulativ | hoch | wiederholte Fehler |
Was nicht hilft
- Teureres Modell allein ohne bessere Daten
- Längere Prompts ohne Retrieval-Fix
- Disclaimer „KI kann irren” ohne Quellenpflicht
Das sind Alibimaßnahmen, keine Architektur.
Use Cases mit höherer Fehlertoleranz
Marketing-Formulierungsvorschläge vertragen mehr Kreativität als Compliance- oder Sicherheitsfragen. Definieren Sie Risk-Klassen: Wo ist Quellenpflicht Pflicht, wo reicht Copilot-Style?
Use-Case-Orientierung: RAG im Mittelstand.
Regulatorischer Kontext
Der EU AI Act verschärft Dokumentations- und Aufsichtspflichten für bestimmte KI-Anwendungen. Nachvollziehbare Quellen und Logging unterstützen Compliance, ersetzen aber keine Rechtsberatung.
Monitoring im laufenden Betrieb
Definieren Sie KPIs für den Retainer:
- Anteil Antworten mit Quellenbeleg
- Anteil Verweigerungen („keine Dokumente gefunden”)
- Anzahl negativer Feedbacks pro 100 Anfragen
- Top-10-Fragen ohne satisfactory Antwort (Content-Lücken)
Operate-Retainer (1.500 Euro monatlich) bei Nentix enthält proaktive Optimierung dieser Kennzahlen, nicht nur Hosting.
Abgrenzung zu allgemeiner KI
Unternehmens-KI ist kein Ersatz für Google. Schulen Sie Teams, dass Fragen zu allgemeinem Weltwissen, Aktienkursen oder Live-Wetter nicht in Scope sind. Das reduziert Halluzinations-Druck, weil das Modell nicht raten muss, wo keine internen Dokumente existieren.
Nächster Schritt
Sie wollen keine Black Box im Intranet? Technische Umsetzung auf interne KI-Wissensdatenbank oder Potenzial-Check. Architektur-Fragen: Direkt mit uns sprechen.
Häufige Fragen
Kann man Halluzinationen vollständig eliminieren?
Nein. LLMs bleiben probabilistisch. Ziel ist nicht null Fehler, sondern nachweisbare Antworten mit Quellen, klare Verweigerung bei fehlender Basis und schnelle Korrektur über Feedback.
Was ist die wirksamste einzelne Maßnahme?
Datenqualität vor dem Index. Schlechte Dokumente erzeugen schlechtes Retrieval. Cleaner-Pipelines und aktuelle Versionen helfen mehr als teurere Modelle.
Müssen Antworten immer Quellen zeigen?
In Unternehmens-Kontext ja. Mitarbeitende müssen prüfen können, woher eine Aussage stammt. Antworten ohne Quellenangabe sollten als unvollständig gelten.
Was tun bei falscher Antwort im Betrieb?
Feedback-Button, Ticket an Fachowner, Index-Korrektur oder Dokument-Update. Ohne Loop wiederholt sich der Fehler bei jeder ähnlichen Frage.