Halluzinationen in der Unternehmens-KI: 5 Architektur-Maßnahmen, die wirken

KI-Halluzinationen vermeiden: Quellenpflicht, Retrieval-Qualität, Ich-weiß-es-nicht-Pfad, Datenbereinigung, Feedback-Loop. Praxis für Unternehmens-RAG.

/ Interne KI-Wissensdatenbank /

Autor
Onur Turp
Veröffentlicht
Aktualisiert
Aktualisiert
Lesezeit
3 Min. Lesezeit

Halluzinationen in der Unternehmens-KI lassen sich nicht eliminieren, aber architektonisch begrenzen. Fünf Maßnahmen wirken in der Praxis: Quellen-Zitierpflicht im Prompt und UI, Retrieval-Qualität durch bereinigte Indizes, ein expliziter „Ich weiß es nicht”-Pfad bei schwachem Treffer-Score, Datenbereinigung vor dem Index und ein Feedback-Loop im Betrieb. Zusammen senken sie die Rate selbstsicherer Falschaussagen von Demo-Niveau auf betriebstaugliche Zuverlässigkeit. Nentix implementiert das standardmäßig in KnowBase auf IONOS, weil Verlässlichkeit für uns als Entwicklungspartner aus Oberhausen wichtiger ist als beeindruckende Demo-Chats ohne Beleg.

Warum Skepsis berechtigt ist

LLMs sind Sprachmodelle, keine Datenbanken. Ohne Retrieval erfinden sie Antworten. Selbst mit Retrieval kann schlechte Datenlage zu falscher Synthese führen. Jeder Discovery-Call enthält deshalb die Frage: „Wie stellen Sie sicher, dass mein Team nicht Quatsch liest?”

Die ehrliche Antwort ist Architektur, nicht Marketing.

Maßnahme 1: Quellen-Zitierpflicht

Was: Jede Antwort enthält Verweise auf Dokument, Seite oder Abschnitt.
Wirkung: hoch für Vertrauen und Prüfbarkeit
Aufwand: mittel (UI + Prompt-Design)

Mitarbeitende müssen in zwei Klicks prüfen, ob die Quelle stimmt. Antworten ohne Quellen werden im UI als unvollständig markiert oder blockiert.

Maßnahme 2: Retrieval-Qualität

Was: Chunk-Größe, Top-K-Auswahl, Re-Ranking, Berechtigungs-Filter
Wirkung: sehr hoch auf inhaltliche Korrektheit
Aufwand: hoch in der Implementierung, laufend optimierbar

Schlechtes Retrieval ist die häufigste Ursache für „fast richtige” Falsche. Technische Dokumentation braucht andere Chunk-Strategien als Kurz-FAQs.

Maßnahme 3: „Ich weiß es nicht”-Pfad

Was: Bei niedrigem Similarity-Score antwortet das System mit Verweigerung statt Raterei
Wirkung: hoch für Risiko-Reduktion
Aufwand: gering

Lieber „dazu liegen keine Dokumente vor” als eine erfundene Reklamationsfrist. Geschäftsführung und DSB akzeptieren das eher als kreative Antworten.

Maßnahme 4: Datenbereinigung

Was: Cleaner-Agents, Duplikat-Entfernung, Versionslogik, OCR
Wirkung: sehr hoch, unterschätzt
Aufwand: mittel bis hoch

Details: Warum RAG-Projekte an Datenqualität scheitern.

Maßnahme 5: Feedback-Loop im Betrieb

Was: Daumen runter → Ticket → Fachowner prüft → Dokument oder Index korrigiert
Wirkung: mittel langfristig, hoch kumulativ
Aufwand: organisatorisch, nicht nur technisch

Ohne Loop wiederholt sich derselbe Fehler bei jeder ähnlichen Frage. Retainer ab 800 Euro monatlich bei Nentix enthält Support-Stunden für genau diese Optimierung.

Wirksamkeit auf einen Blick

MaßnahmeRisiko-ReduktionUser-VertrauenTypischer Fehler ohne sie
Quellenpflichtmittelsehr hochblindes Vertrauen
Retrieval-Qualitätsehr hochhoch„fast richtig” falsch
Verweigerungspfadhochmittelselbstsichere Lügen
Datenbereinigungsehr hochhochwidersprüchliche Antworten
Feedback-Loopkumulativhochwiederholte Fehler

Was nicht hilft

  • Teureres Modell allein ohne bessere Daten
  • Längere Prompts ohne Retrieval-Fix
  • Disclaimer „KI kann irren” ohne Quellenpflicht

Das sind Alibimaßnahmen, keine Architektur.

Use Cases mit höherer Fehlertoleranz

Marketing-Formulierungsvorschläge vertragen mehr Kreativität als Compliance- oder Sicherheitsfragen. Definieren Sie Risk-Klassen: Wo ist Quellenpflicht Pflicht, wo reicht Copilot-Style?

Use-Case-Orientierung: RAG im Mittelstand.

Regulatorischer Kontext

Der EU AI Act verschärft Dokumentations- und Aufsichtspflichten für bestimmte KI-Anwendungen. Nachvollziehbare Quellen und Logging unterstützen Compliance, ersetzen aber keine Rechtsberatung.

Monitoring im laufenden Betrieb

Definieren Sie KPIs für den Retainer:

  • Anteil Antworten mit Quellenbeleg
  • Anteil Verweigerungen („keine Dokumente gefunden”)
  • Anzahl negativer Feedbacks pro 100 Anfragen
  • Top-10-Fragen ohne satisfactory Antwort (Content-Lücken)

Operate-Retainer (1.500 Euro monatlich) bei Nentix enthält proaktive Optimierung dieser Kennzahlen, nicht nur Hosting.

Abgrenzung zu allgemeiner KI

Unternehmens-KI ist kein Ersatz für Google. Schulen Sie Teams, dass Fragen zu allgemeinem Weltwissen, Aktienkursen oder Live-Wetter nicht in Scope sind. Das reduziert Halluzinations-Druck, weil das Modell nicht raten muss, wo keine internen Dokumente existieren.

Nächster Schritt

Sie wollen keine Black Box im Intranet? Technische Umsetzung auf interne KI-Wissensdatenbank oder Potenzial-Check. Architektur-Fragen: Direkt mit uns sprechen.

Häufige Fragen

Kann man Halluzinationen vollständig eliminieren?

Nein. LLMs bleiben probabilistisch. Ziel ist nicht null Fehler, sondern nachweisbare Antworten mit Quellen, klare Verweigerung bei fehlender Basis und schnelle Korrektur über Feedback.

Was ist die wirksamste einzelne Maßnahme?

Datenqualität vor dem Index. Schlechte Dokumente erzeugen schlechtes Retrieval. Cleaner-Pipelines und aktuelle Versionen helfen mehr als teurere Modelle.

Müssen Antworten immer Quellen zeigen?

In Unternehmens-Kontext ja. Mitarbeitende müssen prüfen können, woher eine Aussage stammt. Antworten ohne Quellenangabe sollten als unvollständig gelten.

Was tun bei falscher Antwort im Betrieb?

Feedback-Button, Ticket an Fachowner, Index-Korrektur oder Dokument-Update. Ohne Loop wiederholt sich der Fehler bei jeder ähnlichen Frage.

Konkreter werden?

Im Potenzial-Check sehen Sie in 15 Minuten, welcher Hebel bei Ihnen zuerst Sinn ergibt. Wenn Sie lieber direkt sprechen möchten, erreichen Sie uns ohne Warteschleife.