
Bild: Olkeri
Von Olkeri.space
Warum KI halluziniert: selbstsichere KI-Fehler erkennen und verhindern
KI-Halluzination ist strukturell, kein vorübergehender Fehler. Warum Modelle Fakten erfinden, wo sich Fehler ballen und welche Prüfungen sie zuverlässig aufdecken.
Diesen Artikel lesen auf: English · Français · Español
Halluzination heißt es, wenn ein KI-System etwas Falsches mit voller Überzeugung behauptet. Es ist die folgenreichste Einschränkung heutiger Sprachmodelle und die am wenigsten verstandene bei denen, die sich auf sie stützen.
Entscheidend ist: Halluzination ist kein Mangel, der auf einen Patch wartet. Sie folgt unmittelbar aus der Arbeitsweise dieser Systeme, lässt sich also beherrschen und verringern, aber nicht wegdefinieren.
Warum sie auftritt:
Ein Sprachmodell ist darauf trainiert, wahrscheinlichen Text zu erzeugen, nicht wahren. Nichts in seinem Training unterscheidet eine richtige Aussage von einer falschen, die sich natürlich liest. Es gibt keine interne Datenbank zum Nachschlagen und keinen Mechanismus, eine Behauptung an der Wirklichkeit zu prüfen.
Wenn Sie um eine Quellenangabe bitten, hat das Modell das Muster aufgenommen, wie Quellenangaben aussehen: Autorennamen, ein plausibler Titel, eine Zeitschrift, ein Jahr. Eine zu erzeugen, die diesem Muster entspricht, ist genau das, wofür es trainiert wurde. Ob dieser Aufsatz existiert, ist eine Frage, die das System nie stellt.
Das erklärt auch ein widersinnig anmutendes Verhalten: Modelle halluzinieren bei entlegenen Themen oft besonders selbstsicher. Wo die Trainingsdaten dünn waren, ist das Muster schwach, doch das Modell erzeugt weiterhin flüssigen Text, weil es auf Flüssigkeit hin optimiert ist. Die Sicherheit der Ausgabe sagt nichts über ihre Richtigkeit.
Wo sich die Fehler ballen:
Erfindungen verteilen sich nicht gleichmäßig, und genau das macht sie beherrschbar.
Konkrete Zahlen sind riskant: Statistiken, Preise, Daten, Maße, Finanzkennzahlen. Modelle nähern Mengen aus Mustern an und liefern Zahlen, die vernünftig aussehen und häufig falsch sind.
Quellen und Belege sind die riskanteste Kategorie überhaupt. Erfundene Aufsätze, ausgedachte Rechtsprechung, nicht existierende Adressen und falsch zugeordnete Zitate sind außerordentlich häufig. Schriftsätze mit erfundenen Fundstellen haben in mehreren Rechtsordnungen zu Sanktionen geführt.
Aktuelle Ereignisse sind unzuverlässig, weil die Trainingsdaten einen Stichtag haben. Nach etwas Späterem gefragt, rät ein Modell möglicherweise, statt abzulehnen.
Einzelheiten über reale Personen und Organisationen, Lebensläufe, Amtsbezeichnungen, Zugehörigkeiten, wer was gesagt hat, werden häufig aus plausiblen Verknüpfungen zusammenfabuliert.
Umgekehrt ist das Risiko gering, wenn das Modell von Ihnen geliefertem Text umformt, ein Problem durchdenkt, dem Sie folgen können, oder sich in gut abgedecktem Allgemeinwissen bewegt. Der Unterschied liegt darin, ob die Antwort von abgerufenen Fakten abhängt oder von der Arbeit an Material, das ihm vorliegt.
Wie man sie erkennt:
Flüssigkeit ist kein Beleg. Halluzinierter Text liest sich genau wie zutreffender, denn beide entstehen auf dieselbe Weise. Nach dem Tonfall zu urteilen ist der mit Abstand häufigste Fehler.
Achten Sie auf übertriebene Genauigkeit bei schwer Wissbarem: ein exakter Prozentsatz in entlegenem Zusammenhang, ein präzises Datum für ein Randereignis, eine namentliche Quelle für eine unstrittige Aussage. Unnötige Präzision deutet oft auf Musterergänzung statt auf Erinnerung.
Stellen Sie dieselbe Frage in einem neuen Gespräch. Echtes Wissen ist eher stabil, Erfindung schwankt zwischen den Versuchen. Widersprüchliche Antworten auf eine Tatsachenfrage heißen: Das Modell weiß es nicht.
Prüfen Sie alles, worauf man sich stützen wird, beginnend mit den obigen Kategorien. Jede Quellenangabe, jede Zahl, jedes zugeschriebene Zitat.
Was tatsächlich hilft:
Liefern Sie das Ausgangsmaterial. Ein Modell, das ein von Ihnen bereitgestelltes Dokument liest und daraus antwortet, betreibt Textverständnis, worin es gut ist, statt Erinnerung, worin es schlecht ist. Das ist die größte einzelne Verbesserung und der Grund, warum Retrieval-Systeme betriebliche Einsätze dominieren.
Verlangen Sie Belege, die an den gelieferten Text gebunden sind. Muss ein System angeben, welche Stelle jede Behauptung stützt, werden unbelegte Aussagen sichtbar, statt sich einzufügen.
Erlauben Sie ausdrücklich, die Antwort zu verweigern. Auf Hilfsbereitschaft trainierte Modelle antworten im Zweifel. Anweisungen wie „wenn die Antwort nicht im gelieferten Material steht, sage das" erhöhen messbar die richtigen Verweigerungen.
Fragen Sie nach dem Gedankengang vor der Schlussfolgerung. Modelle, die ein Problem Schritt für Schritt durcharbeiten, machen bei mehrstufigen Fragen weniger Fehler, und der offengelegte Weg gibt Ihnen etwas zum Prüfen.
Grenzen Sie die Aufgabe ein. „Fasse dieses Dokument zusammen" ist weit sicherer als „erzähl mir von diesem Thema", denn das Erste hat eine überprüfbare Quelle und das Zweite nicht.
Wo das Risiko nicht hinnehmbar ist:
Manche Anwendungen dürfen sich überhaupt nicht auf ungeprüfte Modellausgaben stützen: juristische Fundstellen ohne Kontrolle, medizinische Ratschläge ohne fachliche Durchsicht, Finanzzahlen ohne Abgleich, Tatsachenbehauptungen zur Veröffentlichung ohne Quellenarbeit und jede Entscheidung, die Rechte oder Sicherheit eines Menschen berührt.
Das Muster ist in jedem öffentlich gewordenen Fehlschlag dasselbe. Jemand hielt flüssige Ausgabe für geprüfte Ausgabe. Die Technik verhielt sich genau wie vorgesehen; der Prozess um sie herum berücksichtigte ihre Arbeitsweise nicht.
Die realistische Haltung:
Neuere Modelle halluzinieren weniger als ältere, und Retrieval- und Denkverfahren haben den Abstand deutlich verringert. Das Problem ist seltener geworden, was es in einer Hinsicht gefährlicher macht: Seltene Fehler laden zur Nachlässigkeit ein, und der Fehler, nach dem man nicht mehr sucht, ist der, der beim Kunden landet.
Behandeln Sie diese Systeme wie eine außerordentlich fähige Kollegin, die gelegentlich etwas Falsches mit voller Überzeugung sagt, ohne es zu merken. Diese Sicht erzeugt die richtigen Gewohnheiten. Übertragen Sie großzügig, prüfen Sie alles Folgenreiche, und lassen Sie Selbstsicherheit nie als Beleg gelten.