Leitfaden: KI im Unternehmen › Recht, Risiko und Ethik der KI
KI-Halluzinationen sind Antworten, in denen ein Sprachmodell mit voller Überzeugung Unwahres behauptet: eine erfundene Tatsache, eine nicht existierende Quelle, ein falsches Zitat oder eine falsche Zahl. Ganz verschwinden werden sie nicht. Man kann sie jedoch stark eindämmen und abfangen, bevor sie Kunden, Journalisten oder die Geschäftsführung erreichen. Dieser Text zeigt, woher sie kommen, wie häufig sie auftreten und welcher einfache Prozess Ihr Unternehmen schützt.
In 60 Sekunden Halluzinationen auf einen Blick
- Was es ist: eine selbstsichere, aber falsche Antwort des Modells, vom erfundenen Datum bis zur nicht existierenden Veröffentlichung.
- Für wen: jeden, der einen mit KI erstellten Text nach außen gibt, in der Praxis am häufigsten Menschen aus Marketing, PR und Kundenservice, die viel und unter Zeitdruck schreiben.
- Die erste Gewohnheit: Was sich prüfen lässt (eine Zahl, ein Name, ein Zitat, eine Quelle), prüft ein Mensch, bevor der Text das Unternehmen verlässt.
- Der häufigste Fehler: Vertrauen in den selbstsicheren Ton. Das Modell klingt gleich, ob es recht hat oder fantasiert.
- Wer für den Fehler zahlt: das Unternehmen, nicht „das System“. Das zeigte der Fall Air Canada aus dem Jahr 2024.
Was sind KI-Halluzinationen?
Halluzinationen künstlicher Intelligenz (engl. AI hallucination, bei Sprachmodellen auch LLM hallucination) sind Situationen, in denen ein Modell eine glaubwürdig klingende, aber falsche Antwort erzeugt. OpenAI definiert sie als „plausible, aber falsche Aussagen, die von Sprachmodellen erzeugt werden“. Ein LLM, also ein großes Sprachmodell, ist die Engine hinter ChatGPT, Gemini oder Copilot. Den größeren Zusammenhang, von der Auswahl der Tools bis zur Einführung im Team, haben wir zusammengestellt in Leitfaden zu künstlicher Intelligenz im Unternehmen.
Eine Halluzination ist keine Lüge im menschlichen Sinne. Das Modell weiß nicht, dass es sich irrt. Es sagt die wahrscheinlichste Wortfolge voraus, und diese Folge ergibt manchmal einen nicht existierenden Bericht, ein Markteinführungsdatum, das es nie gab, oder ein Zitat des Vorstandschefs, das nie jemand gesagt hat. Das Schlimmste? Eine falsche Antwort klingt genauso selbstsicher wie eine richtige.
- Erfundene Fakten. Ein Datum, eine Zahl, ein Name oder ein Finanzergebnis, das es nie gab.
- Erfundene KI-Quellen. Der Titel eines Artikels, Berichts oder Urteils, den es nicht gibt, oft mit einer glaubwürdig aussehenden Webadresse.
- Falsche Zuordnung. Die Quelle ist echt, sagt aber nicht das, was das Modell behauptet.
- Veraltete Informationen. Ein Stand von vor einigen Monaten, als aktuell dargestellt.
Warum KI Dinge erfindet
Im September 2025 veröffentlichte OpenAI eine Analyse der Ursachen von Halluzinationen bei Sprachmodellen. Die Schlussfolgerung ist einfach und etwas unbequem: Modelle werden so trainiert und bewertet, dass sich Raten für sie lohnt. Belohnt ein Test nur richtige Antworten, bringt „ich weiß es nicht“ immer null Punkte, ein Treffer ins Blaue dagegen zumindest eine gewisse Chance. Also lernt das Modell zu raten.
Der zweite Grund ist die Art, wie ein Modell sich „erinnert“. Allgemeine Sprachmuster beherrscht es gut: Grammatik, Stil, typische Assoziationen. Seltene Einzelfakten, etwa das Gründungsdatum eines mittelständischen Unternehmens aus dem Karpatenvorland oder den Namen seines Vertriebsleiters, hat es in seinen Daten einmal oder gar nicht gesehen, und genau dort halluzinieren ChatGPT und andere Chatbots am häufigsten.
Der dritte Grund liegt beim Fragenden. Ein Prompt mit versteckter These („Nenne drei Studien, die belegen …“) verleitet das Modell dazu, die Antwort anzupassen, statt zu widersprechen. Wie man Prompts schreibt, die das nicht provozieren, zeigen wir in unserem Leitfaden zu Prompts für das Marketing.
Wie oft ChatGPT und andere Modelle halluzinieren
Die eine Zahl gibt es nicht. Die Halluzinationsrate hängt vom Modell ab, von der Art der Aufgabe und davon, ob das Modell Quelldokumente vor sich hat. Unten finden Sie drei unabhängige Messungen, die das Ausmaß gut zeigen.
| Messung | Was untersucht wurde | Ergebnis |
|---|---|---|
| OpenAI, September 2025 | Antworten auf kurze Faktenfragen (SimpleQA-Test) | o4-mini: 75 % Fehler bei 1 % Verweigerungen; gpt-5-thinking-mini: 26 % Fehler bei 52 % Verweigerungen |
| Stanford RegLab und HAI, Mai 2024 | spezialisierte KI-Tools für juristische Recherche | von über 17 % bis über 34 % der Antworten mit Halluzinationen |
| Vectara, Mai 2026 | Zusammenfassen eines bereitgestellten Dokuments | von 1,8 % bis 24,2 % der Zusammenfassungen mit Halluzinationen, je nach Modell |
Zwei bekannte Fälle, in denen eine Halluzination ein Unternehmen teuer zu stehen kam
Im Februar 2024 entschied ein kanadisches Tribunal im Fall Moffatt gegen Air Canada. Der Chatbot auf der Website der Fluggesellschaft hatte einem Kunden fälschlich mitgeteilt, er könne einen Trauerfall-Rabatt auf sein Ticket innerhalb von 90 Tagen nach der Reise beantragen. Die Airline argumentierte, der Chatbot sei eine „eigenständige Einheit“, die für ihre Aussagen selbst verantwortlich sei. Das Tribunal wies das zurück: Das Unternehmen haftet für die Informationen auf seiner Website, unabhängig davon, ob ein Mensch oder ein Programm sie gegeben hat. Die Entschädigung war gering, rund 650 kanadische Dollar. Trotzdem ging der Fall um die Welt.
Im Herbst 2025 erklärte sich Deloitte bereit, die letzte Honorarrate für einen Bericht an die australische Regierung zurückzuzahlen. In dem Dokument wurden unter anderem nicht existierende wissenschaftliche Publikationen und ein erfundenes Zitat aus einem Gerichtsurteil entdeckt, und das Unternehmen räumte ein, bei der Arbeit das Modell GPT-4o genutzt zu haben. Die Fehler fand ein Wissenschaftler der Universität Sydney.
Was haben beide Fälle gemeinsam? Eine Halluzination ist kein technisches Problem mehr, sobald sie beim Kunden ankommt. Ab diesem Moment ist sie eine Frage der Reputation und muss auch so behandelt werden, mit einer vorbereiteten Stellungnahme und einer Person, die sie vertritt. Wie Sie sich darauf vorbereiten, bevor etwas passiert, beschreiben wir in unserem Leitfaden zur Krisen-PR-Management.
Für wen Halluzinationen ein Problem sind und in welchen Situationen
Das Risiko steigt an zwei Stellen: dort, wo KI-Inhalte ungeprüft das Unternehmen verlassen, und dort, wo jemand auf ihrer Grundlage eine Entscheidung trifft. Stellen Sie sich vor der Veröffentlichung eine Frage: Steht im Text etwas, das ein Journalist oder Kunde in fünf Minuten überprüfen kann? Wenn ja, prüfen Sie es zuerst selbst.
| Situation | Halluzinationsrisiko | Was zu tun ist |
|---|---|---|
| Pressemitteilung mit Marktdaten | hoch (Zahlen und Quellen) | jede Zahl im Original prüfen, Quelle mit Datum angeben |
| Kundenservice-Chatbot zu Preisen und Konditionen | hoch, weil das Unternehmen für die Antwort haftet | der Chatbot antwortet nur aus einer freigegebenen Wissensdatenbank |
| Zusammenfassung eines langen Berichts | mittel (Auslassungen und Verzerrungen) | die Kernaussagen mit dem Original vergleichen |
| Entwurf eines Posts oder Kampagnen-Headlines | gering, wenige Fakten | normales Redigieren |
| Wettbewerbsanalyse aus dem Gedächtnis des Modells | hoch (seltene Fakten über Unternehmen) | nur aus bereitgestellten Quellen, mit Verweisen |
KI-Halluzinationen Schritt für Schritt reduzieren
Einen Schalter „ohne Halluzinationen“ gibt es nicht. Was funktioniert, sind einige einfache Gewohnheiten. Jede für sich ändert wenig, zusammen senken sie das Risiko aber auf ein Niveau, mit dem ein Team im Alltag gelassen arbeiten kann, ohne das Gefühl, jede Antwort des Modells wie eine Mine entschärfen zu müssen.
- SCHRITT 01Geben Sie dem Modell Quellen
Statt das Modell aus dem Gedächtnis antworten zu lassen, fügen Sie Dokumente ein oder binden sie an: einen Bericht, eine Preisliste, eine Notiz. Unternehmen, die das systematisch tun, bauen einen Assistenten auf Basis eigener Dokumente. Wie das funktioniert und wann es sich lohnt, erklären wir im Artikel über RAG, also KI auf Basis des Unternehmenswissens.
- SCHRITT 02Erlauben Sie ein „Ich weiß es nicht“
Ergänzen Sie Ihren Prompt um einen Satz: „Wenn du dir nicht sicher bist oder die Information nicht in den Dokumenten steht, schreib, dass du es nicht weißt.“ Das ist die direkte Antwort auf den von OpenAI beschriebenen Mechanismus.
- SCHRITT 03Verlangen Sie Verweise und öffnen Sie sie
Öffnen Sie jede vom Modell genannte Quelle und prüfen Sie zwei Dinge: ob sie überhaupt existiert und ob sie wirklich sagt, was das Modell behauptet, denn eine glaubwürdig aussehende Webadresse beweist für sich genommen gar nichts.
- SCHRITT 04Grenzen Sie die Aufgabe ein
Eine konkrete Aufgabe pro Prompt. „Fasse Kapitel 3 zusammen“ führt zu weniger Fehlern als „Schreib alles über den Markt“.
- SCHRITT 05Prüfen Sie immer vier Dinge
Zahlen, Namen, Zitate, Daten. Eine Überprüfung der KI-Antwort in diesen vier Punkten dauert wenige Minuten und fängt die gefährlichsten Fehler ab.
- SCHRITT 06Ein Mensch gibt frei und zeichnet ab
Nichts geht ohne die Freigabe einer konkreten, namentlich genannten Person nach außen. Das ist auch eine Voraussetzung für die Befreiung von der Kennzeichnungspflicht für KI-Texte, mehr dazu in unserem Artikel über die Kennzeichnung von KI-Inhalten nach dem AI Act.
Was der Schutz vor Halluzinationen kostet
Der günstigste Schutz ist Disziplin. Ein paar Minuten Prüfung für jeden Text mit Fakten kosten weniger als eine einzige Richtigstellung. Das Budget steigt erst, wenn ein Unternehmen einen Chatbot für Kunden oder einen Assistenten auf Basis eigener Dokumente einführt, denn dann müssen eine Wissensbasis aufgebaut, Antworten auf typische Fragen getestet und eine Person bestimmt werden, die das Ganze dauerhaft überwacht.
| Position | Wovon die Kosten abhängen | Wann nötig |
|---|---|---|
| Prüfung der Inhalte durch einen Redakteur | Anzahl der Veröffentlichungen mit Daten, Spezialisierungsgrad des Themas | immer, wenn Inhalte nach außen gehen |
| Schulung des Teams | Anzahl der Personen, Wissensstand zu KI | bei der ersten Einführung und bei neuen Tools |
| Assistent auf Basis von Unternehmensdokumenten (RAG) | Anzahl und Qualität der Dokumente, Integrationen, Tests | wenn die KI Kunden oder Mitarbeitenden antworten soll |
| Tests der Chatbot-Antworten | Anzahl der Szenarien, Häufigkeit von Angebotsänderungen | vor dem Start und nach jeder Änderung der Preisliste oder der AGB |
| Monitoring dessen, was KI über die Marke sagt | Anzahl der zu prüfenden Fragen und Modelle | wenn Kunden Unternehmen über KI-Chatbots suchen |
Wenn ein Modell über Ihre Marke fantasiert
Halluzinationen betreffen nicht nur die Texte, die ein Unternehmen schreibt, sondern auch das, was Modelle über das Unternehmen selbst sagen. Ein Kunde fragt einen Chatbot nach Anbietern der Branche und erhält ein erfundenes Angebot, einen veralteten Firmensitz oder den falschen Namen des Vorstandschefs. Eine Commplace-Messung vom 21. September 2026 zeigt, dass bei 28 von 40 Suchbegriffen, für die der Commplace-Blog in den Top 20 von Google rankt, eine KI-Antwort in den Ergebnissen erscheint. Menschen lesen also immer öfter die Version des Modells, bevor sie die Website des Unternehmens sehen.
Modelle fantasieren seltener über Marken, zu denen es viele glaubwürdige und stimmige Veröffentlichungen gibt. Deshalb ist der Schutz vor Halluzinationen über das eigene Unternehmen zu einem großen Teil PR-Arbeit: Medienberichte, aktuelle Daten auf der Website, einheitliche Beschreibungen in Verzeichnissen. Den Mechanismus erklären wir ausführlicher im Artikel darüber, warum Medienveröffentlichungen bestimmen, was ChatGPT über Ihr Unternehmen sagt. Beginnen Sie mit einer Messung. Audit der Sichtbarkeit in KI bedeutet, dass Sie den Modellen die Fragen stellen, die Ihre Kunden stellen, und festhalten, was sie antworten.
Wann man KI eher vertrauen kann — und wann nicht
KI bewährt sich dort, wo Sie selbst das Material liefern und das Ergebnis beurteilen: Lektorat Ihres eigenen Textes, Zusammenfassung einer Besprechungsnotiz, Varianten von Überschriften, Übersetzung mit anschließender Korrektur. Halluzinationen kommen hier seltener vor und lassen sich leicht erkennen, weil Sie das Original kennen.
Vorsicht ist geboten bei seltenen Fakten, Vorschriften, aktuellen Ereignissen, Marktzahlen und konkreten Personen. Wenn von der Antwort Geld, Gesundheit, Recht oder Reputation abhängen, kann das Modell einen Entwurf liefern, die Entscheidung trifft aber ein Mensch, nachdem er die Quellen geprüft hat. Eine umfassendere Übersicht der Risiken finden Sie im Text über Risiken und Ethik von KI im Unternehmen, und die rechtlichen Pflichten beschreibt unser Beitrag über Der AI Act in Polen.
Sie wählen ein Tool für Ihr Team? Einen Vergleich der Tarife finden Sie in der Übersicht ChatGPT, Gemini oder Copilot für Unternehmen. Planen Sie einen Chatbot für Ihre Kunden? Lesen Sie zuerst, wie man Chatbots im Kundenservice gestaltet. Überprüfung als Gewohnheit statt als Ausnahme bringen wir Marketing- und Kommunikationsteams bei in KI-Schulungen für Unternehmen.
Gewohnheiten, durch die KI-Erfindungen in Veröffentlichungen gelangen
Eine Quellenliste mit Webadressen wirkt professionell, doch einige Einträge existieren womöglich gar nicht. Es genügt, dass ein Journalist oder Kunde auf einen einzigen Link klickt, und die Glaubwürdigkeit des gesamten Materials ist dahin.
Ein Modell klingt genauso sicher, wenn es recht hat, wie wenn es sich irrt. Wer eine Antwort nach dem Stil statt nach geprüften Fakten beurteilt, lässt genau die Fehler durch, die später am meisten schmerzen, weil sie in Texten mit dem Namen des Unternehmens landen.
Ein Chatbot, der aus dem allgemeinen Wissen des Modells antwortet, kann einen Rabatt oder eine Bedingung versprechen, die es in den AGB nicht gibt. Für ein solches Versprechen haftet das Unternehmen. Air Canada hat das vor einem Tribunal erfahren.
Ein Prompt wie „Nenne Studien, die belegen, dass …“ verleitet das Modell dazu, Fakten passend zur These zurechtzubiegen. Am Ende steht eine Argumentation auf Basis von Daten, die es nicht gibt.
„Von KI geschrieben, vom Team geprüft“ heißt oft, dass niemand die Zahlen geprüft hat. Ohne Namen bei der Freigabe hat ein Fehler keinen Verantwortlichen. Und ohne Verantwortlichen verbessert sich der Prozess nicht.
Fragen zu Halluzinationen, die wir von Marketingteams hören
Was sind KI-Halluzinationen?
Es sind Antworten eines Sprachmodells, die glaubwürdig klingen, aber falsch sind: erfundene Fakten, Zahlen, Zitate oder Quellen. Das Modell weiß nicht, dass es sich irrt. Es sagt wahrscheinlichen Text voraus, statt die Wahrheit zu prüfen.
Warum halluziniert ChatGPT?
Laut einer Analyse von OpenAI vom September 2025 werden Modelle so trainiert und bewertet, dass Raten stärker belohnt wird als das Eingeständnis von Nichtwissen. Am häufigsten irren sie sich bei seltenen Fakten, die in den Trainingsdaten kaum vorkamen.
Lassen sich KI-Halluzinationen vollständig beseitigen?
Nein. Man kann sie aber deutlich eindämmen: dem Modell Quelldokumente geben, ihm erlauben, „ich weiß es nicht“ zu antworten, die Aufgabe eingrenzen und vor der Veröffentlichung die Fakten prüfen (Zahlen, Namen, Zitate, Daten).
Wie prüft man, ob eine KI-Antwort stimmt?
Öffnen Sie jede angegebene Quelle und prüfen Sie, ob sie existiert und ob sie sagt, was das Modell behauptet. Vergleichen Sie Zahlen und Zitate mit dem Original. Sie finden die Quelle nicht? Behandeln Sie die Information als unbestätigt.
Wer haftet für den Fehler eines Chatbots auf der Unternehmenswebsite?
Das Unternehmen. Im Fall Moffatt gegen Air Canada vom Februar 2024 wies ein kanadisches Tribunal das Argument zurück, der Chatbot sei eine eigenständige Einheit, und verurteilte die Fluggesellschaft zur Zahlung einer Entschädigung für die falsche Information.
Welche Aufgaben sind am anfälligsten für Halluzinationen?
Fragen zu seltenen Fakten, konkreten Personen und Unternehmen, Vorschriften, aktuellen Ereignissen und Zahlen, besonders wenn das Modell aus dem Gedächtnis antwortet. Am wenigsten riskant ist die Arbeit mit bereitgestelltem Material, etwa das Lektorat oder die Zusammenfassung Ihres eigenen Textes.
Halluzinieren kostenpflichtige Versionen der Modelle seltener?
Neuere Modelle mit Reasoning-Modus und Zugriff auf eine Suchmaschine irren sich oft seltener, Messungen zeigen jedoch große Unterschiede je nach Aufgabe. Keine Version entbindet also davon, Inhalte zu prüfen, die nach außen gehen.
Quellen
- QUELLEOpenAI: Why language models hallucinate · 5. September 2025
- QUELLE
- QUELLEVectara: Hallucination Leaderboard · aktualisiert am 11. Mai 2026
- QUELLE
- QUELLE
- QUELLE
Weiterlesen
In unseren Schulungen arbeiten wir mit Materialien aus dem Arbeitsalltag der Abteilung: Wir zeigen, wo Modelle am häufigsten fabulieren und wie man einen einfachen Prüfprozess aufbaut.
Sebastian Kopiej, CEO von Commplace®. Seit 1996 in der Öffentlichkeitsarbeit tätig. Der Text wurde mithilfe von KI-Werkzeugen erstellt und vom Autor redaktionell geprüft. Stand der Daten: 24. September 2026.