
Beeindruckend ist kein Abnahmekriterium
Jede KI-Demo funktioniert. Das liegt nicht daran, dass die Systeme so gut sind. Es liegt daran, dass eine Demo so lange wiederholt wird, bis sie klappt. Die Fälle, die schiefgehen, fliegen raus, bevor jemand zuschaut. Das ist keine Täuschung, das ist Selbsttäuschung, und die ist schwerer zu entdecken als jede Lüge.
Wie ihr den Erfolg eines KI-Systems messt, bevor ihr es baut
Jede KI-Demo funktioniert. Das liegt nicht daran, dass die Systeme so gut sind. Es liegt daran, dass eine Demo so lange wiederholt wird, bis sie klappt. Die Fälle, die schiefgehen, fliegen raus, bevor jemand zuschaut. Das ist keine Täuschung, das ist Selbsttäuschung, und die ist schwerer zu entdecken als jede Lüge.
Im ersten Beitrag dieser Reihe ging es um den Pilotfriedhof: Viele KI-Piloten versanden, weil vorher niemand festgelegt hat, woran man Erfolg erkennt. Hier geht es um das Werkzeug, das genau das festlegt. Es heißt Abnahmekriterium, und es klingt langweiliger, als es ist.
Das Golden Set
Ein Golden Set ist eine feste Sammlung echter Fälle, zu denen ein Mensch vorher aufgeschrieben hat, was das richtige Ergebnis ist. Keine ausgedachten Beispiele, sondern Anfragen, Dokumente oder Vorgänge, die bei euch tatsächlich so vorkommen.
Wie groß? Kleiner, als die meisten denken. Langfuse, ein verbreitetes Werkzeug zur Überwachung von KI-Anwendungen, empfiehlt für den Start 20 bis 50 geprüfte Fälle, die die wichtigsten Verhaltensweisen abdecken. Für eine vollständige Regressionsprüfung wächst das Set später auf 100 bis 1.000 Fälle. Der entscheidende Satz dort: Die Abdeckung unterschiedlicher Fehlerarten zählt mehr als die Anzahl. Hundert verschiedene Fälle sind mehr wert als tausend fast gleiche.
Wer baut es? Die Fachabteilung, nicht die IT. Wer nicht beurteilen kann, ob eine Kreditanfrage richtig eingeordnet ist, kann auch kein Sollergebnis dafür festlegen. Die IT baut das System, die Fachleute bauen den Maßstab. Wenn beides in einer Hand liegt, prüft sich das System am Ende selbst.
Und dann wird das Set eingefroren. Also versioniert und festgehalten, bevor die Optimierung beginnt. Sonst passiert, was fast immer passiert: Ein Fall klappt nicht, jemand findet, der Fall sei "eh untypisch", und nimmt ihn raus. Nach drei solchen Runden misst das Set nur noch, was ohnehin funktioniert. Neue Fälle kommen dazu, als neue Version, und alte bleiben drin.
Im Alltag funktioniert das genauso. Bevor ihr ein KI-Abo verlängert, schreibt zehn typische Aufgaben auf, die ihr damit wirklich erledigt, und bewertet die Antworten. Das dauert eine Stunde. Danach wisst ihr, ob es sich lohnt, statt es nur zu glauben.
Im Unternehmen ist das Golden Set gleich dreimal nützlich: als Grundlage für die Abnahme, als Regressionstest bei jedem Modell- oder Promptwechsel und als Nachweis, wenn später jemand fragt, wie ihr die Qualität geprüft habt. Einmal gebaut, dreimal gebraucht.
Die vier Größen
Qualität ist nur eine von vier Größen, die bei einem KI-System im Betrieb zählen.
Qualität: Stimmt die Ausgabe, gemessen am Golden Set?
Latenz: Wie lange dauert eine Antwort, und ab wann stört das?
Kosten: Was kostet ein Vorgang, nicht ein einzelnes Token?
Sicherheit: Was passiert im schlimmsten anzunehmenden Fall?
Der unbequeme Teil: Jede Verbesserung an einer Größe kostet an einer anderen. Ein größeres Modell hebt die Qualität und verschlechtert Latenz und Kosten. Strengere Sicherheitsprüfungen kosten Zeit. Deshalb muss vorher jemand entscheiden, welche Größe führt, wenn es eng wird. Das ist eine Managemententscheidung, keine technische. Wer behauptet, alle vier gleichzeitig zu optimieren, hat keine davon gemessen.
Wo Qualität konkret wird
Viele KI-Systeme im Unternehmen sind RAG-Systeme. RAG steht für Retrieval Augmented Generation und heißt: Das System sucht zuerst passende Stellen in euren eigenen Dokumenten und formuliert dann daraus eine Antwort. Da stecken zwei Fehlerquellen drin, das Suchen und das Formulieren, und die muss man getrennt messen.
Für das Suchen gibt es zwei gängige Kennzahlen. Context Precision fragt, ob die relevanten Textstellen oben in den Suchergebnissen landen. Context Recall fragt, ob alles gefunden wurde, was für die richtige Antwort nötig ist. Für das Formulieren gibt es Faithfulness: Lässt sich jede Aussage der Antwort aus den gefundenen Stellen belegen? Wichtig dabei, und oft missverstanden: Eine hohe Faithfulness heißt nicht, dass die Antwort stimmt. Sie heißt nur, dass sie sich an das Gefundene hält. Wurde das Falsche gefunden, ist auch eine treue Antwort falsch.
Daraus folgt ein praktischer Rat. Bevor ihr einen Tag lang an Prompts feilt, messt, ob das System überhaupt die richtigen Stellen findet. Sehr oft liegt das Problem im Suchen, nicht im Formulieren, und dann hilft kein noch so schöner Prompt.
Werkzeuge dafür gibt es einige. Die Open-Source-Bibliothek Ragas bringt genau diese Kennzahlen mit, DeepEval ist ähnlich aufgestellt, Langfuse und Arize Phoenix setzen stärker bei der Überwachung im laufenden Betrieb an. Das ist keine Empfehlung, sondern eine Landkarte. Welches passt, hängt von eurem Aufbau ab. Und keines davon ersetzt das Golden Set, sie rechnen nur damit.
Ein Detail, das man kennen sollte: Viele dieser Kennzahlen werden selbst von einem Sprachmodell ausgerechnet, das als Prüfer eingesetzt wird. Dieses Prüfmodell sollte fest bleiben und nicht bei jedem Update mitwechseln. Sonst misst ihr nach dem Wechsel etwas anderes als vorher und haltet den Unterschied für eine Verbesserung.
Schwellenwert und Abbruchbedingung
Jetzt kommt der Teil, der aus einer Messung eine Entscheidung macht.
Der Schwellenwert wird vom heutigen Zustand abgeleitet, nicht vom Wunsch. Wenn heute ein Mensch 12 von 50 Fällen im Golden Set falsch einordnet, ist "maximal 5 Fehler" ein Ziel, über das man reden kann. "99 Prozent richtig" ist dagegen eine Zahl aus einer Präsentation. (Die 12 und die 5 sind ein erfundenes Rechenbeispiel, keine Messung.)
Dazu ein technischer Punkt, der oft übersehen wird. Sprachmodelle liefern auf dieselbe Frage nicht zuverlässig dieselbe Antwort. Selbst mit der Einstellung Temperatur 0, die theoretisch immer die wahrscheinlichste Antwort erzwingt, sind die gängigen Schnittstellen in der Praxis nicht deterministisch. Das Thinking Machines Lab hat im September 2025 gezeigt, woran das hauptsächlich liegt: Die Ergebnisse hängen davon ab, wie viele Anfragen der Server gerade gleichzeitig bündelt. Für euch heißt das: Legt Toleranzbänder fest statt exakter Punktwerte, und lasst das Golden Set mehrmals laufen, bevor ihr aus einem Unterschied eine Entscheidung ableitet.
Und dann die Abbruchbedingung. Sie wird aufgeschrieben, bevor der Pilot startet, mit Datum, und eine benannte Person unterschreibt sie. "Wenn wir bis 31. März nicht unter 8 Fehlern liegen, stoppen wir." Das fühlt sich am ersten Tag unangenehm an. Genau deshalb macht es fast keiner, und genau deshalb versanden so viele Projekte, statt entschieden zu werden.
Was ihr diese Woche tun könnt
Nehmt euer aktuelles KI-Vorhaben und sammelt zwanzig echte Fälle. Lasst jemanden aus der Fachabteilung für jeden Fall das richtige Ergebnis aufschreiben. Speichert die Liste mit Datum ab und fasst sie ab dann nicht mehr an, außer um Fälle hinzuzufügen.
Wenn das nach einer Woche nicht steht, wisst ihr, dass euch kein Werkzeug fehlt, sondern ein Maßstab.
Quellen
- Langfuse: "Golden dataset evaluation: build and maintain LLM test sets" (August 2026), https://langfuse.com/resources/engineering/golden-dataset-evaluation
- Ragas-Dokumentation, Kennzahlen Faithfulness und Context Precision: https://docs.ragas.io/en/stable/concepts/metrics/available_metrics/faithfulness/ und https://docs.ragas.io/en/stable/concepts/metrics/available_metrics/context_precision/
- Redis: "Get better RAG responses with Ragas" (2026), zur Trennung von Such- und Antwortqualität und zur Grenze von Faithfulness: https://redis.io/blog/get-better-rag-responses-with-ragas/
- Horace He / Thinking Machines Lab: "Defeating Nondeterminism in LLM Inference" (September 2025), Ursache Batch-Varianz
- MIT NANDA: "The GenAI Divide: State of AI in Business 2025" (Rückbezug Pilotfriedhof)
6 Fragen, die ich vor jedem KI-Projekt stelle
Vor ein paar Tagen habe ich auf LinkedIn sechs Fragen gepostet, die ich vor jedem KI-Vorhaben stelle. Keine davon betrifft das Modell. Ein Karussell hat halt pro Seite Platz für einen Gedanken. Hier kommt die lange Fassung: was jede Frage eigentlich klären soll, welche Antworten ich immer wieder höre, die nicht tragen, und wie eine brauchbare Antwort aussieht.
KI-Realitätscheck 1. bis 14. Juni 2026: Was sich wirklich bewegt hat
Die Halbwertszeit einer KI-Schlagzeile liegt weiter bei etwa 48 Stunden. In den ersten zwei Juni-Wochen wurde aus "der Bundestag verabschiedet ein Durchführungsgesetz" ein "Deutschland reguliert KI scharf", aus einem freiwilligen Verhaltenskodex eine "Pflicht zum Wasserzeichen", und aus einer Exportkontroll-Anordnung ein "Anthropic schaltet Claude ab".
KI-Realitätscheck 2026: Was zwischen April und Juni wirklich passiert ist (und was davon nur Lärm war)
Die Halbwertszeit einer KI-Schlagzeile liegt bei ungefähr 48 Stunden. In dieser Zeitspanne wird aus "Microsoft schränkt intern ein Tool ein" ein "Microsoft wirft Claude raus", aus "ein Automatisierungstool verdoppelt seinen Wert" ein "n8n ist tot", und aus einer verschobenen Frist ein "die EU kippt das KI-Gesetz". Wer beruflich mit künstlicher Intelligenz arbeitet, steht damit vor einem doppelten Problem: Man muss nicht nur die Entwicklungen kennen, sondern auch laufend zwischen Signal und Lärm unterscheiden.