Inhaltsverzeichnis

30.08.2026 · 2 Min. Lesezeit

Ergebnisse von KI-Agenten prüfen: worauf du wirklich schaust

Kein Eval-Framework, keine Metriken — eine kurze Checkliste, mit der du als Einzelperson ein Agenten-Ergebnis in Minuten prüfst, statt es zu erraten.

Polygon-Portrait von Dr. Matthias Klinger mit Brille und blauem Hemd vor einem grünen geometrischen Hintergrund.

REDAKTIONELL GEPRÜFT VON

MatthiasPolygon-Portrait von Dr. Matthias Klinger mit Brille und blauem Hemd vor einem grünen geometrischen Hintergrund.MatthiasVorsitzender, Quandes Projects e.V.„Ideas to Impact“ – Matthias glaubt an die Kraft der Digitalisierung, um echte Veränderungen zu schaffen. Als Gründer von Quandes und Vorsitzender des Quandes Projects e.V. nutzt er Technologie als Katalysator für gesellschaftlichen Wandel – für besseren Bildungszugang und innovative Lösungen für Umwelt und Gesellschaft.

2 Min. Lesezeit

In einem flach liegenden Sieb ist ein einzelnes Korn hängen geblieben, das größer ist als die übrigen und farblich markiert. Ein erfundener Wert fällt erst auf, wenn etwas ihn zurückhält.

Für eine kleine Testreihe haben wir vier Sprachmodellen dieselbe Aufgabe gegeben: die Notiz einer Sitzung zusammenfassen. Zum Teilnahmebeitrag schwieg die Notiz. Drei der vier Modelle nannten trotzdem einen Betrag, und zwei davon teilten 240 Euro durch 17 Personen und schrieben 14,12 Euro pro Kopf in ihre Zusammenfassung.[1]

Das Wichtigste in Kürze

  • Ein plausibles Ergebnis ist noch kein geprüftes Ergebnis. Erfundene Zahlen sehen genauso ordentlich aus wie richtige.
  • Eine kurze Prüfliste reicht. Quelle, Lücken, Sicherheitssprache, zweite Quelle bei Zweifel.
  • Ein Eval-Framework brauchst du nicht, wenn du die Quelle selbst kennst.
  • Prüfen führt zu Korrektur mit Beleg, nicht zu Vermutung.

Der Fehler, der plausibel aussah

Nur eines der vier Modelle in der Testreihe erkannte die Lücke richtig und schrieb, es gebe keine Angabe zum Teilnahmebeitrag.[1] Die anderen drei erfanden einen Betrag, und zwei davon gingen noch einen Schritt weiter: Sie nahmen zwei Zahlen, die an anderer Stelle in der Notiz standen, teilten die eine durch die andere und präsentierten das Ergebnis als Teilnahmebeitrag pro Person.

Am fertigen Text sah man den Unterschied zwischen dem einen richtigen und den drei falschen Modellen nicht an. Alle vier klangen gleich sicher. Das ist der eigentliche Befund: Sprache verrät nicht, ob eine Aussage geprüft oder erfunden ist.

Woran du wirklich schaust

Die Prüfliste

Zahlen gegen die Quelle halten. Jede Zahl im Ergebnis muss sich in der Ausgangsquelle wiederfinden lassen, eine plausible Größenordnung reicht nicht.

Nach fehlenden Angaben suchen, nicht nur nach falschen. Ein Agent füllt Lücken lieber, als sie offen zu lassen — das ist die häufigere Fehlerquelle.

Sicherheitssprache misstrauen. Ein Satz, der besonders bestimmt klingt, ist keine zusätzliche Garantie für seine Richtigkeit.

Bei Unsicherheit eine zweite, unabhängige Quelle heranziehen. Reicht die erste Prüfung nicht, hilft ein zweiter Blick von außen mehr als ein zweiter Blick auf dasselbe Ergebnis.

Vier flache Siebe liegen in einer Reihe, ihre Maschen werden von links nach rechts feiner, das feinste ist farblich markiert. Vier Prüfpunkte greifen unterschiedlich fein, der letzte hält auch das zurück, was den anderen entgeht.
Vier Punkte, keine Metriken: die Prüfliste für ein einzelnes Ergebnis.

Diese vier Punkte reichen für die meisten Ergebnisse, die im Camp entstehen. Sie sind eine Gewohnheit, die sich einüben lässt: das Ergebnis an dem messen, was sich belegen lässt, und den Klang der Sätze außer Acht lassen.

Am Anfang dauert das noch bewusstes Nachdenken. Nach ein paar geprüften Ergebnissen wird daraus ein Blick, den du fast automatisch auf die richtigen Stellen richtest.

Montags im Camp

Wenn du das an einem eigenen Ergebnis üben willst

Im Social Impact Camp arbeiten wir jeden Montagabend an gemeinnützigen Vorhaben, und die Ergebnisprüfung gehört zum festen Handwerk. Du kannst dazukommen, ohne Vorerfahrung und ohne Kosten.

Beim Camp mitmachen

Was du nicht prüfen musst

Ein Eval-Framework mit Metriken oder ein zweites Sprachmodell als Richter brauchst du nicht, wenn du die Quelle selbst kennst und nachlesen kannst. Diese Werkzeuge lohnen sich für Teams, die dieselbe Aufgabe hunderte Male automatisiert laufen lassen. Für eine einzelne Aufgabe im Camp reicht der eigene Blick auf die Quelle.

Was du danach machst

Findest du eine falsche oder erfundene Stelle, korrigierst du sie mit Beleg, nicht mit einer Vermutung, die genauso gut daneben liegen kann. Bleibt eine Stelle unklar, markierst du sie als offene Frage, statt sie zu erraten. Beide Reaktionen setzen voraus, dass der Zuschnitt und der Auftrag von Anfang an eine Prüfform vorgesehen haben — dazu mehr in den Beiträgen zum Aufgabenzuschnitt und zum Einstieg mit Agenten.

Quandes Projects e. V.

Wenn du wissen willst, woran wir gerade arbeiten

Das Social Impact Camp ist ein offenes, kostenloses Format von Quandes Projects e. V. Auf der Camp-Seite steht, was montags passiert und wie ein Abend abläuft.

Das Camp ansehen

Häufige Fragen

Häufige Fragen zur Ergebnisprüfung

Reicht es, wenn das Ergebnis gut klingt?

Nein. Der Fehlerfall mit den 14,12 Euro zeigt das Gegenteil: Ein erfundener Wert kann genauso ordentlich formuliert sein wie ein richtiger.

Wie prüfe ich, wenn ich die Quelle selbst nicht kenne?

Verlange vom Agenten, die Quelle mitzuliefern oder Fundstellen zu zitieren. Ohne Quelle bleibt nur eine zweite, unabhängige Prüfung.

Was mache ich mit einer Stelle, bei der ich unsicher bleibe?

Markiere sie offen, statt zu entscheiden. Eine als unsicher gekennzeichnete Stelle ist ein besseres Ergebnis als eine geratene.

Brauche ich ein zweites KI-Modell, um das Ergebnis zu prüfen?

Nein. Ein zweites Modell als Richter ist ein Werkzeug für automatisierte Testläufe in großem Umfang, nicht für die einzelne Aufgabe im Camp.

Weiterführend

KI-Unterstützung
Text
Claude Opus 5
Bilder
OpenAI Codex ImageGen 2

Redaktionell geprüft von Quandes Projects e. V.

Mehr erfahren

Textentwurf, Struktur und Recherchezusammenfassung entstanden mit Claude Opus 5 (Recherche: Claude Opus 5 mit Websuche) und wurden von Quandes Projects e. V. redaktionell geprüft und freigegeben. Bilder wurden mit OpenAI Codex ImageGen 2 erzeugt und redaktionell ausgewählt. Die inhaltliche Verantwortung liegt bei Quandes Projects e. V.

Unsere KI-Transparenz-Erklärung
Ergebnisse von KI-Agenten prüfen: worauf du wirklich schaust | Quandes Projects