Einen KI-Schritt prüfen Sie genauso wie jedes andere System. Sie halten eine Sammlung von Fällen vor, in denen die richtige Antwort bereits bekannt ist, und bewerten die Ausgabe Feld für Feld dagegen.
Ein grüner Durchlauf erledigt das nicht für Sie. Er sagt Ihnen, dass die HTTP-Aufrufe 200 zurückgegeben haben.
Bei einem KI-Schritt in einem Geschäftsprozess läuft die Prüfung auf fünf Dinge hinaus:
Ein Gold Set aus Ihren eigenen Dokumenten, 50 bis 100 Stück, bewusst so ausgewählt, dass die unangenehmen Fälle dabei sind.
Ein typisiertes Ausgabeschema, das null zulässt, damit ein fehlender Wert fehlend bleibt und nicht erfunden wird.
Getrennte Prüfregeln für einfache und für schwierige Felder, denn eine einzige Genauigkeitszahl verdeckt die schwierigen.
Ein Konfidenz-Gate, das alles unterhalb der Schwelle an einen Menschen weiterleitet, bevor es verbucht wird.
Ein Regressionslauf über das komplette Gold Set nach jeder Prompt-Änderung und nach jedem Modell-Update.
Alles andere ist Prompt-Tuning. Prompt-Tuning ist kein Nachweis.
Ein grüner Durchlauf ist noch kein korrekter
Drei Threads im n8n Community Forum stellen fast wörtlich dieselbe Frage: "Wie prüft man, ob KI-Workflows wirklich das Richtige getan haben?", "Wie erkennt man Workflows, die fehlerfrei laufen, aber nichts tun?" und "Wie testet man eine Workflow-Änderung, bevor sie in den Produktivbetrieb geht?".
Sie kreisen alle um dieselbe Lücke. Ein Error Trigger löst nicht aus, wenn ein Workflow eine selbstbewusst falsche Zahl schreibt, und er löst auch nicht aus, wenn ein Workflow überhaupt nichts schreibt. Das sind die zwei Fehler, die Geld kosten, und keiner von beiden sieht im Dashboard wie ein Fehler aus.
Die Prüfung muss die Ausgabe also mit einer bekannten Antwort vergleichen, nicht mit dem Ausbleiben einer Fehlermeldung.
Bewerten Sie Felder, nicht Dokumente
Eine Bewertung auf Dokumentebene ist nahezu wertlos. Hat eine Rechnung 4 Kopffelder und 30 Positionszellen, kommen Sie mit einem falschen Einzelpreis auf 97 Prozent Genauigkeit und auf eine Rechnung, die Sie nicht verbuchen können.
Die Prüfregel hängt am Feld, und Felder werden danach gewichtet, was ein falscher Wert kostet. Dieselbe Regel erfüllt beide Aufgaben: Sie bewertet das Gold Set beim Aufbau, und sie entscheidet im Betrieb über die Weiterleitung.
Identität. Beispiel: USt-IdNr. des Lieferanten, Rechnungsnummer. Prüfregel: Exakte Übereinstimmung, ohne Ausnahme. Aktion im Betrieb bei Fehlschlag: Durchlauf blockieren, zur Prüfung weiterleiten.
Beträge. Beispiel: Gesamtbetrag, Netto, USt. je Steuersatz. Prüfregel: Exakte Übereinstimmung auf den Cent mit dem Gold-Wert, und Netto plus USt. ergibt den Gesamtbetrag im Rahmen einer festgelegten Rundungstoleranz. Aktion im Betrieb bei Fehlschlag: Durchlauf blockieren, zur Prüfung weiterleiten.
CEO von Neviox Digital mit einem Ingenieurabschluss in Informatik von der Universität Split sowie mehreren Zertifizierungen. Meine Kernkompetenzen umfassen Frontend- und Backend-Technologien, mit besonderem Fokus auf LangChain, Next.js und AWS.
Neviox Digital
Haben Sie eine Vision für eine digitale Lösung? Möchten Sie Ihr technisches Know-how teilen oder Ihre Marke bewerben? Lassen Sie uns zusammenarbeiten und gemeinsam die Zukunft gestalten!
Was wir gebaut haben, was schiefging und was wir heute anders machen würden. Keine Linksammlungen.
Datumsfelder. Beispiel: Rechnungsdatum, Fälligkeitsdatum. Prüfregel: Exakte Übereinstimmung nach Normalisierung des Formats. Aktion im Betrieb bei Fehlschlag: Zur Prüfung weiterleiten.
Positionen. Beispiel: Bezeichnung, Menge, Einzelpreis, Positionssumme. Prüfregel: Die Zeilenanzahl muss stimmen, dann Abgleich auf Zellebene. Aktion im Betrieb bei Fehlschlag: Zur Prüfung weiterleiten.
Freitext. Beispiel: Zahlungsreferenz, Notizen. Prüfregel: Zeichenketten-Ähnlichkeit, keine exakte Übereinstimmung. Aktion im Betrieb bei Fehlschlag: Protokollieren, nicht blockieren.
Betragsfelder werden zweimal geprüft: einmal gegen den Gold-Wert und einmal gegen sich selbst, denn Netto plus USt. muss den Gesamtbetrag ergeben, unabhängig davon, was das Modell ausgegeben hat. Die Rundungstoleranz ist hier wichtig, denn Lieferanten, die pro Position statt pro Rechnung runden, erstellen korrekte Dokumente, die eine strikte Summenprüfung zurückweist.
Das Schema lässt null bei jedem Feld zu, das nicht strukturell garantiert ist, mit der ausdrücklichen Anweisung, null einer Vermutung vorzuziehen. Ein null-Wert ist eine Ausnahme, die weitergeleitet wird. Ein erfundener Wert ist ein stiller Verlust.
Bauen Sie das Gold Set aus Ihren Dokumenten, nicht aus einem Benchmark
Veröffentlichte Benchmarks zur Datenextraktion sagen Ihnen, wie gut ein Modell mit den Unterlagen anderer Leute zurechtkommt. Ihre Lieferanten sind in dieser Stichprobe nicht enthalten. Eine Anfrage im n8n Forum sucht "einen einzigen Workflow zur Rechnungsklassifizierung mit einem ausdrücklich erwarteten Label". Geteilte Workflows liefern fast immer den Prompt mit, aber nicht die erwartete Antwort.
Wir fragen nach 50 bis 100 echten Fällen, bewusst ausgewählt und nicht zufällig:
Ihre Top 10 Lieferanten oder Kunden nach Volumen. Warum: Das ist der Großteil des späteren Volumens.
Gescannte und abfotografierte Dokumente, nicht nur native PDFs. Warum: Fotografierte Dokumente scheitern anders als native PDFs, und in Ihrem Postfach liegt beides.
Mehrseitige Dokumente und Dokumente mit einer Tabelle, die über Seiten hinweg umbricht. Warum: An den Positionen scheitert die Extraktion tatsächlich.
Fremdwährung und ein Fall mit ausländischer Umsatzsteuer. Warum: Anderes Feldlayout, andere Rundung.
Gutschriften und Korrekturen. Warum: Negative Beträge decken Vorzeichenfehler auf.
Zwei oder drei Dokumente, bei denen ein neuer Mitarbeiter Fehler machen würde. Warum: Wo ein Mensch Urteilsvermögen braucht, braucht es das Modell auch.
Für jeden Fall werden die richtigen Werte einmal eingetragen, von jemandem aus dem Team, dem der Prozess gehört. Das ist der einzige aufwendige Teil. Es ist Tipparbeit, einmal erledigt, von der Person, die die richtige Antwort ohnehin kennt.
Das Konfidenz-Gate, und wer was freigibt
Die Bewertung auf Feldebene liefert Ihnen im Betrieb eine Entscheidung pro Dokument, nicht nur eine Note beim Aufbau. Dokumente, die jede blockierende Regel erfüllen, laufen direkt durch. Alles, was an einer Regel scheitert oder unter der Konfidenzschwelle liegt, landet in einer Warteschlange für Menschen, mit hervorgehobenem unsicherem Feld. n8n bringt eigene Send-and-wait-for-response-Operationen mit Freigabemodus mit, sodass der Workflow genau an dem Schritt pausiert, der ein Risiko trägt, und nicht an allen.
Zwei Zahlen, die Sie vor dem Start festlegen und danach weiter beobachten sollten:
Den Anteil am Volumen, der zur Prüfung abgezweigt wird, gemessen daran, wie lange eine vollständige manuelle Erfassung vorher gedauert hat. Eine Abzweigungsquote ist nur neben der Zeit aussagekräftig, die sie ersetzt, legen Sie daher beide Zahlen in derselben Sitzung fest.
Die Korrekturquote innerhalb dieser Warteschlange. Jede Korrektur wandert ins Gold Set, damit die Prüfung mit der Laufzeit des Prozesses strenger wird.
Der Regressionslauf nach jedem Modell-Update
Diesen Teil lassen die meisten Automatisierungen aus. Er ist der Grund, warum ein Workflow, der beim Start bestanden hat, irgendwann unbemerkt durchfällt. Modellversionen ändern sich. Prompts werden bearbeitet. Keines von beidem kündigt sich in Ihrer Ausgabe an.
n8n liefert das Werkzeug dafür mit. Die Testfälle liegen in einer Data Table. Ein Evaluation Trigger führt den Workflow über jede Zeile aus. Der Evaluation node schreibt die Ergebnisse mit Set Outputs zurück und erfasst die Bewertungen mit Set Metrics, über eingebaute Metriken wie Correctness, String Similarity und Categorisation. Die Ergebnisse werden pro Lauf im Evaluations tab zusammengefasst, sodass sich zwei Läufe vergleichen lassen.
Wählen Sie das Messinstrument passend zum Feld. Correctness ist ein KI-Judge auf einer Skala von 1 bis 5, was für Freitext in Ordnung und für einen Gesamtbetrag unbrauchbar ist. Identitäts- und Betragsfelder bekommen einen einfachen Gleichheitsvergleich in einem Code node, keine bewertete Note.
Wichtiger als das Werkzeug ist die Regel, wann ausgelöst wird. Wir lassen das komplette Set erneut laufen, bevor eine Prompt-Änderung live geht, wenn der Anbieter eine neue Modellversion veröffentlicht, und ohnehin einmal im Monat. Ein Einbruch bei einer Feldklasse ist sofort sichtbar, und das Gold Set ist es, was uns erlaubt, den Schritt auf ein anderes Modell oder einen anderen Anbieter umzustellen, ohne dem Ergebnis blind zu vertrauen.
Was der Betrieb kostet
Die Aufbaukosten sind sichtbar. Diese vier sind es nicht:
Die Token-Kosten pro Dokument, die mit der Seitenzahl wachsen und weiter steigen, wenn Sie Seitenbilder statt extrahierten Text senden. Rechnen Sie beide Wege an zehn Ihrer eigenen Dokumente durch, bevor Sie sich entscheiden.
Das erneute Durchlaufen des Gold Sets. 100 Dokumente pro Regressionslauf, mehrere Läufe im Monat.
Die Prüf-Warteschlange. Echte Minuten eines echten Menschen, bei welcher Abzweigungsquote sich das Ganze auch einstellt.
Eine Kostenobergrenze pro Lauf. Prüfen Sie, ob Ihre n8n Version die Ausgaben pro Durchlauf begrenzt. Wenn nicht, hat eine Schleife an einem fehlerhaften Schritt keine Obergrenze, bis Sie eine einziehen. Wir setzen sie ausdrücklich.
Wir betreiben das auf selbst gehostetem n8n in der EU oder auf den eigenen Servern des Kunden, damit das Gold Set und die Ausführungsdaten im Unternehmen bleiben. Das Dokument verlässt das Haus trotzdem, hin zu dem Modell, das es liest, es sei denn, das Modell läuft ebenfalls lokal. Diese Entscheidung treffen wir pro Prozess und schriftlich. Wie wir solche Workflows zuschneiden und umsetzen, steht auf unserer Seite zur .
Wer freigibt
Die Person, der der Prozess gehört, nicht die Person, die den Workflow gebaut hat. Sie sieht die Ergebnisse auf Feldebene an den eigenen Dokumenten, sie sieht, welche Fälle weiterhin zur Prüfung gehen, und sie entscheidet, ob das für den Live-Betrieb gut genug ist.
Lassen Sie das Gold Set vor diesem Gespräch von der Person durchgehen, die die Arbeit heute macht. Erfassen Sie deren Fehlerquote auf Feldebene an denselben Dokumenten. Das ist die Zahl, gegen die die Automatisierung tatsächlich antritt, und sie ist fast nie null. Ein Modell an der Perfektion zu messen, führt dazu, dass eine funktionierende Automatisierung abgelehnt und ein manueller Prozess mit derselben Fehlerquote beibehalten wird.
Wenn niemand bereit ist, seinen Namen unter das Ergebnis zu setzen, ist die Automatisierung nicht reif, und kein Genauigkeitsprozentsatz ändert daran etwas.
Wenn Sie einen Prozess im Kopf haben, den Sie automatisieren möchten, und wissen wollen, wie das Testset dafür aussehen würde: Schicken Sie uns die drei Dokumente, die Ihrem Team am meisten Mühe machen, und wir sagen Ihnen, was wir messen würden.
Quellen
Wie prüft man, ob KI-Workflows wirklich das Richtige getan haben?: https://community.n8n.io/t/how-do-you-verify-ai-workflows-actually-did-the-right-thing/304241
Wie erkennt man Workflows, die fehlerfrei laufen, aber nichts tun?: https://community.n8n.io/t/how-do-you-catch-workflows-that-run-fine-but-do-nothing/308708
Wie testet man eine Workflow-Änderung, bevor sie in den Produktivbetrieb geht?: https://community.n8n.io/t/how-do-you-test-a-workflow-edit-before-it-touches-production/313427
einen einzigen Workflow zur Rechnungsklassifizierung mit einem ausdrücklich erwarteten Label: https://community.n8n.io/t/looking-for-1-invoice-classification-workflow-with-an-explicit-expected-label/284760