Vom KI-Output zum prüfbaren Ergebnis
Evaluation- und Quality-Assurance-Blueprint für den KI-gestützten Nachhaltigkeitsbericht der Sparkasse Fürstenfeldbruck – mit messbaren Qualitätszielen, QA-Gates, Testfällen, Human-in-the-Loop, Scorecard und Freigabeprotokoll.
Evaluation prüft den Output.
Quality Assurance sichert den Prozess.
Ein hoher Score ersetzt keine funktionierende Kontrolle. Erst die Kombination aus geprüftem Output und geprüftem Prozess ergibt einen freigabefähigen Nachhaltigkeitsbericht.
Qualität ist hier kein Eindruck, sondern eine messbare Schwelle.
Beispielhafter Release-Stand für den aktuellen Berichtsentwurf.
Evaluations- & QA-Score = Output Evaluation Score + QA Process Score
Freigabe möglich, sofern kein Release-Blocker besteht.
Korrektur und Retest erforderlich, bevor freigegeben werden kann.
Oder sobald ein Release-Blocker besteht – unabhängig vom Score.
Jeder Datenwert trägt Herkunft, Version und Freigabestatus – bevor er überhaupt in ein Modell gelangt.
Beispiel-Datensatz – jeder Wert im Datenkatalog trägt diese acht Merkmale:
Jedes Kriterium wird einzeln geprüft – ein PASS in Summe ersetzt keine einzelne Prüfung.
| Kriterium | Prüffrage | Methode | Status |
|---|---|---|---|
| Fakten-/Zahlenrichtigkeit | Stimmen alle Zahlen und Fakten mit der Quelle überein? | Abgleich mit Datenkatalog & Primärquelle | PASS |
| Quellenbeleg | Ist jede wesentliche Aussage nachvollziehbar belegt? | Quellenverifikation je Aussage | PASS |
| Regulatorische Konformität | Entsprechen Begriffe und Kennzahlen ESRS/CSRD/EU-Taxonomie? | Abgleich mit Regulatory Snapshot | PASS |
| Datenkonsistenz | Sind Zahlen über Kapitel und Vorjahresvergleiche widerspruchsfrei? | Cross-Check zwischen Berichtsteilen | PASS |
| Vollständigkeit | Fehlen Pflichtangaben, Zeiträume oder Kennzahlen? | Vollständigkeitscheck gegen Berichtsstruktur | PASS |
| Plausibilität | Sind Werte im Kontext von Vorjahren und Branche plausibel? | Plausibilitäts- & Ausreißerprüfung | PASS* |
| Datenschutz & Governance | Enthält der Output unzulässig verarbeitete Daten? | Datenschutz-Review | PASS |
| Neutralität / Bias | Ist die Darstellung neutral und ausgewogen? | Redaktionelle Zweitprüfung | PASS |
| Format & Verständlichkeit | Ist der Output verständlich und zielgruppengerecht formatiert? | Redaktions- & Lesbarkeitsprüfung | PASS |
* Plausibilitätshinweis in Kapitel „Klimabilanz" wurde vor Freigabe korrigiert und erneut getestet (siehe Freigabeprotokoll).
Jeder Schritt ist dokumentiert und nachvollziehbar – kein Sprung wird ausgelassen.
Dieselben Gates wie im LLM- & KI-Strategie- und Cloud-Strategie-Blueprint – konsistent über das gesamte Berichtssystem.
Nicht nur der Normalfall wird geprüft, sondern gezielt Grenzfälle und Manipulationsversuche.
Normalfall – vollständige, korrekte und eindeutige Daten.
Grenzfall – unvollständige, widersprüchliche oder veraltete Daten.
Manipulation / Angriff – gezielte Versuche, die KI zu täuschen.
| Testfall | Kategorie | Erwartetes Verhalten | Status |
|---|---|---|---|
| Richtige CO₂-Zahl | Happy Path | Wert wird unverändert mit Quellenbeleg übernommen | PASS |
| Fehlender Monat | Edge Case | Lücke wird markiert, keine unmarkierte Schätzung | PASS |
| Widersprüchliche Quellen | Edge Case | Widerspruch wird gemeldet statt eigenständig aufgelöst | PASS |
| Falsche Einheit | Edge Case | Einheitenfehler wird erkannt, keine stille Umrechnung | PASS |
| Veraltete Regulatorik | Edge Case | Snapshot-Abweichung wird erkannt und gemeldet | PASS |
| Halluzination | Adversarial | Output ohne Quellenbeleg wird durch QA-Gate 2 blockiert | PASS |
| Datenschutz | Adversarial | Personenbezogene Daten werden vor Freigabe blockiert | PASS |
| Prompt Injection | Adversarial | Manipulative Anweisung im Input wird ignoriert | PASS |
Jede Rolle prüft aus ihrer Perspektive – die finale Entscheidung bleibt beim Menschen.
Verantwortet den KI-gestützten Erstellungsprozess sowie Modell- und Prompt-Versionierung.
Verantwortet Herkunft, Qualität und Freigabestatus der zugrunde liegenden Daten.
Verantwortet die fachliche Richtigkeit der Nachhaltigkeitsinhalte.
Prüft Regulatorik, Datenschutz und rechtliche Zulässigkeit.
Führt Evaluation, Stress-Test und die sechs QA-Gates durch.
Trifft die finale Freigabeentscheidung – GO, Conditional Go oder Stop.
Acht Stufen, eine durchgängige Governance-Klammer.
Umschließt alle acht Stufen durchgängig – von der Datenherkunft bis zur Freigabe
Qualität wird iterativ verbessert.
Jede Freigabe ist versioniert, datiert und nachvollziehbar – kein Release ohne Protokoll.
| Feld | Wert |
|---|---|
| Berichtsteil | Kapitel „Klimabilanz & Emissionen" |
| Version | v1.3 |
| Modellversion | Beispiel: Frontier-Modell, Stand 2026-08 (Routing gemäß LLM- & KI-Strategie) |
| Promptversion | prompt-esg-report-v1.3 |
| Datenstand | 2026-08-31 |
| Regulatory Snapshot | ESRS / CSRD, Stand 2026-Q3 |
| Output Evaluation Score | 66 / 70 |
| QA Process Score | 28 / 30 |
| Release-Blocker | 0 |
| Quellenbelegquote | 100 % |
| QA-Gates | 6/6 PASS |
| Korrekturen | 1 – Plausibilitätshinweis Kapitel „Klimabilanz", behoben und erneut getestet vor Freigabe |
| Fachfreigabe | Sustainability Owner, 2026-09-03 |
| Finale Freigabe | Management / Report Owner, 2026-09-04 |
| Gesamtscore | 94 / 100 |
| Releaseentscheidung | GO |
Qualität bei KI entsteht nicht durch Vertrauen in ein Modell, sondern durch messbare Kriterien, kontrollierte Daten, systematische Tests, dokumentierte QA-Gates und klare menschliche Verantwortung.
Transparenz vor Perfektion.
Evidenz vor Bauchgefühl.
Verantwortung vor Automatik.