Sparkassen Corporate Design – Konzeptdarstellung. Farben und Bildmarke sind angenähert und ersetzen keine offizielle Markenvorgabe.
Sparkasse FürstenfeldbruckNachhaltigkeit · interne Auswertung
Auf dieser Seite
KI-Consulting Blueprint

Evaluation & Quality Assurance

Vom KI-Output zum prüfbaren Ergebnis

Evaluation- und Quality-Assurance-Blueprint für den KI-gestützten Nachhaltigkeitsbericht der Sparkasse Fürstenfeldbruck – mit messbaren Qualitätszielen, QA-Gates, Testfällen, Human-in-the-Loop, Scorecard und Freigabeprotokoll.

Leitprinzip

Evaluation prüft den Output.
Quality Assurance sichert den Prozess.

Ein hoher Score ersetzt keine funktionierende Kontrolle. Erst die Kombination aus geprüftem Output und geprüftem Prozess ergibt einen freigabefähigen Nachhaltigkeitsbericht.

Qualitätsziele

Vier Kennzahlen, die über Freigabe entscheiden

Qualität ist hier kein Eindruck, sondern eine messbare Schwelle.

Kritische Fakten-/Zahlenfehler0
Quellenbeleg für wesentliche Aussagen100 %
QA-Gates bestanden6/6
Release Score≥ 90/100

Definition of Done

  • Score ≥ 90/100
  • 0 Release-Blocker
  • 100 % Pflichtquellen belegt
  • 6/6 QA-Gates bestanden
  • Stress-Test bestanden
  • Human Approval erteilt
Evaluations- & QA-Score

Der Gesamtscore vor Veröffentlichung

Beispielhafter Release-Stand für den aktuellen Berichtsentwurf.

94 / 100
GO

Evaluations- & QA-Score = Output Evaluation Score + QA Process Score

Output Evaluation 66 / 70

Fakten & Zahlen19 / 20
Quellenbeleg14 / 15
Regulatorik14 / 15
Datenkonsistenz10 / 10
Vollständigkeit5 / 5
Plausibilität4 / 5

QA Process 28 / 30

QA-Gates10 / 10
Stress-Test5 / 5
Human-in-the-Loop5 / 5
Versionierung & Audit Trail4 / 5
Rollen & Verantwortlichkeiten4 / 5
Go

90–100 Punkte

Freigabe möglich, sofern kein Release-Blocker besteht.

Conditional Go

80–89 Punkte

Korrektur und Retest erforderlich, bevor freigegeben werden kann.

Stop

< 80 Punkte

Oder sobald ein Release-Blocker besteht – unabhängig vom Score.

Ein hoher Score darf niemals einen kritischen Fehler kompensieren.

Release-Blocker – jeder Einzelne verhindert ein GO

  • Falsche Zahl
  • Falsche Einheit
  • Kritischer Faktenfehler
  • Fehlende wesentliche Quelle
  • Veraltete Regulatorik
  • Datenschutzverletzung
  • Ungeklärter Widerspruch
  • Fehlende Pflichtfreigabe
  • Nicht nachvollziehbare Datenherkunft
Approved Source Layer

Nur geprüfte Daten erreichen die KI

Jeder Datenwert trägt Herkunft, Version und Freigabestatus – bevor er überhaupt in ein Modell gelangt.

Interne Quellen + externe Regulatorik Datenkatalog Data Dictionary Qualitätsregeln Versionierung RAG / API KI Prüfbarer Output

Beispiel-Datensatz – jeder Wert im Datenkatalog trägt diese acht Merkmale:

Wert
12.480 t CO₂e
Einheit
t CO₂e
Berichtsperiode
2025
Quelle
ESG-Datenkatalog · Scope-1
Owner
Sustainability Owner
Aktualisierungsdatum
2026-08-31
Version
v1.3
Freigabestatus
Freigegeben
Evaluation Scorecard

Neun Kriterien für jeden Berichtsentwurf

Jedes Kriterium wird einzeln geprüft – ein PASS in Summe ersetzt keine einzelne Prüfung.

KriteriumPrüffrageMethodeStatus
Fakten-/ZahlenrichtigkeitStimmen alle Zahlen und Fakten mit der Quelle überein?Abgleich mit Datenkatalog & PrimärquellePASS
QuellenbelegIst jede wesentliche Aussage nachvollziehbar belegt?Quellenverifikation je AussagePASS
Regulatorische KonformitätEntsprechen Begriffe und Kennzahlen ESRS/CSRD/EU-Taxonomie?Abgleich mit Regulatory SnapshotPASS
DatenkonsistenzSind Zahlen über Kapitel und Vorjahresvergleiche widerspruchsfrei?Cross-Check zwischen BerichtsteilenPASS
VollständigkeitFehlen Pflichtangaben, Zeiträume oder Kennzahlen?Vollständigkeitscheck gegen BerichtsstrukturPASS
PlausibilitätSind Werte im Kontext von Vorjahren und Branche plausibel?Plausibilitäts- & AusreißerprüfungPASS*
Datenschutz & GovernanceEnthält der Output unzulässig verarbeitete Daten?Datenschutz-ReviewPASS
Neutralität / BiasIst die Darstellung neutral und ausgewogen?Redaktionelle ZweitprüfungPASS
Format & VerständlichkeitIst der Output verständlich und zielgruppengerecht formatiert?Redaktions- & LesbarkeitsprüfungPASS

* Plausibilitätshinweis in Kapitel „Klimabilanz" wurde vor Freigabe korrigiert und erneut getestet (siehe Freigabeprotokoll).

QA-Prozess

Zehn Schritte von der Datenbereitstellung bis zum Audit Trail

Jeder Schritt ist dokumentiert und nachvollziehbar – kein Sprung wird ausgelassen.

1Daten bereitstellen
2KI-Entwurf
3Automatisierte Checks
4Evaluation Scorecard
5Stress-Test
6Human Review
7Korrektur
8Retest
9Freigabe
10Audit Trail
Die KI darf niemals direkt vom Entwurf zur Veröffentlichung springen.
QA-Gates

Sechs Pflicht-Prüfschritte vor jeder Freigabe

Dieselben Gates wie im LLM- & KI-Strategie- und Cloud-Strategie-Blueprint – konsistent über das gesamte Berichtssystem.

1Datenprüfung
2Quellenprüfung
3Regulatorikprüfung
4Plausibilitätsprüfung
5Fachliche Freigabe
6Finale Freigabe
Ohne PASS aller Pflicht-Gates kein Release.
Stress-Test

Drei Belastungsstufen vor jeder Freigabe

Nicht nur der Normalfall wird geprüft, sondern gezielt Grenzfälle und Manipulationsversuche.

Happy Path

Normalfall – vollständige, korrekte und eindeutige Daten.

  • Richtige CO₂-Zahl korrekt übernommen

Edge Case

Grenzfall – unvollständige, widersprüchliche oder veraltete Daten.

  • Fehlender Monat in der Datenreihe
  • Widersprüchliche Quellen
  • Falsche Einheit (z. B. kg statt t)
  • Veraltete Regulatorik

Adversarial

Manipulation / Angriff – gezielte Versuche, die KI zu täuschen.

  • Halluzination (erfundene Zahl/Quelle)
  • Datenschutzverletzung im Prompt/Output
  • Prompt Injection
TestfallKategorieErwartetes VerhaltenStatus
Richtige CO₂-ZahlHappy PathWert wird unverändert mit Quellenbeleg übernommenPASS
Fehlender MonatEdge CaseLücke wird markiert, keine unmarkierte SchätzungPASS
Widersprüchliche QuellenEdge CaseWiderspruch wird gemeldet statt eigenständig aufgelöstPASS
Falsche EinheitEdge CaseEinheitenfehler wird erkannt, keine stille UmrechnungPASS
Veraltete RegulatorikEdge CaseSnapshot-Abweichung wird erkannt und gemeldetPASS
HalluzinationAdversarialOutput ohne Quellenbeleg wird durch QA-Gate 2 blockiertPASS
DatenschutzAdversarialPersonenbezogene Daten werden vor Freigabe blockiertPASS
Prompt InjectionAdversarialManipulative Anweisung im Input wird ignoriertPASS
Human-in-the-Loop

Sechs Rollen, eine gemeinsame Verantwortung

Jede Rolle prüft aus ihrer Perspektive – die finale Entscheidung bleibt beim Menschen.

AI / Process Owner

Verantwortet den KI-gestützten Erstellungsprozess sowie Modell- und Prompt-Versionierung.

Data Owner

Verantwortet Herkunft, Qualität und Freigabestatus der zugrunde liegenden Daten.

Sustainability Owner

Verantwortet die fachliche Richtigkeit der Nachhaltigkeitsinhalte.

Compliance / Datenschutz

Prüft Regulatorik, Datenschutz und rechtliche Zulässigkeit.

QA Reviewer

Führt Evaluation, Stress-Test und die sechs QA-Gates durch.

Management / Report Owner

Trifft die finale Freigabeentscheidung – GO, Conditional Go oder Stop.

KI
Human Review
Freigabe
KI empfiehlt – Verantwortliche entscheiden.
Blueprint-Architektur

Vom Rohdatensatz zum versionierten, prüfbaren Bericht

Acht Stufen, eine durchgängige Governance-Klammer.

Daten & Quellen
KI-Verarbeitung
Evaluation Engine
Stress-Test
Human-in-the-Loop
QA-Gates
Release-Entscheidung
GOConditional GoStop
Versionierter, prüfbarer Nachhaltigkeitsbericht

Governance-Klammer

Umschließt alle acht Stufen durchgängig – von der Datenherkunft bis zur Freigabe

Owner
Logging
Versionierung
Audit Trail
Eskalation
Datenschutz
Promptversion
Modellversion
Freigabestatus

Qualitätsdreieck

Evidenz Freigabe Tests
EvidenzDatenherkunft, Quellenbeleg, Nachvollziehbarkeit
TestsScorecard, Stress-Test, Testfälle
FreigabeQA-Gates, Human-in-the-Loop, Audit Trail

Qualitätstrend

v1.1 v1.2 v1.3 82 88 94

Qualität wird iterativ verbessert.

Freigabeprotokoll

Dokumentierte Freigabe für den aktuellen Berichtsentwurf

Jede Freigabe ist versioniert, datiert und nachvollziehbar – kein Release ohne Protokoll.

FeldWert
BerichtsteilKapitel „Klimabilanz & Emissionen"
Versionv1.3
ModellversionBeispiel: Frontier-Modell, Stand 2026-08 (Routing gemäß LLM- & KI-Strategie)
Promptversionprompt-esg-report-v1.3
Datenstand2026-08-31
Regulatory SnapshotESRS / CSRD, Stand 2026-Q3
Output Evaluation Score66 / 70
QA Process Score28 / 30
Release-Blocker0
Quellenbelegquote100 %
QA-Gates6/6 PASS
Korrekturen1 – Plausibilitätshinweis Kapitel „Klimabilanz", behoben und erneut getestet vor Freigabe
FachfreigabeSustainability Owner, 2026-09-03
Finale FreigabeManagement / Report Owner, 2026-09-04
Gesamtscore94 / 100
ReleaseentscheidungGO
Consulting-Fazit

Qualität entsteht durch Kontrolle, nicht durch Vertrauen

Qualität bei KI entsteht nicht durch Vertrauen in ein Modell, sondern durch messbare Kriterien, kontrollierte Daten, systematische Tests, dokumentierte QA-Gates und klare menschliche Verantwortung.

Transparenz vor Perfektion.
Evidenz vor Bauchgefühl.
Verantwortung vor Automatik.

ADLER · Nachhaltigkeit & KI