Sparkassen Corporate Design – Konzeptdarstellung. Farben und Bildmarke sind angenähert und ersetzen keine offizielle Markenvorgabe.
Sparkasse FürstenfeldbruckNachhaltigkeit · interne Auswertung
Auf dieser Seite
KI-Consulting Blueprint

LLM- & KI-Strategie

Die richtige KI. Für die richtige Aufgabe. Im richtigen Kontext.

Modellstrategie für den KI-gestützten Nachhaltigkeitsbericht der Sparkasse Fürstenfeldbruck: Microsoft-first in der Arbeitsoberfläche, Multi-Model in der Qualitätssicherung und Governance über den gesamten Daten- und Modell-Lifecycle.

Management-Empfehlung

Microsoft-first Governance.
Multi-Model für Qualität.
Routing statt Einheitsmodell.

Copilot und Teams bilden die sichere Enterprise-Arbeitsoberfläche. Ein Managed-AI-Layer steuert RAG, Agenten, Modellrouting und Qualität. Spezialmodelle werden nur dort eingesetzt, wo sie einen messbaren Mehrwert schaffen.

Empfohlene Modellstrategie

Drei Schichten statt eines Einheitsmodells

Jede Schicht hat eine klar abgegrenzte Rolle – vom Arbeitsalltag bis zur Datensouveränität.

01

Microsoft als Enterprise-Basis

  • Microsoft Teams
  • Word
  • Excel
  • PowerPoint
  • SharePoint
  • OneDrive
  • Microsoft 365 Copilot
  • Copilot Studio

Microsoft bildet die primäre Arbeits- und Integrationsoberfläche.

02

Frontier-Modelle gezielt ergänzen

Modelle

OpenAI GPT · Claude · Gemini

Einsatz

  • Deep Research
  • Long Documents
  • Komplexe Analyse
  • Redaktionsqualität
  • Coding
  • Qualitätssicherung
  • Cross-Checks

Nicht jeder Nutzer benötigt jedes Modell. Spezialmodelle werden gezielt eingesetzt.

03

Open-Weight als strategische Option

Einbeziehen

Mistral · Llama · Qwen · DeepSeek · Kimi · GLM

Einsatz

  • Private Verarbeitung
  • Self-Hosting
  • Kostenoptimierung
  • Modellvergleich
  • Spezielle Use Cases

Mehr Datensouveränität bedeutet gleichzeitig mehr Betriebs- und Governance-Verantwortung.

Datenklassifikation

Welche Daten dürfen wohin?

Die Ampel entscheidet, welche Modelle und Umgebungen für eine Information zulässig sind.

Grün – öffentlich / freigegeben

  • Veröffentlichte Nachhaltigkeitsberichte
  • Homepage-Inhalte
  • Öffentliche regulatorische Quellen
  • ESRS · CSRD · EU-Taxonomie
  • Freigegebene aggregierte Kennzahlen
Geeignet für: Enterprise Research, ChatGPT, Claude, Gemini, Perplexity, mehrere Modelle zum Cross-Check

Gelb – intern / kontrolliert

  • Berichtsentwürfe
  • Interne ESG-KPIs
  • Prozessinformationen
  • Unveröffentlichte Tabellen
  • Interne Dokumente
Nur verwenden mit: Business-/Enterprise-Umgebungen, Rollen- & Rechtekonzept, Logging, Verschlüsselung, Datenresidenz, freigegebenen Providern

Rot – sensibel / kritisch

  • Kundendaten
  • Personenbezogene Rohdaten
  • Credentials
  • Geschäftsgeheimnisse
  • Sensible Risikodaten
Keine ungeprüfte Verarbeitung über externe Consumer-KI. Nur: interne Systeme, Private Cloud, genehmigte Enterprise-Architektur, ggf. Open-Weight/Self-Hosting.
Modell-Landschaft

Sieben Systeme, sieben klar abgegrenzte Rollen

Von der Arbeitsoberfläche bis zum Multi-Model-Router – jedes System hat eine definierte Aufgabe im Gesamtbild.

Microsoft 365 Copilot

Oberflächen

Teams · Word · Excel · Outlook · PowerPoint · SharePoint · Copilot Studio

Geeignet für

  • Meetings & interne Zusammenarbeit
  • Office-Dokumente & Tabellen
  • Wissenszugriff, interne Agenten

Enterprise-Arbeitsoberfläche für den Kunden.

OpenAI

Produkte

ChatGPT · ChatGPT Work · Codex · API

Modelle & Routing

  • Sol – komplexe Analyse, Strategie, QA, schwierige Reasoning-Aufgaben
  • Terra – produktiver Default, Standard-Wissensarbeit, Agenten
  • Luna – Extraktion, Klassifizierung, große Mengen, kostengünstiges Routing
  • Codex – HTML/CSS/JS, Website-Erstellung, Codeprüfung, Refactoring

Anthropic Claude

Produkte

Claude · Projects · Claude Code · Skills · MCP

Beste Einsatzfelder

  • Lange Dokumente, hochwertige Texte
  • Konzepte & Strategie, Redaktionsqualität
  • Zweitmodell-Review, agentisches Coding

Sehr stark für Long-form Content und strukturierte Wissensarbeit.

Google Gemini

Produkte

Gemini · AI Studio · Deep Research

Stärken

  • Sehr große Kontexte, viele Dokumente
  • Multimodalität: Audio, Video, Bilder
  • Große Wissensbestände

Spezial- und Benchmark-Modell, nicht primäre Arbeitsplattform.

Perplexity / Research-Layer

Geeignet für

  • Aktuelle Webrecherche
  • Quellen & Grounding
  • Regulatorisches Monitoring
  • Gegenprüfung

Regel: Rechercheergebnisse nie ungeprüft als fachliche Wahrheit übernehmen. Quellen, Datum und Abruf müssen dokumentiert werden.

OpenRouter

Multi-Model-Router für Test, Benchmarking und A/B-Vergleiche

Geeignet für

  • Modell- & Preisvergleich
  • Fallback-Strategien
  • Identische Testprompts über mehrere Modelle
  • Evaluation

Für Bankproduktion nur nach Prüfung von: Provider, Datenregion, Logging, Datenschutz, DPA, Subprozessoren, DORA, Informationssicherheit.

Open-Weight / Open Source

Mistral · Llama · Qwen · DeepSeek · Kimi · GLM

Open Weight ist nicht automatisch vollständig Open Source.

Vorteile

  • Kontrolle, Self-Hosting
  • Anpassbarkeit
  • Datensouveränität
  • Geringere Vendor-Abhängigkeit

Nachteile

  • Eigener Betrieb & Infrastruktur
  • Security & Monitoring
  • Updates & Modell-Evaluation
  • Höhere technische Verantwortung
LongDoc-Strategie

Große Dokumentmengen brauchen eine Strategie, keine Einzelentscheidung

LongDoc ist keine einzelne Plattform, sondern eine Verarbeitungsstrategie – z. B. für ESRS, CSRD, Richtlinien, Nachhaltigkeitsberichte, Policies, Prüfberichte, Verträge, große PDF-Sammlungen.

Long Context

Dokumente direkt in ein Modell mit großem Kontext geben.

Geeignet für

  • Einmalige Analyse
  • Exploration
  • Schnelle Zusammenfassungen

RAG

Dokumente indexieren und nur relevante Textstellen abrufen.

Geeignet für

  • Produktive Unternehmenssysteme
  • Nachvollziehbare Quellen
  • Wiederkehrende Nutzung, große Wissensbestände
  • Reporting-Agenten
Für den Nachhaltigkeitsbericht langfristig RAG mit Quellenbeleg verwenden.
Entscheidungstabelle

Wann nutze ich welches Programm?

Die zehn häufigsten Aufgaben im Berichtsprozess, jeweils mit Primärlösung, Alternative und Datenklasse.

AufgabePrimärlösungAlternativeWarumDatenklasse
Teams / Meetings / ZusammenarbeitMicrosoft 365 CopilotNative Integration ins ArbeitsumfeldGelb
Word- und PowerPoint-BerichtCopilot + ChatGPT WorkClaude für Redaktions-QAOfficenahe Erstellung, hochwertige ZweitmeinungGelb
ESRS / CSRD / Taxonomie ResearchDeep Research / Perplexity / ChatGPT ResearchGemini / ClaudeAktuelle, breite QuellenlageGrün
Große PDF-MengenGemini oder ClaudeRAG + GPT/Claude/Gemini (Produktion)Großer Kontext bzw. nachvollziehbare ProduktionGelb
ESG-Daten extrahierenGünstige Modelle (Luna-/Flash-/Haiku-Klasse)Hohes Volumen, geringe KomplexitätGelb
Komplexe PlausibilitätsprüfungGPT Sol / Claude Opus-KlasseGemini Pro (Cross-Check)Höchste Reasoning-Tiefe nötigGelb / Rot
AgentenCopilot Studio / freigegebene Managed-AI-PlattformOpenAI Agents, Claude SkillsGovernance & Logging integriertGelb
Website / HTML / CodingCodexClaude Code, Gemini CLISpezialisiert auf CodequalitätGrün
ModellvergleichOpenRouter + eigenes Eval-SetHugging FaceNeutraler Multi-Provider-VergleichGrün
Höchste DatensouveränitätPrivate Open-Weight-ModelleVolle Kontrolle über Infrastruktur & DatenRot
Chat, Research, Work oder Agent?

Vier Stufen steigender Autonomie – und steigender Governance-Anforderung

Je höher die Stufe, desto mehr Kontrolle, Logging und Freigabe sind erforderlich.

1

Chat

  • Fragen beantworten, Brainstorming
  • Texte, E-Mails
  • Kurze Analysen, Ideen
Beispiele: ChatGPT, Claude, Gemini, Copilot Chat
2

Research

  • Komplexe Recherche, mehrere Quellen
  • Marktanalysen, Regulatorik
  • Vergleich, Strategie
Beispiele: ChatGPT Deep Research, Claude Research, Gemini Deep Research, Perplexity
3

Work

  • Mehrstufige Wissensarbeit
  • Dokumenterstellung, Präsentationen
  • Längere, wiederkehrende Aufgaben
Beispiele: ChatGPT Work, Claude Cowork, Microsoft Copilot
4

Agent

  • Wiederkehrende Prozesse, Tool-Nutzung
  • Automatisierte Arbeitsschritte, Datenabfragen
  • Workflows, Reporting-Prozesse
Beispiele: Copilot Studio, OpenAI Agents, Claude Skills, Enterprise-Agent-Plattformen
Empfohlene Zielarchitektur

Drei Ebenen von der Arbeitsoberfläche bis zu Daten & Modellen

Ein Managed-AI-Layer steuert das Routing zwischen günstigen, Standard- und Frontier-Modellen.

Ebene 1 · Nutzer & Arbeitsoberfläche
TeamsWordExcelPowerPointMicrosoft 365 CopilotSharePoint / OneDrive
Ebene 2 · Managed AI & Orchestrierung

Copilot Studio / freigegebene Enterprise AI Platform

Zentrale Steuerungsschicht für RAG, Agenten, Routing, Guardrails und Freigaben

RAG
Agenten
Prompt Management
Modell-Routing
Guardrails
Evaluation
Logging
Monitoring
API Gateway
Human-in-the-Loop
günstiges Modell Standardmodell Frontier-Modell

Interne Daten

  • ESG
  • Finance
  • Gebäude
  • Einkauf
  • HR
  • Risiko
  • Reporting

Öffentliche Quellen

  • ESRS
  • CSRD
  • EU-Taxonomie
  • Regulatorische Webseiten
  • Nachhaltigkeitsberichte

Modelle

  • OpenAI
  • Claude
  • Gemini
  • Microsoft
  • Open-Weight bei Bedarf
Governance

Ein Governance-Layer für den gesamten Modell-Lifecycle

Von DSGVO und DORA bis zur Exit-Strategie – 18 Kontrollpunkte, die die Modellstrategie absichern.

DSGVO
DORA
EU AI Act
Datenschutz
Informationssicherheit
IAM
Rollen & Rechte
Datenklassifikation
Provider Management
Audit-Rechte
Datenresidenz
Unterauftragnehmer
Logging
Modellversionierung
Promptversionierung
Exit-Strategie
Business Continuity
Kostenkontrolle
Die Verantwortung bleibt bei der Sparkasse.
QA-Gates

Sechs Prüfschritte zwischen Modellausgabe und Veröffentlichung

Dieselben Pflicht-Gates wie im Cloud-Strategie-Blueprint – konsistent über das gesamte Berichtssystem.

1Datenprüfung
2Quellenprüfung
3Regulatorikprüfung
4Plausibilitätsprüfung
5Fachliche Freigabe
6Finale Freigabe
Kein autonomes Veröffentlichen des Nachhaltigkeitsberichts.

Human-in-the-Loop ist verpflichtend.

Vollständiger Blueprint: Eval & QA

Preisstruktur

Kostenrichtwerte für die wichtigsten Bausteine

Preise ändern sich häufig – vor jeder Beschaffung gegenprüfen.

Richtwerte – Stand September 2026

Microsoft 365 Copilot

ca. 26 € / Nutzer / Monat

bei jährlicher Abrechnung, abhängig vom Vertrag

OpenAI API – Routing-Beispiel

Luna: ca. $0,20 Input / $1,20 Output pro 1 Mio. Tokens Terra: ca. $2 / $12 pro 1 Mio. Tokens Sol: ca. $4 / $20 pro 1 Mio. Tokens

Copilot Studio

verbrauchs- / creditbasiert

OpenRouter

Pay-as-you-go

Hugging Face

Provider Routing / dedizierte Inference-Endpunkte

Für Claude, Gemini, Mistral, DeepSeek, Qwen u. a.: keine starren Preise, solange sie nicht aktuell verifiziert sind. Stattdessen gilt: aktuellen Listenpreis vor Beschaffung prüfen.

Kostenstrategie

Nicht der günstigste Tokenpreis zählt

Tokenkosten, Arbeitszeit, Retry-Kosten, Nachbearbeitung, Fehler, Qualität, First-Pass-Freigabe, Quellenqualität und Geschwindigkeit fließen gemeinsam in die Bewertung ein.

Die wichtigste Kennzahl

Kosten pro erfolgreich erledigter Aufgabe

Einfache Aufgaben
→ günstige Modelle
Standardaufgaben
→ Workhorse-Modelle
Komplexe/kritische Aufgaben
→ Frontier-Modelle
Living Model Strategy

Die Strategie wird regelmäßig aktualisiert, nicht einmal festgelegt

Modelle, Preise und Regulatorik verändern sich schneller als klassische IT-Strategien – drei feste Prüfrhythmen fangen das ab.

monatlich

Kurzfristig prüfen

  • Modellneuheiten
  • Preise
  • Retirements
  • Sicherheitsänderungen
  • Provideränderungen
quartalsweise

Benchmark durchführen

Mit identischen Testaufgaben

  • Qualität
  • Kosten
  • Geschwindigkeit
  • Quellen
  • Halluzinationen
  • Fehlerquote
jährlich

Strategisch prüfen

  • Zielarchitektur
  • Vendor Lock-in
  • Microsoft-Abhängigkeit
  • Multi-Model-Optionen
  • Open-Weight / Self-Hosting
  • Providerstrategie
30–60–90-Tage-Roadmap

Kontrollierter Einstieg in die Modellstrategie

Drei Phasen, klar messbar, mit definierter Entscheidung am Ende.

0–30 Tage

Vorbereitung

  • Use Case finalisieren
  • Pilotkapitel wählen
  • Daten klassifizieren
  • Microsoft-Landschaft analysieren
  • Provider-Kriterien festlegen
  • Governance prüfen
  • Eval-Testset aufbauen
  • Kostenhypothese erstellen
31–60 Tage

Aufbau

  • Copilot-/M365-Workflow testen
  • RAG-MVP aufbauen
  • 2–3 Modelle benchmarken
  • Agent testen
  • QA-Gates implementieren
  • Rollen & Logging einrichten
61–90 Tage

Messung & Entscheidung

  • Qualität, Zeitersparnis messen
  • Quellenbelegquote prüfen
  • Nacharbeit & Fehler analysieren
  • Kosten bewerten
  • Nutzerakzeptanz einholen
  • Governance-Risiken prüfen

GO / ADJUST / STOP

Consulting-Fazit

Die empfohlene Strategie im Überblick

Empfohlene Strategie

Microsoft-first Enterprise Experience + Managed AI Platform + Controlled Multi-Model Routing + RAG + Human-in-the-Loop + Governance

Für den KI-gestützten Nachhaltigkeitsbericht empfiehlt sich kein Winner-takes-all-Modell. Die robuste Lösung ist eine Microsoft-first Enterprise-Arbeitsoberfläche mit kontrollierter Multi-Model-Strategie, RAG und Quellenbeleg, kostenbasiertem Routing sowie klaren Human- und Governance-Gates.

ADLER · Nachhaltigkeit & KI