---
title: "KI-Modell-Evaluation: Testsets, Metriken und Gates"
description: "KI-Evaluation misst vor und nach Launch, ob ein modellgestütztes System Task-, Risiko-, Latenz- und Kostenanforderungen erfüllt."
canonical: "https://zephior.com/de/glossary/ai-model-evaluation"
last-updated: 2026-07-28
---

# KI-Modell-Evaluation: Testsets, Metriken und Gates

> KI-Evaluation misst vor und nach Launch, ob ein modellgestütztes System Task-, Risiko-, Latenz- und Kostenanforderungen erfüllt.

Von [Tony Kim](https://zephior.com/de/authors/tony-kim). Published 2026-07-28; updated 2026-07-28. 4 minute read.

## Definition

KI-Modell-Evaluation ist die systematische Messung eines Modells oder modellgestützten Systems gegen definierte Tasks, Kontexte, Risiken und Akzeptanzkriterien. Repräsentative Testfälle, menschliche oder automatische Judgements und Betriebsmetriken stützen den Release-Entscheid.

## Problem

Ein öffentlicher Benchmark repräsentiert selten den Unternehmensworkflow. Ein hoher Durchschnitt versteckt Fehler in Sprache, Dokumenttyp oder Segment. Subjektive Spot Checks belohnen Eloquenz und erkennen Regression schlecht. Nur das Modell zu testen ignoriert Retrieval, Prompts, Tools und Interaktion.

## Perspektive

Evaluieren Sie die kleinste entscheidungsnützliche Einheit und den gesamten wertschöpfenden Workflow. Versionieren Sie Cases, Rubrics, Systeme und Resultate, zeigen Sie kritische Slices und verbinden Sie jeden Score mit Release, Rollback oder Improvement.

## Komponenten und End-to-end-System evaluieren

Component Tests isolieren Ursachen. Retrieval prüft nötige Evidenz, Generation die Treue zur Evidenz. Tool Tests validieren Wahl und Argumente. Policy Tests prüfen Abstention, Escalation und Permissions.

End-to-end fragt, ob ein realer User die Arbeit korrekt und effizient erledigt. Eine Komponente kann besser werden, ohne den Workflow zu verbessern; ein gutes Resultat kann unsichere Zwischenschritte verbergen. Beide Ebenen sind nötig.

| Layer | Frage | Beispiel |
| --- | --- | --- |
| Retrieval | Wurde nötige Evidenz gewählt? | Recall und Context Precision |
| Generation | Folgt Output der Evidenz? | Korrektheit und Unsupported Claims |
| Tool Use | War die Aktion korrekt? | Selection und Argument Validity |
| Workflow | Erreichte der User das Ziel? | Accepted Completion und Zeit |
| Operations | Ist es skalierbar? | Latenz, Kosten und Recovery |

## Ein Score zählt nur, wenn er einen Entscheid verändert

Setzen Sie Thresholds vor dem neuen Resultat. Release verlangt vielleicht keine Critical Regression, Minimum Success, Maximum Unsupported Claims und begrenzte Kosten. Risk Tiers nutzen unterschiedliche Gates und Human Review.

Dokumentieren Sie Exceptions mit Owner, Evidenz, Scope und Ablauf. Ein Waiver erzeugt Mitigation oder Rollout Constraint. Re-evaluieren Sie nach Modell-, Prompt-, Corpus-, Retrieval-, Tool- oder Policy-Change.

- Cases, Expected Results, Rubrics und Systeme versionieren.
- Geschütztes Holdout bewahren.
- Confidence und Sample Size mit Scores zeigen.
- Critical Slices vor Durchschnitt prüfen.
- Thresholds an Release und Rollback koppeln.

## Ablauf

1. **Den Evaluationsentscheid definieren.** Klären Sie Modellwahl, Release, Promptvergleich oder Drift Monitoring. Definieren Sie Success Unit, materiellen Fehler und Thresholds. Nehmen Sie Latenz, Kosten, Privacy und Operations auf, wenn sie den Outcome beeinflussen.
2. **Ein repräsentatives Caseset bauen.** Sampeln Sie reale Taskverteilungen mit Permission und De-Identification. Ergänzen Sie Boundary-, Rare-, Multilingual- und Adversarial-Cases. Bewahren Sie erwartete Evidenz und Notes. Ein geschütztes Holdout verhindert Überoptimierung auf bekannte Beispiele.
3. **Verlässliche Masse wählen.** Nutzen Sie deterministische Checks für Schema, Zitate und Berechnungen und Expert Rubrics für Nuance. Kalibrieren Sie Reviewer, messen Sie Disagreement und nutzen Sie blinde Vergleiche. Ersetzen Sie kein Business-Kriterium durch eine bequeme Proxy.
4. **Gates laufen lassen und Change monitoren.** Erfassen Sie Modell-, Prompt-, Retrieval-, Tool- und Codeversion. Vergleichen Sie Baseline, prüfen Sie Slice Regression und untersuchen Sie Fehler. Blockieren Sie bei Critical Threshold. Monitoren Sie Production Outcomes und integrieren Sie neue Failure Patterns kontrolliert.

## Wichtige Entscheidungen

- Welchen Deployment- oder Produktentscheid stützt die Evaluation?
- Welche Nutzer- und Fehlerverteilungen muss das Set repräsentieren?
- Misst die Metrik Qualität oder nur eine bequeme Proxy?
- Welche Slices brauchen eigene Minima statt Durchschnitt?
- Welche Regression löst Block, Rollback oder Human-only aus?

## Risiken

- Optimierung auf das Testset generalisiert nicht.
- Durchschnitte verbergen katastrophale Fehler in kleinem Risk Slice.
- Unkalibrierte Judges belohnen Stil statt faktischer Korrektheit.
- Gleichzeitiger Rubric- und Systemwechsel zerstört Vergleichbarkeit.
- Production Thumbs-up kann Fatigue statt Korrektheit zeigen.

## Kennzahlen

- Task Success und Critical Failure Rate
- Performance je Sprache, Quelle und Risk Slice
- Reviewer Agreement und offene Judgements
- Citation-, Schema- und Tool-Call-Validität
- Latenz und Kosten je akzeptiertem Outcome
- Regressionshäufigkeit und Rollback-Zeit

## Häufige Fragen

### Was ist KI-Modell-Evaluation?

Die systematische Prüfung eines Modells oder KI-Systems gegen repräsentative Tasks, Risiken und Akzeptanzkriterien für Wahl, Release und Monitoring.

### Welche Metriken braucht eine LLM-Evaluation?

Task-spezifische Korrektheit und Critical Failure plus relevante Citation-, Schema-, Tool-, Latenz-, Kosten- und Human-Correction-Masse. Keine Universalmetrik deckt alles.

### Kann ein LLM Outputs bewerten?

Es kann kalibriert gegen Expert Judgement unterstützen, ist aber keine alleinige Instanz bei High-impact- oder subtiler Fachkorrektheit. Klare Rubrics und Disagreement Review sind nötig.

### Wann läuft Evaluation?

Vor Erstrelease, nach materiellen Änderungen an Modell, Prompt, Daten, Retrieval, Tools oder Policy und kontinuierlich auf angemessen gesampeltem Production Behavior.


## Primärquellen

- [NIST AI Resource Center](https://airc.nist.gov/), NIST
