RAG Eval Ops: Retrieval vs. Answer
RAG-Qualität mit getrennten Retrieval- und Answer-Metriken, Golden Sets und Release-Gates nach jedem Re-Index betreiben — Brücke zu AI Eval ohne Umschreiben.
Eine flüssige falsche Antwort des Policy-Bots aus dem falschen Chunk wirkt wie Sprachmodell-Versagen. Oft ist es Retrieval-Versagen: der Index liefert den retired Policy-Chunk. Ohne getrennte Metriken tunen Teams Prompts ewig und fixen nie den Index.
Methodentiefe liegt in AI Eval; dieser Teil ist das Release-Operating-Model für freigegebene RAG-Pfade.
Vorher: Corpus Supply Chain und Poisoning. Weiter: Agent Tools, HITL und AI-Waivers.
zitiert der Bot eine Woche später wieder die retired Richtlinie.
Lösung: Jeder limited/high RAG-Release braucht ein RAG Eval Pack mit getrennten Retrieval- und Answer-Schwellen, einem versionierten Golden Set, Cards-Link und benanntem Owner, Steward und Waiver-Weg (minimal warnt).
In einem Satz: Kein RAG-Release ohne getrenntes Retrieval- und Answer-Gate, Golden Set und gespeicherte Eval-Pack-ID.
Entscheidung
Bevor ein Index- oder Prompt-Change einen sanctioned RAG-Pfad erreicht:
- ein RAG Eval Pack (
rag-eval-pack-v1) als Hard Gate fürlimited/high(Warn fürminimal); - getrennte Schichten — Retrieval (Recall@k, Filter, Empty-Hit) und Answer (Groundedness, Task Success, Refusal);
- ein versioniertes Golden Set (Query→Doc-IDs, Sensitivität, Owner = Path-Steward);
- Cards-Link zu Model/Dataset aus Teil 3 plus Restrisiko-Note;
- Owner für Schwellen, Steward für Golden Set und Review, Custodian für Pipeline-Block; Waiver nur über Teil 7.
Nie nur auf Answer-Scores promoten, wenn Retrieval-Regression failed.
Eval-Workflow
1. Schichten trennen
| Schicht | Was Sie messen | Fail heißt |
|---|---|---|
| Retrieval | Recall@k, MRR/nDCG, Filter-Korrektheit, Empty-Hit-Rate | falscher/fehlender Kontext — Index/Filter/Corpus vor Prompt-Tweaks |
| Answer | Groundedness, Policy-Compliance, Task Success, Refusal | Generator- oder Prompt/Tool-Issue auf korrektem Kontext |
Der Eval-Owner setzt Schwellen je Pfad. Der Steward veröffentlicht sie im Pack. Wer nur Answer-BLEU misst, tuned Prompts und lässt den retired Chunk stehen.
2. Golden Set versionieren
Steward besitzt das Set: 50–200 kritische Intents, Query→erwartete Doc-IDs, Sensitivität gelabelt. Synthetic oder redaktiert bevorzugen — Teil 4. Refresh bei Policy- oder Produktwechsel. Ein Set mit PII oder veralteten Policies ist selbst ein Incident.
3. Release an Builds hängen
Custodian triggert Eval bei neuem Index-Build, Embedding- oder Chunker-Wechsel, großem Corpus-Delta und Prompt-Change. Require: Retrieval-Pass + Answer-Pass + Cards-Link. Ohne Hook shippt der Hygiene-Re-Index auf Slack-Daumen — und Woche+1 zitiert der Bot die retired Policy.
4. Fails zurück verdrahten
Retrieval-Misses durch tote oder tainted Docs gehen an Junk→AI oder Teil 5, nicht an Prompt-Tuning. Steward dokumentiert den Fix im Pack. Ein Fail ohne Owner wird zum Dauer-Waiver.
5. Pack speichern
Custodian legt Pack-ID, Index/Build-ID, Golden-Set-Hash, Metriken, Pass/Fail/Waive und Reviewer ab. Owner bestätigt Restrisiko. Ohne gespeicherte ID ist der letzte Production-Change nicht auditierbar.
Handoffs
| Von | An | Artefakt |
|---|---|---|
| Path-Owner | Eval-Owner / Steward | Schwellen + Golden-Set-v1 |
| Steward | Custodian | Eval-Jobs an Index/Promote |
| Eval-Owner | Corpus-Steward | Retrieval-Fail → Hygiene oder Trust-Tier |
| Steward | Path-Owner | Pack Pass/Fail + Restrisiko-Note |
| Path-Owner | Waiver-Owner (Teil 7) | befristeter Waiver nur mit Ablauf |
Anti-Patterns
- Online-Demo oder Slack-Daumen als Regression behandeln
- Nur Answer-Scores messen, Hit-Rate@k ignorieren
- Re-Index nach Hygiene ohne Eval-Prüfpunkt shippen
- Golden Sets mit personenbezogene Daten oder veralteten Richtlinien fahren
- Eval-Fails still über Slack waiven
Umsetzung im Alltag
Dieser Einstieg ist kein Kalenderzwang und keine Leseliste. Nimm einen echten Fall, an dem sich die Entscheidung prüfen lässt.
Arbeitsweise: Nutze den verlinkten Plan als Arbeitsfläche für Owner, Termine und offene Punkte. Die fachliche Entscheidung muss trotzdem in der Story verständlich bleiben.
Starte mit dem kleinsten Fall, der fachlich wichtig genug ist. Prüfe danach, ob die Entscheidung wirklich auffindbar, umsetzbar und auditierbar ist. Rollenklärung: Wer hilft wem an der Quelle.
- Retrieval- und Answer-Schwellen für einen sanctioned RAG-Pfad festlegen.
- Golden Set v1 mit Owner und Sensitivitäts-Tags publizieren.
- Index/Promote an Eval-Jobs hängen und ein Release bei failed Retrieval blocken.
- Eval-Pack-ID des letzten Production-Change speichern.
Sanctioned AI Ops
Part 6 of 8
View series