Zum Inhalt springen
Search the hub
RAG Eval Ops: Retrieval vs. Answer

RAG Eval Ops: Retrieval vs. Answer

RAG-Qualität mit getrennten Retrieval- und Answer-Metriken, Golden Sets und Release-Gates nach jedem Re-Index betreiben — Brücke zu AI Eval ohne Umschreiben.

Category
Data Governance
Reading time
4 min
Published
Tags
data-governance ai-governance rag ai-eval quality stewardship
Download PDF

Eine flüssige falsche Antwort des Policy-Bots aus dem falschen Chunk wirkt wie Sprachmodell-Versagen. Oft ist es Retrieval-Versagen: der Index liefert den retired Policy-Chunk. Ohne getrennte Metriken tunen Teams Prompts ewig und fixen nie den Index.

Methodentiefe liegt in AI Eval; dieser Teil ist das Release-Operating-Model für freigegebene RAG-Pfade.

Vorher: Corpus Supply Chain und Poisoning. Weiter: Agent Tools, HITL und AI-Waivers.

zitiert der Bot eine Woche später wieder die retired Richtlinie.

Lösung: Jeder limited/high RAG-Release braucht ein RAG Eval Pack mit getrennten Retrieval- und Answer-Schwellen, einem versionierten Golden Set, Cards-Link und benanntem Owner, Steward und Waiver-Weg (minimal warnt).

In einem Satz: Kein RAG-Release ohne getrenntes Retrieval- und Answer-Gate, Golden Set und gespeicherte Eval-Pack-ID.

Entscheidung

Bevor ein Index- oder Prompt-Change einen sanctioned RAG-Pfad erreicht:

  1. ein RAG Eval Pack (rag-eval-pack-v1) als Hard Gate für limited/high (Warn für minimal);
  2. getrennte Schichten — Retrieval (Recall@k, Filter, Empty-Hit) und Answer (Groundedness, Task Success, Refusal);
  3. ein versioniertes Golden Set (Query→Doc-IDs, Sensitivität, Owner = Path-Steward);
  4. Cards-Link zu Model/Dataset aus Teil 3 plus Restrisiko-Note;
  5. Owner für Schwellen, Steward für Golden Set und Review, Custodian für Pipeline-Block; Waiver nur über Teil 7.

Nie nur auf Answer-Scores promoten, wenn Retrieval-Regression failed.

Eval-Workflow

1. Schichten trennen

Schicht Was Sie messen Fail heißt
Retrieval Recall@k, MRR/nDCG, Filter-Korrektheit, Empty-Hit-Rate falscher/fehlender Kontext — Index/Filter/Corpus vor Prompt-Tweaks
Answer Groundedness, Policy-Compliance, Task Success, Refusal Generator- oder Prompt/Tool-Issue auf korrektem Kontext

Der Eval-Owner setzt Schwellen je Pfad. Der Steward veröffentlicht sie im Pack. Wer nur Answer-BLEU misst, tuned Prompts und lässt den retired Chunk stehen.

2. Golden Set versionieren

Steward besitzt das Set: 50–200 kritische Intents, Query→erwartete Doc-IDs, Sensitivität gelabelt. Synthetic oder redaktiert bevorzugen — Teil 4. Refresh bei Policy- oder Produktwechsel. Ein Set mit PII oder veralteten Policies ist selbst ein Incident.

3. Release an Builds hängen

Custodian triggert Eval bei neuem Index-Build, Embedding- oder Chunker-Wechsel, großem Corpus-Delta und Prompt-Change. Require: Retrieval-Pass + Answer-Pass + Cards-Link. Ohne Hook shippt der Hygiene-Re-Index auf Slack-Daumen — und Woche+1 zitiert der Bot die retired Policy.

4. Fails zurück verdrahten

Retrieval-Misses durch tote oder tainted Docs gehen an Junk→AI oder Teil 5, nicht an Prompt-Tuning. Steward dokumentiert den Fix im Pack. Ein Fail ohne Owner wird zum Dauer-Waiver.

5. Pack speichern

Custodian legt Pack-ID, Index/Build-ID, Golden-Set-Hash, Metriken, Pass/Fail/Waive und Reviewer ab. Owner bestätigt Restrisiko. Ohne gespeicherte ID ist der letzte Production-Change nicht auditierbar.

Handoffs

Von An Artefakt
Path-Owner Eval-Owner / Steward Schwellen + Golden-Set-v1
Steward Custodian Eval-Jobs an Index/Promote
Eval-Owner Corpus-Steward Retrieval-Fail → Hygiene oder Trust-Tier
Steward Path-Owner Pack Pass/Fail + Restrisiko-Note
Path-Owner Waiver-Owner (Teil 7) befristeter Waiver nur mit Ablauf

Anti-Patterns

  • Online-Demo oder Slack-Daumen als Regression behandeln
  • Nur Answer-Scores messen, Hit-Rate@k ignorieren
  • Re-Index nach Hygiene ohne Eval-Prüfpunkt shippen
  • Golden Sets mit personenbezogene Daten oder veralteten Richtlinien fahren
  • Eval-Fails still über Slack waiven

Umsetzung im Alltag

Dieser Einstieg ist kein Kalenderzwang und keine Leseliste. Nimm einen echten Fall, an dem sich die Entscheidung prüfen lässt.

Arbeitsweise: Nutze den verlinkten Plan als Arbeitsfläche für Owner, Termine und offene Punkte. Die fachliche Entscheidung muss trotzdem in der Story verständlich bleiben.

Starte mit dem kleinsten Fall, der fachlich wichtig genug ist. Prüfe danach, ob die Entscheidung wirklich auffindbar, umsetzbar und auditierbar ist. Rollenklärung: Wer hilft wem an der Quelle.

  1. Retrieval- und Answer-Schwellen für einen sanctioned RAG-Pfad festlegen.
  2. Golden Set v1 mit Owner und Sensitivitäts-Tags publizieren.
  3. Index/Promote an Eval-Jobs hängen und ein Release bei failed Retrieval blocken.
  4. Eval-Pack-ID des letzten Production-Change speichern.

Sanctioned AI Ops

Part 6 of 8

View series

Knowledge check

Tour