Zum Inhalt springen
Search the hub
Synthetic Data für AI und Nonprod

Synthetic Data für AI und Nonprod

Wann synthetische statt maskierter Daten für Training, Eval und Nonprod — mit Purpose Cards und Leakage-Checks.

Category
Data Governance
Reading time
4 min
Published
Tags
data-governance ai-governance synthetic-data privacy training-data nonprod
Download PDF

Synthetic Data für Policy-Bot-Evals und Nonprod ist kein Freifahrtschein. Es kann Patterns leaken, Eval verwirren und wieder in Prod-Corpora gelangen.

Dieser Teil entscheidet, wann synthetisch statt maskiert erlaubt ist — bevor ein Set Training, Eval oder Nonprod speist.

Vorher: Model- und Dataset-Cards die betrieben werden. Weiter: Corpus Supply Chain und Poisoning.

Lösung: Jedes synthetische Set, das Training, Eval oder Nonprod-AI speist, braucht eine Purpose Card mit Generator und Seed, getrennte Zwecke, Leakage- und Re-ID-Checks, ein Promote-Verbot nach Prod sowie Owner, Steward und Privacy-Freigabe.

In einem Satz: Kein synthetisches Set in Training, Eval oder Nonprod ohne Purpose Card, Leakage-Check und benanntes Promote-Verbot.

Entscheidung

Bevor ein synthetisches Set Training, Eval oder Nonprod-AI-Pfade speist:

  1. eine Synthetic Data Purpose Card je Set (train / eval / nonprod-ui) mit Generator-Methode, Seed-Policy und Nicht-Zielen;
  2. ein Promote-Verbot synthetic→Prod-Corpus — kein stilles Mischen in den Policy-Index;
  3. Leakage- und Utility-Checks plus Re-Identifikationsnote mit Privacy;
  4. Masking plus Subset statt Synthetic, wenn Prod-Bugs reproduziert werden müssen;
  5. Owner für Zweck, Steward für Card und Checks, Custodian für Ingest-Block; Junk→AI-Scrub wenn Synthetic auf reale Quellen trifft.

Nebenkopien bleiben im Deletion-Scope — Nonprod, Exports….

Synthetic-Workflow

1. Sets inventarisieren

Der Steward listet jedes synthetische Set, das einen AI-Pfad berührt — inkl. Generator-Exports und „temporärer“ Nonprod-Refreshes. Der Owner bestätigt den Zweck. Ohne Inventar landet ein uncarded Set im Train-Job, und niemand kann DSDR beantworten.

2. Purpose Card ausstellen

Eine Card pro Zweck: train, eval oder nonprod-ui. Generator, Seed-Policy und Nicht-Ziele gehören auf die Card, nicht ins Ticket. Custodian blockt Ingest ohne Card-ID. Eine Card für alle drei Zwecke ist dasselbe Schlupfloch wie „AI ok“ auf dem Mail-Export.

3. Leakage und Re-ID prüfen

Privacy und Steward fahren Membership-/Overlap-Checks gegen Prod-Stichproben und bewerten Utility ehrlich. Overfittete Generatoren leaken Patterns, auch wenn keine Klarnamen stehen. Ohne Check ist „synthetic = anonym“ eine Behauptung — PII vor AI-Ingestion stoppen.

4. Promote und Mischung sperren

Custodian verbietet stilles Promote in den Prod-Corpus. Eval-Golden-Sets labeln synthetisch vs. Prod; ungelabelte Mischung macht Retrieval-Metriken aus Teil 6 wertlos. Wer Prod-Bugs braucht, nimmt Masking plus Subset, nicht einen Generator, der die Verteilung glättet.

5. Nebenkopien und Refresh binden

Owner hängt Refresh und Restore an Re-Scan. Steward legt die Card neben Dataset Cards aus Teil 3. Custodian nimmt Synthetic-Kopien in den Deletion-Scope. Wer Synthetic aus dem Scope lässt, erzählt DSDR eine Lüge.

Handoffs

Von An Artefakt
Path-Owner Steward Set-Inventar + Purpose Card (train/eval/nonprod-ui)
Steward Privacy Leakage-/Re-ID-Note + Utility-Check
Privacy Owner Freigabe oder Block + DPIA-Hinweis
Steward Custodian Ingest-Regel + Promote-Verbot
Custodian Deletion Ops Nebenkopien-Liste für Synthetic-Sets

Anti-Patterns

  • Nicht-Produktion mit Raw-Produktion „vorübergehend“ befüllen
  • Synthetic als automatisch anonym und frei nutzbar behandeln
  • Eval-Golden-Sets aus synthetisch und Produktion ohne Labels mischen
  • Generator-Output still in den Produktion-Dokumentbestand promoten
  • Masking überspringen, obwohl ein Produktion-Bug reproduziert werden muss

Umsetzung im Alltag

Dieser Einstieg ist kein Kalenderzwang und keine Leseliste. Nimm einen echten Fall, an dem sich die Entscheidung prüfen lässt.

Arbeitsweise: Nutze den verlinkten Plan als Arbeitsfläche für Owner, Termine und offene Punkte. Die fachliche Entscheidung muss trotzdem in der Story verständlich bleiben.

Starte mit dem kleinsten Fall, der fachlich wichtig genug ist. Prüfe danach, ob die Entscheidung wirklich auffindbar, umsetzbar und auditierbar ist. Rollenklärung: Wer hilft wem an der Quelle.

  1. Alle synthetischen Sets an AI-Pfaden inventarisieren und je eine Purpose Card schreiben.
  2. Leakage- und Re-ID-Check mit Privacy für ein Train- oder Eval-Set fahren.
  3. Einen uncarded Set vom Train-Ingest blocken und den Fail loggen.
  4. Promote-Verbot synthetic→Prod im Custodian-Job verdrahten.

Tools und Quellen

Sanctioned AI Ops

Part 4 of 8

View series

Knowledge check

Tour