Zum Inhalt springen
Search the hub
PII vor AI-Ingestion stoppen

PII vor AI-Ingestion stoppen

Verhindern, dass personenbezogene Daten und Secrets in Indexe, Feature Stores, Notebooks und Vendor-Fine-Tune-Uploads gelangen — scannen, maskieren, Nebenkopien steuern.

Category
Data Governance
Reading time
5 min
Published
Tags
data-governance pii ai-governance training-data rag privacy masking
Download PDF

Begriffe vor dem Lesen

  • Datenmüll — Daten, Dokumente oder Assets ohne belastbaren Zweck, zuständige Fachrolle, Aktualität, Herkunft oder Qualitätsnachweis.
  • KI-Suche — Retrieval-Augmented Generation: ein Modell ruft Inhalte zur Laufzeit ab, statt nur aus Training zu antworten.
  • Datenschutz-Folgenabschätzung / DSFA — Prüfung für Verarbeitungen, die ein hohes Risiko für betroffene Personen haben können.
  • Training — Nutzung von Daten, um Modellverhalten oder Features zu lernen.
  • Imputation / Schätzung — Ersetzen fehlender Werte durch abgeleitete Annahmen. Das muss sichtbar bleiben.
  • KI-Fitness — Eignung eines Assets für Retrieval, Training oder Agentennutzung mit Zweck, Qualität, Rechten und Nachweis.

Qualität, Quellkorrektur und AI-Nutzung

Datenqualität muss sichtbar machen, wo ein Problem behoben wurde. Wenn der Fehler im Quellsystem entsteht, ist die beste Behebung eine Korrektur an der Quelle oder mindestens ein dokumentierter Quellbefund mit Verantwortung. Wenn ETL oder ELT Werte nachgelagert bereinigt, schätzt, mappt oder filtert, braucht diese Änderung Nachweis: Regel, Grund, betroffene Felder, Version und erlaubte Nutzung.

Das ist besonders wichtig für AI. Retrieval, Training, Features und Agenten sehen oft nur das nachgelagerte Ergebnis. Ohne Kennzeichnung wissen sie nicht, ob ein Wert beobachtet, korrigiert, geschätzt, defaulted oder ausgeschlossen wurde. Governance muss Unsicherheit und Herkunft erhalten, statt sie hinter einem sauber wirkenden Datensatz zu verstecken.

Personenbezogene Daten aus HR-Exports, Supporttickets oder E-Mails dürfen nicht beiläufig in Embeddings, Prompt-Caches, Trainingsdaten oder Dienstleister-Uploads wandern. Prävention vor der Aufnahme ist einfacher, billiger und ehrlicher als nachträgliche Bereinigung in Teil 5.

Privacy-Pillars bleiben normativ: PII & Privacy Governance, DSDR Governance. Dieser Teil ist die präventive Betriebskontrolle auf dem Prep-Pfad.

Vorher: DQ-Gates für AI-Fitness. Weiter: Machine Unlearning und AI-Remediation.

Entscheidung

Bevor ein Pfad KI-Suche oder Training speist:

  1. Vor dem Verschieben klassifizieren: Keine Quelle ohne Sensitivität und rechtmäßigen KI-Zweck.
  2. Scannen und schützen: Personenbezogene Daten und Secrets im Bereinigungsschritt erkennen, maskieren oder entfernen; Trefferquoten dokumentieren.
  3. Speicher trennen: Produktionsindexe und Trainings-Snapshots teilen keine unkontrollierten Rohablagen.
  4. Dienstleister und Notebooks einbeziehen: Uploads und lokale Exporte brauchen dieselbe Zweckfreigabe und Scan-Nachweise.
  5. Nebenkopien listen: Caches, Evaluationssets, Logs und Embedding-Metadaten müssen bekannt sein. Refresh und Restore lösen Re-Scan aus.
  6. Rollen klären: Fachliche Verantwortung für Zweck, Steward für Kontrollkarte, Datenschutz für Sign-off, technischer Betreiber für Sperre.

KI-Suche mit minimierten Feldern ist nicht dasselbe wie Training auf vollständiger Gesprächshistorie. Training mit Personenbezug ist ein eigener Prüf- und Freigabefall, kein Crawl-Default.

Präventions-Workflow

1. Pfade mappen

Der Steward listet Crawl, Export, Feature-Job, Dienstleister und Notebook. Die fachlich zuständige Fachrolle setzt Sensitivität und KI-Zweck vor der Aktivierung. Ein nicht gemappter PoC-Upload ist eine blinde Stelle für Auskunft und Löschung.

2. Scrub mit Nachweis

Der technische Betreiber fährt Personen- und Secret-Scans im Bereinigungsschritt und speichert nur aggregierte Trefferquoten. Der Steward lässt das Gate aus Teil 3 fehlschlagen, wenn die Schwelle verletzt wird. Ein einmaliger Regex-Lauf ohne Protokoll hält Namen weiter in Chunks und Metadaten.

3. Vendor und Notebook blocken

Datenschutz und fachliche Verantwortung geben Uploads nur mit Zweckfreigabe und Scan-Nachweis frei. Der technische Betreiber blockiert unkontrollierte Dienstleisterpfade. „Nur für einen PoC“ außerhalb des Umfangs ist eine zweite Kopie ohne saubere Auskunfts- und Löschfähigkeit.

4. Nebenkopien inventarisieren

Der Steward listet Caches, Evaluationssets und Log-Aufbewahrung wie andere Nebenkopien — Nonprod, Exports…. Der technische Betreiber hängt Quell-Refreshs an einen Re-Scan des Dokumentbestands. Wer Caches auslässt, erzählt bei Auskunft und Löschung nur die halbe Wahrheit.

5. Dirty Ingest belegen

Der technische Betreiber belegt, dass ein unsauberer Ingest mit klarem Fehlergrund gestoppt wurde. Die fachlich zuständige Fachrolle hängt die Kontrollkarte an das DSDR-Runbook, damit klar ist, was bei einem Scheitern gelöscht oder neu aufgebaut werden muss. Ohne diesen Beweis bleibt das Gate Folie.

Praktische Übergabe

Von An Artefakt
Fachlich zuständige Fachrolle Steward Ingest-Pfade und Kontrollkarte für personenbezogene Daten
Steward Technischer Betreiber Scan-Tool, Schwelle, Masking-Policy
Datenschutz Fachlich zuständige Fachrolle Dienstleister-/Notebook-Freigabe oder Block
Steward Löschbetrieb Nebenkopie-Klassen und Aufbewahrung
Technischer Betreiber DSDR-Lead Fail-Reason + Purge-Hooks (Teil 5)

Anti-Patterns

  • personenbezogene Daten „kurz“ in Prompt oder Dokumentbestand lassen
  • Dienstleister-Fine-Tune mit Raw-CSV außerhalb Auskunfts- und Löschrechte-Umfang
  • Feature Store und Notebook am Warehouse-Masking vorbeiführen
  • Eval-Sets mit subjektbezogenen Texten behalten
  • Nicht-Produktion-Refresh ohne Re-Scan nach Scrub

Im Alltag betreiben

Dieser Einstieg ist ein Arbeitsmuster, keine Kalenderübung und keine Leseliste. Nimm einen echten Fall, an dem sich die Entscheidung prüfen lässt.

Arbeitsweise: Nutze den verlinkten Plan als Arbeitsfläche für zuständige Fachrolleen, Termine und offene Punkte. Die fachliche Entscheidung muss trotzdem in der Story verständlich bleiben.

Starte mit dem kleinsten echten Fall, der fachlich wichtig genug ist. Prüfe danach, ob die Entscheidung wirklich auffindbar, umsetzbar und auditierbar ist. Rollenklärung: Wer hilft wem an der Quelle.

  1. Jeden Ingest-Pfad (Crawl, Export, Vendor, Notebook) mappen.
  2. Sensitivität und AI-Zweck vor Path-Enablement verlangen.
  3. PII-Scan im Scrub fahren; nur aggregierte Nachweis speichern.
  4. Einen unmanaged Path blocken und den Fail-Reason loggen.

Tools und Quellen

Data Junk Before AI

Part 4 of 6

View series

Knowledge check

Tour