Teil 1
Müll-Assets vergiften den AI-Kontext
Die Serie Datenmüll vor AI verbindet Datenhygiene mit KI-Nutzung. Sie beantwortet eine einfache, aber wichtige Frage: Welche Daten, Dokumente und Auswertungen dürfen überhaupt in eine KI-Suche, ein Training oder einen Agenten gelangen?
Das Problem entsteht oft unspektakulär. Eine alte Auswertung bleibt im Katalog sichtbar, obwohl niemand sie mehr verantwortet. Ein SharePoint-Ordner enthält veraltete Richtlinien. Eine Excel-Kopie wurde vor Jahren für einen Sonderfall erstellt und nie gelöscht. Für Menschen sind solche Altlasten manchmal erkennbar. Eine KI-Suche sieht dagegen zunächst nur: Der Inhalt ist erreichbar.
Darum braucht AI-Governance eine klare Verbindung zur Datenhygiene. Bevor ein Asset in Retrieval oder Training kommt, muss bekannt sein, ob es behalten, archiviert, ausgeschlossen oder gelöscht wird. Leere Freigabe bedeutet nicht „vielleicht geeignet“, sondern „gesperrt, bis jemand Verantwortung übernimmt“.
Anschluss an Datenhygiene, Bewerten: behalten, archivieren oder stilllegen und Metadaten für AI.
Weiter: Aufräumen vor Retrieve oder Train.
Die folgenden Teile zeigen den praktischen Ablauf: erst den Bestand aufräumen, dann Qualitäts-Gates setzen, personenbezogene Daten vor KI-Ingestion stoppen und im Ernstfall Unlearning oder Remediation sauber nachweisen.
Ausgangspunkt
Das Hygiene-Register kennt den Orphan-Mart sales_legacy_2019: keine zuständige Fachrolle, keine aktuelle Nutzung. Der Katalog zeigt ihn trotzdem weiter. Der RAG-Crawl nimmt ihn auf, weil „die Tabelle existiert“. Der Assistent liefert später eine selbstbewusste Zahl aus diesem toten Mart. Der Vorfall lautet dann schnell „AI hat gelogen“. Tatsächlich wurde eine veraltete Quelle nie aus dem KI-Kontext herausgehalten.
Was diese Serie leistet
- Orientierung: Exclusion Register, Disposition vor Ingest, Retrieval ≠ Training (diese Seite)
- Vertiefung: Aufräumen vor Retrieve oder Train
- Vertiefung: DQ-Gates für KI-Fitness
- Vertiefung: personenbezogene Daten vor KI-Ingestion stoppen
- Abschluss: Machine Unlearning und KI-Remediation
Die Beispiele sind Lehrfälle (keine Kundendaten). Ersetzt Asset-, Corpus- und Toolnamen durch eure Catalog-, Hygiene- und Prozessquellen.
Begriffe vor dem Lesen
- Datenmüll — Daten, Dokumente oder Assets ohne belastbaren Zweck, zuständige Fachrolle, Aktualität, Herkunft oder Qualitätsnachweis.
- KI-Suche — Retrieval-Augmented Generation: ein Modell ruft Inhalte zur Laufzeit ab, statt nur aus Training zu antworten.
- Training — Nutzung von Daten, um Modellverhalten oder Features zu lernen.
- Imputation / Schätzung — Ersetzen fehlender Werte durch abgeleitete Annahmen. Das muss sichtbar bleiben.
- KI-Fitness — Eignung eines Assets für Retrieval, Training oder Agentennutzung mit Zweck, Qualität, Rechten und Nachweis.
Qualität, Quellkorrektur und AI-Nutzung
Datenqualität muss sichtbar machen, wo ein Problem behoben wurde. Wenn der Fehler im Quellsystem entsteht, ist die beste Behebung eine Korrektur an der Quelle oder mindestens ein dokumentierter Quellbefund mit Verantwortung. Wenn ETL oder ELT Werte nachgelagert bereinigt, schätzt, mappt oder filtert, braucht diese Änderung Nachweis: Regel, Grund, betroffene Felder, Version und erlaubte Nutzung.
Das ist besonders wichtig für AI. Retrieval, Training, Features und Agenten sehen oft nur das nachgelagerte Ergebnis. Ohne Kennzeichnung wissen sie nicht, ob ein Wert beobachtet, korrigiert, geschätzt, defaulted oder ausgeschlossen wurde. Governance muss Unsicherheit und Herkunft erhalten, statt sie hinter einem sauber wirkenden Datensatz zu verstecken.
Produkte und Entscheidungen
Datenmüll vor AI braucht nicht einfach einen größeren oder saubereren Index. Es braucht wenige klare Arbeitsprodukte, die Fachbereich, Stewardship und Plattformbetrieb gemeinsam verstehen.
Ausschlussregister für KI-Kontext
Dieses Produkt beschreibt:
- Asset-ID, Hygiene-Klasse, KI-Touchpoints, Entscheidung zum Lebenszyklus, Zweckstatus, zuständige Fachrolle, Steward und Wiedervorlage.
Entscheidungen:
- Welche Assets berühren den Pilot-Dokumentbestand?
- Wer darf eine Sperre aufheben?
- Welche leere Freigabe gilt als gesperrt und nicht als Kandidat?
Entscheidung vor Aufnahme in KI-Systeme
Ohne Lebenszyklusentscheidung kein KI-Kontext.
Es benötigt:
- Entscheidung aus der Hygiene-Serie: behalten, archivieren, stilllegen oder löschen.
- Datum und Link zum Inventar.
- Sperre für Index, Retrieval und Trainingsjob.
Entscheidungen:
- Welche Klassen sind standardmäßig gesperrt, etwa verwaiste Assets, Zombie-Reports oder unzulässige Schattenkopien?
- Wer stoppt die Aufnahme, wenn die Entscheidung fehlt?
- Wo wird festgehalten, dass „technisch vorhanden“ keine Freigabe ist?
Freigabe für KI-Suche und Training getrennt behandeln
KI-Suche und Training sind zwei verschiedene Nutzungen. Ein Dokument kann für die beantwortete Suche geeignet sein und trotzdem nicht für Training freigegeben sein.
Entscheidungen:
- Darf das Asset in eine KI-Suche, aber nicht ins Training?
- Wer darf Trainingsnutzung freigeben?
- Welche Dienstleister-Uploads brauchen zusätzlich einen Rechte- und Zwecknachweis?
Touchpoint-Liste
Die Touchpoint-Liste zeigt, wo Datenmüll bereits KI berührt: Indexe, Trainingsjobs, Dienstleister, Notebooks, Dateien, Agenten oder interne Suchsysteme.
Entscheidungen:
- Welche Indexe, Trainingsjobs, Dienstleister und Notebooks berühren das Asset heute?
- Wer entfernt einen stillen Treffer?
- Welcher Vorfall ist eigentlich ein fehlender Lebenszyklusentscheid?
Wo Governance hängt
Zwischen Katalogsuche und AI-Gate
Auffindbar heißt nicht freigegeben. Der Crawler liest Existenz, nicht Zweck.
Zwischen Hygiene-Register und KI-Allowlist
Ein verwaistes Asset ohne Entscheidung bleibt im Index, bis die Allowlist das Hygiene-Register verbindlich nutzt.
Zwischen KI-Suche und Training
Eine Freigabe für beantwortete Suche ist kein Trainingsrecht. Beide Entscheidungen gehören an dasselbe Asset, bleiben aber getrennt.
Zwischen selbstbewusster Antwort und altem Auswertungsbestand
Das Modell hat die Zahl nicht frei erfunden. Governance hat eine veraltete Quelle nicht aus dem Kontext gehalten.
Zwischen Shadow-Excel und „offizieller“ Quelle
Stille Kopien werden Treffer. Sie brauchen eine Zeile, bevor sie „helfen“.
Zwischen Plattform-Admin und AI-Zweckfreigabe
Wer den Index betreibt, entscheidet nicht training-ok.
Rollen-Mapping
Zuständige Fachrolle
Die zuständige Fachrolle verantwortet Zweck und Entscheidung, ob das Asset KI berühren darf. Sie entscheidet aber nicht allein den Index-Job.
Hygiene Steward
Führt Disposition und Hygiene-Klasse (Serie Datenhygiene). Hygiene ersetzt nicht die AI-Zweckfreigabe.
AI / Context Steward
Führt Ausschlussregister, Status für KI-Suche und Training sowie Wiedervorlagen. Stewardship braucht dafür echte Kapazität, nicht nur Restzeit nach einem Vorfall.
Technischer Betreiber für Index und Plattform
Setzt Blocks und Allowlists um. Konfigurationsmacht ist keine Zweck-Verantwortung.
AI Product Owner
Priorisiert Corpus-Scope und welche Assets Kandidaten werden. Nutzen und Lieferbarkeit ersetzen aber nicht die Hygiene-Disposition.
Audit / Incident User
Erhält Register, Nachweise und eine klare Einordnung, ob ein Vorfall durch Modellverhalten oder durch fehlende Datenhygiene entstanden ist.
Mini-Fall
Alltagssituation: Eine alte Auswertungstabelle sales_legacy_2019 hat keine zuständige Fachrolle, ist aber im Katalog noch auffindbar. Die KI-Suche nimmt sie auf, weil sie technisch existiert. Danach liefert der Assistent eine überzeugend klingende, aber falsche Zahl.
Was schiefläuft: Im Incident heißt es schnell: „KI hat gelogen.“ Tatsächlich wurde ein veralteter Datenbestand nicht archiviert, ausgeschlossen oder gelöscht. Das Modell hat nicht entschieden, welche Quelle gültig ist; es hat gefunden, was verfügbar war.
Vereinbarung: Alte Assets bekommen Disposition: behalten, archivieren, aus Retrieval ausschließen oder löschen. Für KI-Suche zählen nur Quellen mit Zweck, zuständiger Fachrolle, Aktualität und Freigabe. Der Index zitiert diese Entscheidung, statt alles aufzunehmen, was technisch erreichbar ist.
Kritische Übergabe
| Von | An | Artefakt |
|---|---|---|
| Hygiene Steward | AI Steward | Disposition, Hygiene-Klasse, Asset-ID |
| Zuständige Fachrolle | AI Steward | Zweckfreigabe retrieval / training / blocked |
| AI Steward | Technischer Betreiber | Exclusion- und Allowlist-Regel |
| Technischer Betreiber | Steward | Heutige Touchpoints (Index, Job, Vendor) |
| AI Product Owner | Steward | Geplante Corpora und Jobs |
| Steward | Incident / Unlearning | Register-Zeile wenn Datenmüll schon im Modell liegt |
Anti-Patterns
- Alles indexieren „für KI“
- Existenz im Katalog als Freigabe lesen
- Retrieval-Allow auf Fine-Tune vererben
- Incident als Modellfehler führen, obwohl Disposition fehlt
- Shadow-Kopien im KI-Pfad ignorieren
- Index-Admin als Zweck-zuständige Fachrolle führen
- Hygiene-Serie umschreiben statt bridgen
Im Alltag betreiben
Dieser Einstieg ist ein Arbeitsmuster, keine Kalenderübung und keine Leseliste. Nimm einen echten Fall, an dem sich die Entscheidung prüfen lässt.
Arbeitsweise: Nutze den verlinkten Plan als Arbeitsfläche für Zuständigkeiten, Termine und offene Punkte. Die fachliche Entscheidung muss trotzdem in der Story verständlich bleiben.
Starte mit dem kleinsten echten Fall, der fachlich wichtig genug ist. Prüfe danach, ob die Entscheidung wirklich auffindbar, umsetzbar und auditierbar ist. Rollenklärung: Wer hilft wem an der Quelle.
Schritt 1: Rahmen und Entscheidung klären
Hygiene-Zeilen listen, die den Pilot-Corpus berühren. Heutige RAG- und Trainingspfade markieren. Default blocked setzen. Zuständige Fachrolle und Steward benennen.
Schritt 2: Control und Nachweis umsetzen
Exclusion Register für das Pilot-Corpus schließen. Top-Orphan aus dem Crawl nehmen. Retrieval- vs. Train-Status trennen.
Schritt 3: Testen und Ausnahmen sichtbar machen
Eine Shadow-Kopie im AI-Pfad flaggen oder blocken. Negativtest: Asset ohne Disposition darf nicht ingestiert werden. Prep-Anschluss (Teil 2) vorbereiten.
Schritt 4: Messen und begrenzt ausrollen
Aufwand und Lücken messen. Nur bestandene Muster auf ein zweites Corpus übertragen.
Exit-Kriterien
- Pilot-Dokumentbestand-Assets haben Hygiene-Klasse und KI-Zweckstatus; leer heißt blocked.
- Orphans, Zombies und illegale Shadows sind für Index und Train gesperrt, bis Disposition da ist.
- Retrieval-ok und training-ok sind getrennte Freigaben.
- Touchpoints sind benannt; stille Treffer werden geräumt oder gewaived.
- Technischer Betreiber setzt den Block; die zuständige Fachrolle bleibt für die Zweckfreigabe verantwortlich.