Zum Inhalt springen
Search the hub
Incident und Rückbau vorbereiten

Incident und Rückbau vorbereiten

Wenn ein Agent falsch schreibt, zu viel auslöst oder Kosten erzeugt, braucht das Team einen vorbereiteten Weg zum Stoppen, Rekonstruieren und Rückbauen.

Category
Data Governance
Reading time
1 min
Published
Tags
ai-agents incidents rollback playbook operations
Download PDF

Auch gut gesteuerte Agenten können Fehler machen. Entscheidend ist dann, ob das Team vorbereitet ist: stoppen, Umfang verstehen, falsche Wirkungen zurücknehmen und sauber lernen.

<- Vorheriger Teil

Einstieg

Ein Agent schließt versehentlich eine Reihe von Tickets. Während das Team noch im Chat diskutiert, laufen weitere Werkzeugaufrufe. Später fehlen Logs, der aktuelle Prompt wurde überschrieben, und niemand weiß, welche Änderungen zurückgebaut werden müssen.

Ein Incident-Playbook verhindert genau diese Hektik. Es legt vorab fest, wer stoppt, wer bewertet, wer kommuniziert und wie Nachweise gesichert werden.

Begriffe vor dem Lesen

  • Incident: Ein Vorfall mit relevantem Schaden, Risiko oder Kontrollverlust.
  • Containment: Sofortmaßnahme, um weiteren Schaden zu stoppen.
  • Blast Radius: Der betroffene Umfang: Systeme, Daten, Personen, Kunden oder Kosten.
  • Last Known Good: Die letzte bekannte sichere Version von Prompt, Modell, Allowlist oder Konfiguration.
  • Evidence Pack: Nachweispaket mit Zeitlinie, betroffenen Aufrufen, Entscheidungen und Folgeaufgaben.

Entscheidung

Ein Agent-Incident wird nicht zuerst im Chat analysiert. Zuerst wird der Schaden begrenzt und die Spur gesichert. Danach wird bewertet, zurückgebaut und gelernt.

Der Steward koordiniert den Vorfall. Der Owner entscheidet über fachliche Kommunikation und Restrisiko. Der Custodian setzt Stoppschalter, Rechteentzug, Wiederherstellung und Schlüsselrotation um.

Mini-Fall

Der Support-Agent hat 120 Tickets geschlossen, obwohl nur 20 geprüft waren. Das Team pausiert den Agenten, sperrt das Schließen-Werkzeug und sichert Audit Logs. Danach wird geprüft, welche Tickets betroffen sind, welche Kunden informiert werden müssen und welche Tickets wieder geöffnet werden.

Der Abschluss erfolgt erst, wenn das Nachweispaket vollständig ist und die Folgeaufgaben in Tool-Scope, Freigabematrix und Kostenlimits eingearbeitet sind.

Woran du schlechte Praxis erkennst

  • Root Cause wird diskutiert, während der Agent weiterläuft.
  • Logs werden gelöscht, um "aufzuräumen".
  • Es wird einfach die neueste Version redeployed.
  • Niemand bewertet Kunden- oder Geschäftsimpact.
  • Der Incident wird ohne Folgeaufgaben geschlossen.

Umsetzung im Alltag

Übe den Ablauf mit einem nicht-produktiven Agenten. Prüfe, ob Stoppschalter, Log-Sicherung, Rechteentzug, Wiederherstellung und Kommunikation wirklich funktionieren. Ein Playbook muss kurz genug sein, um im Stress benutzt zu werden.

Weiterlesen

Agent and tool-calling operations

Part 5 of 5

View series

Knowledge check

Tour