Incident und Rückbau vorbereiten
Wenn ein Agent falsch schreibt, zu viel auslöst oder Kosten erzeugt, braucht das Team einen vorbereiteten Weg zum Stoppen, Rekonstruieren und Rückbauen.
Auch gut gesteuerte Agenten können Fehler machen. Entscheidend ist dann, ob das Team vorbereitet ist: stoppen, Umfang verstehen, falsche Wirkungen zurücknehmen und sauber lernen.
Einstieg
Ein Agent schließt versehentlich eine Reihe von Tickets. Während das Team noch im Chat diskutiert, laufen weitere Werkzeugaufrufe. Später fehlen Logs, der aktuelle Prompt wurde überschrieben, und niemand weiß, welche Änderungen zurückgebaut werden müssen.
Ein Incident-Playbook verhindert genau diese Hektik. Es legt vorab fest, wer stoppt, wer bewertet, wer kommuniziert und wie Nachweise gesichert werden.
Begriffe vor dem Lesen
- Incident: Ein Vorfall mit relevantem Schaden, Risiko oder Kontrollverlust.
- Containment: Sofortmaßnahme, um weiteren Schaden zu stoppen.
- Blast Radius: Der betroffene Umfang: Systeme, Daten, Personen, Kunden oder Kosten.
- Last Known Good: Die letzte bekannte sichere Version von Prompt, Modell, Allowlist oder Konfiguration.
- Evidence Pack: Nachweispaket mit Zeitlinie, betroffenen Aufrufen, Entscheidungen und Folgeaufgaben.
Entscheidung
Ein Agent-Incident wird nicht zuerst im Chat analysiert. Zuerst wird der Schaden begrenzt und die Spur gesichert. Danach wird bewertet, zurückgebaut und gelernt.
Der Steward koordiniert den Vorfall. Der Owner entscheidet über fachliche Kommunikation und Restrisiko. Der Custodian setzt Stoppschalter, Rechteentzug, Wiederherstellung und Schlüsselrotation um.
Mini-Fall
Der Support-Agent hat 120 Tickets geschlossen, obwohl nur 20 geprüft waren. Das Team pausiert den Agenten, sperrt das Schließen-Werkzeug und sichert Audit Logs. Danach wird geprüft, welche Tickets betroffen sind, welche Kunden informiert werden müssen und welche Tickets wieder geöffnet werden.
Der Abschluss erfolgt erst, wenn das Nachweispaket vollständig ist und die Folgeaufgaben in Tool-Scope, Freigabematrix und Kostenlimits eingearbeitet sind.
Woran du schlechte Praxis erkennst
- Root Cause wird diskutiert, während der Agent weiterläuft.
- Logs werden gelöscht, um "aufzuräumen".
- Es wird einfach die neueste Version redeployed.
- Niemand bewertet Kunden- oder Geschäftsimpact.
- Der Incident wird ohne Folgeaufgaben geschlossen.
Umsetzung im Alltag
Übe den Ablauf mit einem nicht-produktiven Agenten. Prüfe, ob Stoppschalter, Log-Sicherung, Rechteentzug, Wiederherstellung und Kommunikation wirklich funktionieren. Ein Playbook muss kurz genug sein, um im Stress benutzt zu werden.
Weiterlesen
Agent and tool-calling operations
Part 5 of 5
View series