Zum Hauptinhalt springen

Die falsche Person zu wecken, ist der Weg, auf dem eine Bereitschaftsrotation aufhört zu funktionieren

Ein Alert um drei Uhr morgens ist entweder ein echter Ausfall oder eine von vier Bedingungen, die jeden Monat harmlose Alarme auslösen. Nachdem Teams ein zweites Mal geweckt wurden, lernen sie, den Alert zu quittieren, ohne ihn zu lesen, und echte Ausfälle werden übersehen.

Sie können sie nur unterscheiden, indem Sie über den Alert hinausschauen: jüngste Deployments, Alerts verwandter Services, bekannte harmlose Muster und ob bereits jemand handelt. Auch die soziale Wahl zählt. Das Wecken kann der Service-Ownerin oder dem Service-Owner gehören, der Person, die das Deployment ausgeführt hat, oder niemandem bis zur Geschäftszeit. Eine falsche Entscheidung kann das Vertrauen kosten, das Monate braucht, um zurückzukommen.

Der Agent führt Anrufe nach den Regeln, die Ihr Team im Voraus gesetzt hat, erfasst, warum er gehandelt hat, und eskaliert, statt allein zu entscheiden.

So bauen Sie den Agent in Agent Studio auf

Prompt-Fähigkeiten enthalten Alertdefinitionen, bekannte harmlose Bedingungen und was jede historisch bedeutet hat: das institutionelle Wissen, das sonst in einem Kopf sitzt.

Ein zweiter Satz Prompt-Fähigkeiten hält Ihre Eskalationspolitik: wer was besitzt, was ein Wecken auslösen soll und was bis zum Morgen warten soll, nach Ihren eigenen Regeln.

Der System-Prompt verlangt, dass jede Entscheidung den verwendeten Beleg und die angewandte Regel nennt. Die Morgenprüfung kann dann den Anruf betrachten, nicht nur das Ergebnis.

Wenn der Agent unsicher ist, ob etwas echt ist, eskaliert er an die Bereitschaftsingenieurin oder den Bereitschaftsingenieur. Die Kosten dieser Handlung sind eine Unterbrechung. Die Kosten der Alternative sind ein Ausfall.

Ein HTTP Request-Knoten holt den Alert und sammelt die jüngsten Deploys, verwandte rote Alerts und den Gesundheitszustand. Der Agent Chat-Knoten liest dieses Bündel erst nach dem Abruf.

Wenn eine reagierende Person bereits wach ist, darf sie handeln. Wenn niemand per Page benachrichtigt wurde, erfasst der Agent seine Einschätzung zuerst im Incident-Kanal über einen Slack-Knoten. Der Agent wendet die erklärte Regel an, statt per SMS oder Teams zu improvisieren. Google Sheets führt jede Entscheidung gegen den beabsichtigten Incident-Ausgang.

Woraus dieser Agent besteht

  • Prompt-Fähigkeiten: bekannte harmlose Bedingungen und was jede historisch bedeutet hat.
  • Prompt-Fähigkeiten: Ihre Eskalationspolitik: wer was besitzt, und was bis zum Morgen wartet.
  • System-Prompt: Beleg und angewandte Regel, bei jeder Entscheidung genannt.
  • System-Prompt: Unsicherheit eskaliert. Sie löst sich nicht still.
  • External Event (Triggers) with HTTP Request (Util): der Alert plus Deploys, verwandte Alerts und Gesundheitszustand.
  • Slack (Communication) with SMS (Communication): zuerst der Kanal, Paging nur nach erklärter Regel.
  • Wenn ein ActionFlow ausreicht: Wenn Sie einen Alert nur mit jüngsten Deploys anreichern und an die Service-Ownerin oder den Service-Owner leiten müssen, bauen Sie den Workflow. Dieser Workflow nimmt bereits den Großteil des Ratens weg.

Häufige Fragen

KI-Workflows bauen

Legen Sie ein kostenloses Konto an, öffnen Sie eine Vorlage oder eine leere Fläche und führen Sie Ihren ersten ActionFlow aus.

Newsletter

Produktupdates erhalten

Neue Nodes, Agents und Produktnotizen. Wir senden E-Mails nur, wenn sich das Öffnen lohnt.

Sie können das Abonnement jederzeit beenden.