
Die ersten zehn Minuten gehen ins Sammeln, nicht ins Entscheiden
Die ersten zehn Minuten eines Incidents sind Anreicherung. Jemand öffnet die Logs, prüft, was deployed wurde, und klärt, welches Team die ausfallende Komponente besitzt. Erst dann denkt jemand.
Nichts davon ist Urteil, und alles davon ist um drei Uhr morgens langsam. Schlimmer: Das Sammeln läuft jedes Mal anders, sodass zwei Incidents mit derselben Ursache auf zwei verschiedenen Wegen untersucht werden.
Routing ist der Teil, der am teuersten wird, wenn er falsch ist. Ein Incident, der an das falsche Team geht, ist nicht nur verzögert. Er ist verzögert, während alle glauben, er werde bearbeitet.
Der Agent sammelt, schreibt, was der Beleg nahelegt, und sagt, wie sicher er ist. Die wahrscheinliche Ursache wird als wahrscheinlich präsentiert, weil eine reagierende Person, die einem falschen Hinweis vertraut, mehr Zeit verliert als eine, der nichts gegeben wurde.
So bauen Sie den Agent in Agent Studio auf
Servicebesitz lebt in Prompt-Fähigkeiten: welches Team welche Komponente besitzt und wie sich Besitz außerhalb der Geschäftszeiten verschiebt, weil Routing nur so gut ist wie diese Karte.
Ein zweiter Prompt-Skill verknüpft Ihre vergangenen Incidents mit ihren Ausgängen, damit der Agent ein Muster erkennen kann, das er gesehen hat, statt jedes Mal von vorn zu argumentieren.
Der System-Prompt verlangt eine Sicherheitsangabe zu jeder wahrscheinlichen Ursache. Er verlangt außerdem, dass Belege getrennt von der Lesart gelistet werden.
Er verbietet, eine Korrelation als Ursache zu präsentieren. Ein Deploy fünfzehn Minuten vor einem Alert wird als Deploy fünfzehn Minuten vor einem Alert berichtet.
Ein External-Event-Trigger nimmt den Alert entgegen, und ein HTTP Request-Knoten sammelt Logs für das Fenster, jüngste Deploys und den Zustand der Abhängigkeiten, bevor der Agent Chat-Knoten etwas davon sieht.
Die Einschätzung geht über einen Slack-Knoten mit beigefügtem Beleg in den Incident-Kanal. Ein Switch-Knoten leitet die Einschätzung anhand der Besitzkarte an das besitzende Team, nicht anhand der Folgerung des Agenten.
Nichts wird behoben, neu gestartet oder umkonfiguriert. Google Sheets führt jede wahrscheinliche Ursache gegen die tatsächliche Ursache, das ist der einzige Weg zu lernen, ob dem Agent zu trauen ist.
Woraus dieser Agent besteht
- Prompt-Fähigkeiten: die Besitzkarte, einschließlich wie sie sich außerhalb der Geschäftszeiten ändert.
- Prompt-Fähigkeiten: vergangene Incidents und was aus jedem geworden ist.
- System-Prompt: eine Sicherheitsangabe zu jeder wahrscheinlichen Ursache.
- System-Prompt: Beleg wird von seiner Lesart getrennt. Korrelation wird niemals als Ursache genannt.
- External Event (Triggers) with HTTP Request (Util): Logs, Deploy und Zustand der Abhängigkeiten für das Fenster.
- Switch (Control) with Slack (Communication): Routing aus der Karte, nicht aus einer Folgerung.
- Wenn ein ActionFlow ausreicht: Wenn die Ursache eines Alerts offensichtlich ist, ist das Anhängen jüngster Deploys und des besitzenden Teams an den Alert ein Workflow.
Häufige Fragen
Newsletter
Produktupdates erhalten
Neue Nodes, Agents und Produktnotizen. Wir senden E-Mails nur, wenn sich das Öffnen lohnt.