Aller au contenu principal

Les dix premières minutes vont au rassemblement, pas à la décision

Les dix premières minutes d'un incident sont de l'enrichissement. Quelqu'un ouvre les journaux, vérifie ce qui a été déployé, et détermine quelle équipe possède le composant en échec. Ce n'est qu'ensuite que quelqu'un réfléchit.

Rien de cela n'est un jugement, et tout cela est lent à trois heures du matin. Pire, le rassemblement se fait différemment à chaque fois, donc deux incidents de même cause sont enquêtés selon deux chemins différents.

L'acheminement est la partie qui coûte le plus lorsqu'elle se trompe. Un incident envoyé à la mauvaise équipe n'est pas seulement retardé. Il est retardé pendant que tout le monde croit qu'il est traité.

L'agent rassemble, écrit ce que les preuves suggèrent, et dit à quel point il est confiant. La cause probable est présentée comme probable, parce qu'un intervenant qui fait confiance à une mauvaise piste perd plus de temps qu'un intervenant à qui l'on n'a rien donné.

Comment l'agent est construit dans Agent Studio

La propriété des services vit dans les prompt skills : quelle équipe possède quel composant, et comment la propriété bascule hors des heures ouvrées, parce que l'acheminement n'est jamais meilleur que cette carte.

Un second prompt skill associe vos incidents passés à leurs issues, pour que l'agent reconnaisse un schéma déjà vu plutôt que de raisonner de zéro à chaque fois.

Le prompt système exige une déclaration de confiance pour chaque cause probable. Il exige aussi que les preuves soient listées séparément de la lecture.

Il interdit de présenter une corrélation comme une cause. Un déploiement quinze minutes avant une alerte est rapporté comme un déploiement quinze minutes avant une alerte.

Un déclencheur External Event reçoit l'alerte, et un nœud HTTP Request collecte les journaux de la fenêtre, les déploiements récents et la santé des dépendances avant que le nœud Agent Chat n'en voie quoi que ce soit.

L'évaluation va au canal d'incident via un nœud Slack, avec ses preuves jointes. Un nœud Switch achemine l'évaluation vers l'équipe propriétaire d'après la carte de propriété plutôt que d'après l'inférence de l'agent.

Rien n'est remédié, redémarré ni reconfiguré. Google Sheets consigne chaque cause probable face à la cause réelle, ce qui est le seul moyen d'apprendre si l'agent mérite d'être cru.

De quoi cet agent est constitué

  • Prompt skills : la carte de propriété, y compris la façon dont elle change hors des heures ouvrées.
  • Prompt skills : incidents passés, et ce que chacun s'est révélé être.
  • System prompt : une déclaration de confiance pour chaque cause probable.
  • System prompt : les preuves sont séparées de leur lecture. Une corrélation n'est jamais énoncée comme une cause.
  • External Event (Triggers) avec HTTP Request (Util) : journaux, déploiement et santé des dépendances pour la fenêtre.
  • Switch (Control) avec Slack (Communication) : acheminement d'après la carte, pas d'après une inférence.
  • Quand un ActionFlow suffit : Si la cause d'une alerte est évidente, joindre les déploiements récents et l'équipe propriétaire à l'alerte est un flux de travail.

Questions fréquentes

Créer des workflows IA

Créez un compte gratuit, ouvrez un modèle ou une toile vide, puis lancez votre premier ActionFlow.

Newsletter

Recevoir les mises à jour produit

Nouveaux nœuds, agents et notes produit. Nous n'envoyons un e-mail que lorsqu'il vaut la peine de l'ouvrir.

Désabonnement à tout moment.