
Réveiller la mauvaise personne, c'est ainsi qu'une rotation d'astreinte cesse de fonctionner
Une alerte à trois heures du matin est soit une vraie panne, soit l'une de quatre conditions qui provoquent des alarmes sans gravité chaque mois. Après que les équipes ont été réveillées une seconde fois, elles apprennent à accuser réception sans lire, et les vraies pannes passent.
On ne les distingue qu'en regardant au-delà de l'alerte : déploiements récents, alertes de services liés, schémas bénins connus, et si quelqu'un agit déjà. Le choix social compte aussi. Le réveil peut appartenir au propriétaire du service, à la personne qui a mené le déploiement, ou à personne jusqu'aux heures ouvrées. Une mauvaise décision peut coûter la confiance qu'il faut des mois à retrouver.
L'agent traite les appels selon les règles que votre équipe a fixées à l'avance, consigne pourquoi il a agi, et monte en intensité plutôt que de décider seul.
Comment l'agent est construit dans Agent Studio
Les prompt skills comprennent les définitions d'alertes, les conditions bénignes connues, et ce que chacune a historiquement signifié : le savoir institutionnel qui vit d'ordinaire dans une seule tête.
Un second jeu de prompt skills porte votre politique d'escalade : qui possède quoi, ce qui doit déclencher un réveil, et ce qui doit attendre le matin, selon vos propres règles.
Le prompt système exige que chaque décision nomme les preuves utilisées et la règle appliquée. La revue du matin peut alors examiner l'appel, pas seulement l'issue.
Si l'agent n'est pas sûr qu'il s'agisse d'un vrai cas, il monte vers l'ingénieur d'astreinte. Le coût de cette action est une interruption. Le coût de l'alternative est une panne.
Un nœud HTTP Request récupère l'alerte et rassemble les déploiements les plus récents, les alertes rouges liées et l'état de santé. Le nœud Agent Chat ne lit ce lot qu'après la récupération.
Si un intervenant est déjà réveillé, il peut agir. Si personne n'a été appelé, l'agent consigne d'abord son évaluation dans le canal d'incident via un nœud Slack. L'agent applique la règle déclarée plutôt que d'improviser sur SMS ou Teams. Google Sheets consigne chaque décision face à l'issue d'incident visée.
De quoi cet agent est constitué
- Prompt skills : conditions bénignes connues et ce que chacune a historiquement signifié.
- Prompt skills : votre politique d'escalade : qui possède quoi, et ce qui attend le matin.
- System prompt : preuves et règle appliquée, nommées sur chaque décision.
- System prompt : l'incertitude monte en intensité. Elle ne se résout pas en silence.
- External Event (Triggers) avec HTTP Request (Util) : l'alerte, et les déploiements, les alertes liées et l'état de santé.
- Slack (Communication) avec SMS (Communication) : canal d'abord, appel seulement selon une règle déclarée.
- Quand un ActionFlow suffit : Si vous n'avez besoin que d'enrichir une alerte avec les déploiements récents et de l'acheminer vers le propriétaire du service, construisez le flux de travail. Ce flux de travail retire déjà l'essentiel des conjectures.
Questions fréquentes
Newsletter
Recevoir les mises à jour produit
Nouveaux nœuds, agents et notes produit. Nous n'envoyons un e-mail que lorsqu'il vaut la peine de l'ouvrir.