
Une formulation différente n'est pas un désaccord
Une comparaison de modèles côte à côte vous donne un long bloc de texte sans conclusion. La plupart des différences ne sont que de formulation. Les quelques différences importantes se cachent dans ce bruit : un modèle donne un chiffre différent, l'un fait une recommandation que l'autre ne fait pas, ou l'un inclut une mise en garde que l'autre a omise.
Pour les distinguer, il faut lire le sens, pas seulement les différences. Deux réponses peuvent presque ne partager aucun vocabulaire et signifier pourtant la même chose. Deux autres peuvent être presque identiques et diverger encore sur la seule clause qui tranche le résultat.
Une autre découverte n'apparaît que si vous lisez avec soin. Parfois, la divergence n'a rien à voir avec la qualité du modèle. Elle signifie que le prompt était ambigu, et que chaque modèle l'a interprété autrement. C'est souvent le résultat le plus utile d'une comparaison, et un outil de diff ne peut pas le détecter.
Comment l'agent est construit dans Agent Studio
Le prompt système définit une différence de fond pour votre cas d'utilisation. Il dit aussi à l'agent de traiter l'ambiguïté du prompt comme une catégorie à part, pas comme de la qualité de modèle.
Les critères d'évaluation que vous fixez déterminent ce qui compte comme une bonne réponse dans votre domaine, et les modes d'échec qui vous importent le plus.
Parce qu'ActionFlows est connecté à 83 fournisseurs de modèles, choisir l'ensemble de comparaison est de la configuration, pas un projet d'intégration. Une fois un fournisseur connecté sous Credentials, ses modèles sont disponibles pour tout nœud et tout agent.
Le flux fonctionne le mieux quand c'est lui qui envoie les prompts. Dans cette configuration, un ActionFlow envoie le même prompt à plusieurs nœuds Generate Text, chacun rattaché à un service différent, et passe les sorties à l'agent via le nœud Agent Chat. L'agent porte le jugement. Chaque nœud IA rapporte sa propre consommation de tokens et son coût dans sa sortie, donc vous obtenez un jugement de qualité et une comparaison de prix dans la même exécution, sans instrumentation supplémentaire.
Conservez les sorties brutes, car vous finirez par contester le verdict. La seule façon de trancher est de relire les sources.
De quoi cet agent est constitué
- System prompt : ce qui compte comme substantiel, et l'instruction de signaler à part l'ambiguïté du prompt.
- Prompt skills : vos critères d'évaluation et les modes d'échec qui vous importent.
- Generate Text (AI Core) : plusieurs nœuds dans un flux, chacun sur un service de modèle différent.
- Agent Chat (Util) : remet les sorties collectées à l'agent pour jugement.
- Node cost outputs : le verdict de qualité et la comparaison de prix sont produits dans la même exécution.
- Google Sheets (Integration) : consigne les verdicts, pour que les comparaisons puissent être répétées à mesure que les modèles changent.
- Quand un ActionFlow suffit : Si vous faites une évaluation comparative courante de coût et de latence, construisez un flux de travail avec une étape de notation. Utilisez l'agent quand la question est la qualité.
Questions fréquentes
Newsletter
Recevoir les mises à jour produit
Nouveaux nœuds, agents et notes produit. Nous n'envoyons un e-mail que lorsqu'il vaut la peine de l'ouvrir.