Saltar al contenido principal
IA generativa

Un texto distinto no es un desacuerdo

Una comparación de modelos lado a lado te deja un bloque largo de texto sin conclusión. La mayoría de las diferencias son solo de redacción. Las pocas diferencias importantes se esconden en ese ruido: un modelo da un número distinto, uno hace una recomendación que el otro no hace, o uno incluye una advertencia que el otro omitió.

Para distinguirlas hay que leer por significado, no solo por diferencias. Dos respuestas pueden no compartir casi nada de vocabulario y aun así decir lo mismo. Otras dos pueden ser casi idénticas y aun así discrepar en la única cláusula que decide el resultado.

Hay un hallazgo más que aparece solo si lees con cuidado. A veces la divergencia no tiene nada que ver con la calidad del modelo. Significa que el prompt era ambiguo, y cada modelo lo interpretó distinto. Eso suele ser el resultado más útil de una comparación, y una herramienta de diff no puede detectarlo.

Cómo se construye el agent en Agent Studio

El system prompt define qué es una diferencia de sustancia para tu caso de uso. También le dice al agent que trate la ambigüedad del prompt como una categoría propia, no como calidad del modelo.

Los criterios de evaluación que fijas determinan qué cuenta como una buena respuesta en tu área, y los modos de falla que más te importan.

Como ActionFlows está conectado a 83 proveedores de modelo, elegir el set de comparación es configuración, no un proyecto de integración. Una vez que un proveedor está conectado en Credentials, sus modelos quedan disponibles para cualquier nodo y cualquier agent.

El flujo funciona mejor cuando él envía los prompts. En esta configuración, un ActionFlow envía el mismo prompt a varios nodos Generate Text, cada uno unido a un servicio distinto, y pasa las salidas al agent por el nodo Agent Chat. El agent ejecuta el juicio. Cada nodo de IA reporta su propio uso de tokens y su costo en su salida, así que obtienes un juicio de calidad y una comparación de precio en la misma ejecución, sin instrumentación extra.

Conserva las salidas crudas, porque en algún momento vas a discrepar del veredicto. La única forma de resolverlo es volver a leer las fuentes.

De qué está hecho este agent

  • System prompt: qué cuenta como sustancial, y la instrucción de marcar la ambigüedad del prompt por separado.
  • Prompt skills: tus criterios de evaluación y los modos de falla que te importan.
  • Generate Text (AI Core): varios nodos en un flujo, cada uno en un servicio de modelo distinto.
  • Agent Chat (Util): entrega las salidas reunidas al agent para el juicio.
  • Node cost outputs: el veredicto de calidad y la comparación de precio se generan en la misma ejecución.
  • Google Sheets (Integration): registra los veredictos, para poder repetir las comparaciones cuando los modelos cambien.
  • Cuando un ActionFlow basta: Si estás haciendo una comparación rutinaria de costo y latencia, construye un flujo de trabajo con un paso de puntuación. Usa el agent cuando la pregunta sea la calidad.

Preguntas frecuentes

Empieza a crear flujos de IA

Crea una cuenta gratuita, abre una plantilla o un lienzo en blanco y ejecuta tu primer ActionFlow.

Boletín

Recibe actualizaciones del producto

Nodos nuevos, agents y notas de producto. Solo enviamos correo cuando merece la pena abrirlo.

Cancela la suscripción en cualquier momento.