
Las filas rechazadas son el conjunto que te dice qué está mal aguas arriba
Cuando los pipelines limpian datos, descartan cualquier cosa que no pueden procesar. La tabla limpia se ve bien. No explica por qué falló el 11% de las filas.
Esas fallas apuntan a un problema en el sistema de origen. Cuando sube la tasa de rechazo de un campo concreto, un formulario cambió, una integración se rompió, o un proveedor nuevo está enviando datos en otro formato. La tabla limpia no muestra eso.
Las filas duplicadas también piden cuidado. Dos filas que se ven iguales podrían ser dos eventos reales. Un paso de deduplicación que las combina de forma automática quita un número que nadie puede reconstruir.
El juicio es el punto en el que una regla cede a la interpretación. Una regla puede interpretar una fecha mal formateada de forma mecánica. Un nombre de empresa en tres grafías distintas exige una decisión sobre si las variantes se refieren a la misma empresa.
Cómo se ejecuta el ActionFlow en el lienzo
Las filas crudas entran por un nodo Document Upload, un nodo Google Sheets o un nodo HTTP Request que las recupera del sistema de origen.
El nodo Validate actúa primero. Hace el trabajo mecánico: comprobar tipos, verificar campos requeridos y validar el formato. Si una regla puede decidir algo, este nodo lo cubre. No se pasa nada a un modelo cuando una regla podría haberlo cubierto.
Un nodo Filter separa las filas válidas de las inválidas. No descarta las filas inválidas. Las coloca en su propia tabla, con el campo fallido listado en cada fila.
Un nodo Uniq quita los duplicados exactos. Un nodo Sort ordena entonces el resto para que los casi duplicados queden uno al lado del otro.
Un nodo Generate Object cubre solo los casos que sobrevivieron y todavía se ven ambiguos: grafías variantes, categorías inconsistentes y valores posibles pero inusuales. No reescribe las filas. Propone una normalización y un nivel de confianza por cada fila.
Un segundo nodo Filter usa el umbral de confianza. Las normalizaciones de alta confianza se agregan a la tabla limpia por un nodo PostgreSQL, MySQL o Google Sheets. Las demás van a una tabla de revisión.
Un nodo Create Excel produce un archivo que alguien puede trabajar sin conexión como parte del conjunto de revisión.
Nodos que usa este ActionFlow
- Document Upload (Data): toma el archivo crudo. Google Sheets y HTTP Request cubren otras fuentes.
- Validate (Data): hace todo lo que una regla puede decidir, antes de involucrar a cualquier modelo.
- Filter (Data): parte lo válido de lo inválido y conserva el conjunto inválido con su razón de falla.
- Uniq (Control): quita duplicados exactos sin fusionar eventos repetidos genuinos.
- Generate Object (AI Core): propone normalizaciones con una confianza por fila, sin reescribir nada.
- PostgreSQL (Data): recibe la tabla limpia. MySQL y Google Sheets ocupan el mismo lugar.
- Create Excel (Data): produce un archivo para el conjunto de revisión cuando alguien trabaja sin conexión.
Preguntas frecuentes
Empieza a crear flujos de IA
Crea una cuenta gratuita, abre una plantilla o un lienzo en blanco y ejecuta tu primer ActionFlow.
Boletín
Recibe actualizaciones del producto
Nodos nuevos, agents y notas de producto. Solo enviamos correo cuando merece la pena abrirlo.