Saltar al contenido principal
Asistentes y mensajería

Los mensajes de voz se responden al final porque no se pueden hojear

No puedes decidir de un vistazo si un mensaje de voz requiere tu atención, así que se queda pendiente más tiempo que un mensaje escrito de igual urgencia.

La transcripción sola no resuelve el orden. Sí resuelve el problema de hojear, que alcanza para poner el mensaje en la misma cola que todo lo demás, en lugar de en una pila aparte que nadie mira.

El canal de respuesta es en general el mismo que el de llegada, y eso hay que respetarlo. Si alguien envió un mensaje de voz en WhatsApp, no va a esperar un correo. Cambiar de canal se lee como evasión.

El error es enviar sin revisar. Los errores de transcripción no son aleatorios. Suelen ocurrir con nombres, cifras y términos técnicos, que son justo las cosas que una respuesta necesita.

Cómo se ejecuta el ActionFlow en el lienzo

Las notas de voz llegan por un trigger Webhook desde WhatsApp o Telegram. Un nodo Document Upload toma entonces el archivo de audio.

El nodo Transcribe Audio lo convierte. La elección de proveedor importa más aquí que en la mayoría de los otros flujos, porque los mensajes de voz se graban en móviles en malas condiciones, y una transcripción pobre produce una respuesta segura a algo que nunca se dijo.

Un nodo Generate Object devuelve el pedido, la pregunta que se hizo y una señal de confianza de transcripción que indica cuán ambigua era una parte del mensaje.

Un nodo If comprueba esa señal. Cuando la confianza de transcripción es baja, el flujo se salta por completo la redacción y envía el caso a una persona junto con el audio, porque redactar a partir de una transcripción pobre le hace perder el tiempo a quien revisa.

Para los demás, un nodo Generate Text redacta una respuesta en el mismo tono del canal de llegada.

Un nodo Human in the Loop en el mismo canal retiene el borrador, junto con la transcripción y el audio original, para que quien revisa pueda comprobar un nombre o un número en segundos.

La respuesta liberada se envía de vuelta por el canal del que vino originalmente.

Nodos que usa este ActionFlow

  • Webhook (Trigger): recibe el mensaje de voz. Document Upload (Data) toma el archivo de audio.
  • Transcribe Audio (AI Core): lo convierte. La elección de proveedor importa más en audio grabado en móvil.
  • Generate Object (AI Core): devuelve el pedido, cualquier pregunta y una señal de confianza de transcripción.
  • If (Control): se salta por completo la redacción cuando la transcripción no es fiable.
  • Generate Text (AI Core): redacta una respuesta en el registro del canal de llegada.
  • WhatsApp (Human in the Loop): retiene el borrador con transcripción y audio adjuntos.
  • Telegram (Communication): envía la respuesta liberada. SMS, Slack y WhatsApp ocupan el mismo lugar.

Preguntas frecuentes

Empieza a crear flujos de IA

Crea una cuenta gratuita, abre una plantilla o un lienzo en blanco y ejecuta tu primer ActionFlow.

Boletín

Recibe actualizaciones del producto

Nodos nuevos, agents y notas de producto. Solo enviamos correo cuando merece la pena abrirlo.

Cancela la suscripción en cualquier momento.