¿Qué hicieron cuando al usar VAPI con Twilio cada llamada se quedaba atrapada en un loop?
Estoy teniendo serios problemas con VAPI al usarlo con Twilio, y espero que alguien pueda ayudarme o compartir su experiencia.
Estoy usando GPT-4o, Nova 2, y Elevenlabs (Eleven Turbo v2.5), ya que las llamadas son en español. Sin embargo, las llamadas son un desastre:
- En el 80% de los casos, la IA queda atrapada en un bucle en la primera o segunda oración.
- Las grabaciones no reflejan lo que ocurrió en la llamada. A menudo, las voces están superpuestas o una de las voces directamente no se escucha.
- La sección de "mensajes" en los logs es un completo desastre, y lo mismo ocurre con las transcripciones, que son incoherentes. Esto pasa en todos mis proyectos cuando llamo por Twilio, sin importar la longitud o complejidad del prompt.
Además, al analizar diferencias entre los logs de llamadas web y llamadas con Twilio, encontré lo siguiente:
- **Latencia**: Es tres veces mayor en Twilio (ejemplo: 3087ms), con demoras variables en los pasos de procesamiento (transcriptor, endpointing, modelo, síntesis de voz), lo que afecta la experiencia del usuario.
- Respuestas repetitivas: Hay prompts redundantes y frases repetitivas. La IA no se adapta dinámicamente a las respuestas del usuario.
- **Errores en la transcripción**: Fragmentaciones y fallos en el endpointing provocan malas interpretaciones del habla. Además, la salida de audio aparece fragmentada, causando retrasos en entregar respuestas coherentes.
He estado reportando todo esto al correo de soporte de VAPI por casi dos semanas, pero no he tenido respuestas útiles.
¿A alguien le pasó algo similar? ¿Qué harían ustedes en mi lugar?
¡Graaaaciaaaaas!