Bonjour, je souhaite faire un petit tour avec vous concernant les voix IA pour les services de robots téléphoniques et parler de deux sujets, d'abords le défi principal de ces technologies : la latence, et ensuite des problèmes et solutions liées à la nouvelle fonctionnalité d'openai à savoir les voix en realtime.
1) Avez-vous trouvé des solutions intéressantes pour avoir une latence et une discussion le plus naturelle possible? Quels sont vos meilleurs paramètres avancées sur VAPI?
Pour ma part je viens de tester le modèle openai-4o-realtime-preview avec la voix "ballad" qui, sur le papier permet de réduire la latence totale à 500ms, ce qui est exceptionnel par rapport aux autres modèles, mais dans les faits je ne sens pas de différences, j'ai toujours l'impression que l'IA prend beaucoup de temps avant de répondre - alors je me dis qu'il faut régler les paramètres avancées de VAPI, j'ai activé l'option Smart Endpointing mais je ne vois pas de différence, ensuite j'ai trouvé les paramètres suivants intéressants :
Start speaking plan
Wait Seconds = 0.4s
On Punctuation Seconds = 0.1s
On No Punctuation Seconds = 0.8s
On Number Seconds = 0.5s
Stop speaking plan
Number of words = 1
Voice seconds = 0.2s
Back off seconds = 1
Et vous qu'avez-vous testé de satisfaisant?
2) Ensuite deuxième sujet que je voulais aborder : les problèmes liés à la nouvelle fonctionnalités de openai des voix realtime. Avez-vous rencontré des problèmes que vous n'aviez pas avec les voix classiques? Si oui, avez-vous trouvé des solutions intéressantes?
Pour ma part j'ai eu des soucis où l'IA répétait des phrases en boucle sans plus s'arrêter et où l'IA n'arrivait pas à s'arrêter quand on lui coupe la parole.