je recois l'audio de Vonage des appels entrants sur un websocket, je transmets l'audio à Deepgram (client python asynchrone), je transmets le texte provenant de Deepgram au client chatgpt, en anyschrone, et j'envoi la sortie au nouveau client python de Cartesia (ils ont fait une MAJ hier soir), toujours en asynchrone, et enfin j'envoi l'audio généré sur le websocket pour le restituer dans l'appel. J'ai passé plusieurs jours à faire des tests avec daily.co pour utiliser le webrtc (et la gestion des frames qui peut être intéressante) mais au final je perdais en latence