Dubbing AI voulait un Voice Agent qui ressemble à une personne, pas à un assistant vocal
Dubbing AI avait déjà construit une plateforme centrée sur la voix. Ses utilisateurs pouvaient modifier leur voix en temps réel, la cloner, affiner des accents et traduire entre plusieurs langues. Voice Agent ouvrait une nouvelle voie : l'IA pouvait désormais parler à leur place.
Les usages étaient immédiats. Un joueur pouvait laisser l'agent répondre dans une conversation. Une personne trop occupée pour téléphoner pouvait lui confier l'appel. Quelqu'un temporairement indisponible pouvait continuer à communiquer en temps réel.
Mais cette expérience ne fonctionnait que si la voix semblait réelle.
Une pause perceptible rendait l'échange artificiel, tout comme une réponse monotone ou robotique. Pour Dubbing AI, la synthèse vocale en temps réel ne consistait pas simplement à générer rapidement la parole. La voix devait rester naturelle, transmettre des émotions, préserver l'identité du locuteur et fonctionner dans les langues de ses utilisateurs du monde entier.
Le modèle le plus rapide ne suffisait pas si sa voix restait monotone
Dubbing AI a évalué plusieurs fournisseurs de synthèse vocale selon les exigences de Voice Agent. L'équipe a retenu cinq critères : naturel, profondeur émotionnelle, qualité du clonage vocal, latence et prise en charge multilingue.
L'évaluation a révélé un compromis difficile. Les modèles à faible latence pouvaient manquer d'expression émotionnelle. Les modèles expressifs pouvaient introduire des délais perturbant la conversation. D'autres étaient performants dans une langue, mais perdaient en qualité lors d'un changement de langue.
Pour un produit servant plus de 10 millions d'utilisateurs dans le jeu, le divertissement et les usages commerciaux, exceller sur un seul aspect de l'expérience ne suffisait pas.
Dubbing AI avait besoin d'un modèle capable de satisfaire toutes les exigences à la fois.
Fish Audio offre une naturalité vocale exceptionnelle, une expression émotionnelle riche et un TTS fiable à faible latence qui soutient parfaitement l'expérience centrale de notre produit Voice Agent.

Tiange Ling
CEO de Dubbing AI
Fish Audio était le seul modèle à satisfaire les cinq exigences
Fish Audio s’est distingué en réunissant les qualités dont Dubbing AI avait besoin pour Voice Agent : une parole naturelle, une profondeur émotionnelle, un clonage vocal performant, une faible latence et la prise en charge de plusieurs langues.
Cette différence comptait, car les critères étaient liés. Le naturel rendait la voix crédible. L'expression émotionnelle lui donnait son humanité. Le clonage préservait l'identité du locuteur. La faible latence maintenait la fluidité des échanges. Le multilingue offrait la même expérience aux utilisateurs de Dubbing AI partout dans le monde.
Fish Audio prenait en charge plus de 80 langues avec une alternance linguistique native, tout en conservant la réactivité nécessaire aux interactions en temps réel.
Naturel
Une parole humaine, sans sonorité synthétique
Profondeur émotionnelle
Une expression qui transmet chaque nuance
Clonage vocal
Des voix clonées qui préservent l'identité du locuteur
Faible latence
Des réponses en temps réel sans délai perceptible
Support multilingue
Plus de 80 langues avec alternance linguistique native
Fish Audio permet à Dubbing AI de développer Voice Agent à grande échelle
Voice Agent passe d'une possibilité technique à un produit que Dubbing AI peut proposer à ses utilisateurs du monde entier. Fish Audio assurant la synthèse vocale en temps réel, Dubbing AI peut créer de nouvelles façons de communiquer tout en conservant la rapidité, l'expressivité et la qualité vocale requises.
Le résultat est un agent vocal qui ne se contente pas de répondre : il donne envie de poursuivre la conversation.