O Dubbing AI queria que o Voice Agent parecesse uma pessoa, não um assistente de voz
O Dubbing AI já havia construído uma plataforma centrada na voz. Os usuários podiam mudar a voz em tempo real, cloná-la, ajustar sotaques e traduzir entre idiomas. O Voice Agent levou o produto em uma nova direção: a IA agora podia falar em nome do usuário.
Os casos de uso eram imediatos. Um gamer podia deixar o agente responder durante uma conversa. Quem estivesse ocupado demais para telefonar podia delegar a ligação. Alguém temporariamente indisponível ainda podia se comunicar em tempo real.
Mas a experiência só funcionava se a voz soasse real.
Uma pausa perceptível tornava a interação artificial, assim como uma resposta monótona ou robótica. Para o Dubbing AI, TTS em tempo real não era apenas gerar fala rapidamente. A voz precisava soar natural, transmitir emoção, preservar a identidade de quem fala e funcionar nos idiomas necessários aos usuários do mundo todo.
O modelo mais rápido não bastava se a voz soasse monótona
O Dubbing AI avaliou vários provedores de TTS conforme as exigências do Voice Agent. A equipe definiu cinco critérios: naturalidade, profundidade emocional, qualidade da clonagem de voz, latência e suporte multilíngue.
A avaliação revelou um equilíbrio difícil. Modelos com baixa latência podiam perder expressão emocional. Modelos expressivos podiam causar atrasos que interrompiam a conversa. Outros funcionavam bem em um idioma, mas perdiam qualidade quando os usuários trocavam de língua.
Para um produto com mais de 10 milhões de usuários em jogos, entretenimento e usos comerciais, ser excelente em apenas parte da experiência não era suficiente.
O Dubbing AI precisava de um modelo que atendesse a todos os critérios de uma vez.
A Fish Audio entrega naturalidade vocal excepcional, expressão emocional rica e TTS confiável de baixa latência que sustentam perfeitamente a experiência central do nosso produto Voice Agent.

Tiange Ling
CEO da Dubbing AI
O Fish Audio foi o único modelo a atender aos cinco requisitos
A Fish Audio se destacou por oferecer a combinação que a Dubbing AI precisava para o Voice Agent: fala natural, profundidade emocional, clonagem de voz de qualidade, baixa latência e suporte multilíngue.
Essa diferença importava porque os critérios estavam interligados. A naturalidade tornava a voz convincente. A expressão emocional a tornava humana. A clonagem preservava a identidade de quem fala. A baixa latência mantinha a conversa fluida. O suporte multilíngue levava a mesma experiência aos usuários do Dubbing AI no mundo todo.
A Fish Audio oferecia mais de 80 idiomas com alternância nativa entre eles, mantendo a capacidade de resposta necessária para interações em tempo real.
Naturalidade
Fala que soa humana, não sintetizada
Profundidade emocional
Expressão que transmite cada nuance
Clonagem de voz
Vozes clonadas que preservam a identidade de quem fala
Baixa latência
Respostas em tempo real sem atraso perceptível
Suporte multilíngue
Mais de 80 idiomas com alternância nativa entre línguas
O Fish Audio dá ao Dubbing AI espaço para expandir o Voice Agent
O Voice Agent está deixando de ser uma possibilidade técnica para se tornar um produto que o Dubbing AI pode levar à sua base global. Com o Fish Audio cuidando do TTS em tempo real, o Dubbing AI pode criar novas formas de comunicação mantendo a velocidade, a expressividade e a qualidade de voz exigidas.
O resultado é um agente de voz que não apenas responde: ele soa como alguém com quem você quer continuar conversando.