Um TTS natural em japonês não bastava para os personagens de IA da Pictoria
Para a Pictoria, a voz faz parte do próprio personagem. Um modelo pode produzir japonês preciso e natural e ainda ser insuficiente quando o personagem precisa soar empolgado, emotivo, brincalhão ou distinto.
O desafio fica mais evidente em conteúdos longos. Pequenas diferenças de tom, ritmo e expressão emocional podem mudar a percepção do personagem, tornando a consistência tão importante quanto a naturalidade.
A Pictoria precisava dar a cada personagem uma voz que preservasse sua personalidade em diferentes interações e conteúdos.
A Pictoria criou o Picto VOICE para escolher o modelo certo para cada personagem
Em vez de depender de um único fornecedor de TTS, a Pictoria criou o Picto VOICE como um sistema de voz com vários modelos. A equipe podia avaliar diferentes modelos e adequá-los aos requisitos de cada personagem ou produção.
Essa abordagem elevou o padrão exigido de todos os modelos do sistema. A Fish Audio precisava oferecer um diferencial significativo, e não ser apenas mais uma opção competente de TTS em japonês.
A Fish Audio se destacou onde a expressão do personagem era prioridade
A Pictoria avaliou a Fish Audio junto com outras tecnologias de geração de voz e identificou três destaques: vozes expressivas para personagens, prosódia e entonação japonesas e flexibilidade no design das vozes.
A diferença era especialmente clara na maneira como a voz transmitia emoção em uma única fala. Em vez de apenas ler uma frase, o modelo podia dar ao personagem um registro emocional e uma personalidade próprios.
A Fish Audio também trabalhou em estreita colaboração com a equipe da Pictoria nas necessidades específicas das vozes de personagens de IA em japonês. Assim, a integração se tornou uma colaboração contínua, além de uma simples relação com um fornecedor.
A Fish Audio está sempre ampliando os limites da geração de voz de alta qualidade esperada pelo mercado japonês. Acreditamos que só uma equipe que realmente ama conteúdo centrado em personagens pode criar vozes com esse nível de nuances emocionais e expressão.

Hayato Akedo
CEO da Pictoria
A Fish Audio dá voz aos personagens em que a expressão mais importa
No Picto VOICE, a Pictoria usa a Fish Audio quando a expressão do personagem é decisiva. Uma aplicação importante é o fluxo de produção de voz de seus personagens de IA originais, desenvolvidos e operados por seus próprios canais de publicação.
A integração teve uma recepção positiva nesses projetos. Os usuários destacam consistentemente três qualidades: vozes japonesas naturais, maior expressão emocional e consistência em conteúdos longos.
O resultado: vozes de personagens melhores, da produção ao público
Após integrar a Fish Audio ao Picto VOICE, a Pictoria observou melhorias significativas na velocidade de resposta em japonês e na expressão emocional de seus projetos de personagens de IA. As vozes dos personagens originais também receberam avaliações muito positivas pela naturalidade, emoção e consistência ao longo de horas de conteúdo.
Isso oferece à Pictoria uma vantagem prática na produção: a equipe pode combinar cada personagem com a tecnologia de voz mais adequada à experiência e usar a Fish Audio quando a prioridade é uma interpretação expressiva em japonês.