Um ano.

$52M de seed.

8M+ criadores.

Nossa história
27 de jul. de 2026Empresa

5 Modelos, 22 Pessoas, 1 Ano

5 Modelos, 22 Pessoas, 1 Ano

A Fish Audio arrecadou US$ 52 milhões em financiamento seed. Como um projeto de hobby em uma única 4090 se tornou isso, e o que estamos construindo a seguir. Leia nossa história.

Hoje marcamos outro marco incrível para a Fish Audio. Estamos anunciando US$ 52 milhões em financiamento seed no nosso primeiro aniversário. Agradecemos à Coreline Ventures e à Capital Today, que lideraram a rodada, com a participação da 359 Capital, Play Time, HF0, 645 Ventures, Parable, Carya Venture Partners, Alphalist Partners e dos anjos que investiram quando não havia muito para se ver.

O texto para fala (text-to-speech) tem sido bom o suficiente há cerca de uma década, desde que você precise apenas de uma frase. As rachaduras aparecem na décima. Toda a categoria falha no mesmo lugar, pelo mesmo motivo: acertar as palavras e acertar a entrega são problemas diferentes, e quase todo mundo só trabalhou no primeiro.

Anos em IA de voz na Amazon Alexa e Meta me ensinaram onde o TTS legado termina: uma voz construída para ler nunca aprende a performar. Então começamos pela outra ponta. A Fish Audio não é um assistente de voz melhor. É a camada de voz para tudo o que vem depois dela.

Dois fundadores da empresa sentados lado a lado em poltronas de madeira, de frente para a câmera, com uma janela do chão ao teto e árvores ao fundo.

A 4090

Shijia Liao, nosso cientista-chefe, chegou à mesma conclusão por um caminho diferente. Como engenheiro de pesquisa na NVIDIA trabalhando com vídeo, ele passava seu tempo livre assistindo a transmissões de VTubers e não conseguia ignorar o quão sem vida as vozes soavam. Ele começou a treinar modelos em uma única 4090 em seu quarto, fazendo uma aposta antecipada em uma arquitetura autorregressiva dupla que o resto da indústria levaria mais dois anos para alcançar. Esse trabalho tornou-se a base do S2.

O Que Fizemos em 1 Ano

  • Cinco modelos de áudio de última geração lançados. Quatro de texto para fala, um de fala para texto.
  • Aumentamos a equipe de 3 para 22 pessoas, e ainda estamos contratando.
  • De zero a US$ 21 milhões em receita recorrente anual (ARR).
  • Mais de 8 milhões de criadores, desenvolvedores e empresas na plataforma.
  • Mais de 2 milhões de modelos de voz na biblioteca da comunidade.
  • S2.1 Pro, preferido por 66% dos ouvintes em relação aos principais concorrentes em testes cegos de audição.
  • Mais de 83 idiomas com cadência nativa e controle de emoção no nível da palavra em mais de 15.000 controles de linguagem natural.

A Comunidade Construiu o Modelo

Realizamos pós-treinamento com base nas preferências reais dos usuários, o que significa que o modelo melhora conforme as pessoas o usam mais. É por isso que nos destacamos em inglês com sotaque, mandarim, japonês, coreano e espanhol, onde modelos treinados principalmente em inglês americano padrão falham. Essa capacidade veio de pessoas usando a ferramenta em idiomas, sotaques e casos extremos que nunca teríamos pensado em testar.

A Fish Speech passou de um repositório para uma empresa por causa de desenvolvedores de jogos, fãs de anime e pessoas dublando personagens por diversão. Desde o início, acreditamos na transparência e na abertura, tornando a IA de voz expressiva e de alta qualidade acessível a todos.

E oito milhões de vocês confiaram em nós para fazer isso.

O Modelo em que as Empresas Agora Confiam

Essa confiança é o motivo pelo qual as empresas também estão recorrendo à Fish Audio. Junto com os desenvolvedores, o setor corporativo representa agora dois terços da nossa receita.

Oferecemos a eles tempo de atividade (uptime), latência e uma postura de segurança que sobrevive ao processo de aquisição: implantação on-premises, políticas de retenção zero de dados e configurações em conformidade com HIPAA, integradas desde o início. O S2.1 Pro já vence testes cegos contra os modelos líderes, roda a mais de 8.000 tokens por segundo em uma única H200 e se mantém firme em idiomas onde modelos ajustados para apenas um dialeto quebram silenciosamente.

Clientes corporativos nos procuram porque acertar a entrega, e não apenas as palavras, é exatamente o problema que nos propusemos a resolver. É a mesma missão na qual agora podemos ir mais longe.

O Que Vem a Seguir?

O texto para fala nunca foi o objetivo final. Foi a parte que pudemos construir primeiro com uma única GPU e provar a teoria: a entrega importa tanto quanto as palavras, e ninguém estava resolvendo isso.

Agora vamos atrás do resto do stack. Audio Understanding Language Model (Audio LM) e fala-para-fala (speech-to-speech). Também estamos dobrando a aposta em ferramentas para desenvolvedores e na API, expandindo nossa equipe corporativa e aprofundando parcerias com LiveKit e Retell para levar a voz expressiva a mais lugares, mais rápido.

Gratuito até Agosto

Para comemorar este marco importante, o S2.1 Pro é gratuito para todos os desenvolvedores via API até o final de agosto. Este é o mesmo modelo pelo qual nossos clientes corporativos pagam. Também estamos oferecendo 50% de desconto nos planos para criadores e 3 meses grátis se você estiver migrando de outro provedor.

A razão pela qual podemos fazer isso é técnica, e o crédito vai para nossa equipe de pesquisa. Eles reconstruíram todo o nosso stack de inferência este ano: kernels FP8 personalizados, mais de 8.000 tokens por segundo em uma única H200. Isso reduziu nosso custo por solicitação o suficiente para que oferecer o modelo gratuitamente se tornasse uma estratégia bem-sucedida.

Obrigado

Há um ano, a Fish Audio era um projeto de hobby iniciado em nossa sala de estar. Todos que treinaram uma voz, dublaram um personagem, construíram na API ou apostaram em nós antes de haver muito no que apostar — isso é tanto de vocês quanto nosso.

Erramos muitas coisas ao longo do caminho. Agora teremos os recursos para acertar muito mais coisas.

Que venha o segundo ano.

Rissa Cao

Rissa CaoX

Rissa is the CEO and co-founder of Fish Audio, pushing breakthroughs in AI voice technology. Find her latest work at @rissa_cao.

Leia mais de Rissa Cao

Crie vozes que parecem reais

Comece a gerar áudio da mais alta qualidade hoje.

Já tem uma conta? Entrar