Fish Audio S2.1 Pro: API de Texto para Fala Gratuita para Desenvolvedores
Resumo rápido:
S2.1 Pro, o modelo de voz mais avançado da Fish Audio, está agora disponível como uma API gratuita de texto para fala
83 idiomas, uso ilimitado sob a Política de Uso Justo
String do modelo: s2.1-pro-free — basta inseri-la em suas chamadas de API da Fish existentes
Experimente o S2.1 Pro grátis — primeiro áudio em 5 minutos →
Junho de 2026 | O modelo S2.1 Pro da Fish Audio está agora disponível como uma API gratuita de texto para fala com acesso ilimitado sob Uso Justo.
Por que a IA de Voz de Alta Qualidade Sempre Foi Cara
Se você já passou algum tempo avaliando APIs de texto para fala, já conhece o padrão: os modelos que realmente soam bem custam caro.
A camada gratuita da ElevenLabs oferece 10.000 créditos por mês (aproximadamente 6 a 10 minutos) antes que a barreira de pagamento apareça. O OpenAI TTS é pago por uso, sem nenhuma camada gratuita. Os modelos Gemini TTS mais recentes do Google — os mais avançados deles — não têm uso gratuito: você paga desde o primeiro token. O padrão é consistente em toda a indústria: a qualidade de voz de ponta tem sido um recurso pago.
Isso cria um problema real para os desenvolvedores. O mercado de geradores de voz por IA está crescendo quase 20% ao ano — mas o ferramental para construir produtos habilitados para voz permaneceu atrás de uma barreira de pagamento. Você não consegue avaliar adequadamente um modelo com 10.000 créditos. Você não pode prototipar um agente de voz, testar um pipeline de audiolivro ou experimentar com clonagem de voz sem comprometer o orçamento antecipadamente ou passar semanas lutando com alternativas de código aberto que exigem sua própria infraestrutura de GPU.
A Fish Audio está mudando isso hoje.
O Que É o S2.1 Pro?
O S2.1 Pro é o modelo de voz atual de última geração da Fish Audio — o melhor modelo que temos, agora disponível gratuitamente para todos os desenvolvedores via API. É um modelo neural de síntese de fala projetado para geração de voz por IA de nível de produção, com pontos fortes particulares em streaming de baixa latência, TTS multilíngue e clonagem de voz. Ele se baseia na fundação do S2, que lançamos com pesos abertos no início deste ano.
Desempenho
- 61% de taxa de vitória contra o S2 Pro da geração anterior em avaliações de audição frente a frente — veja nossa comparação cega de provedores de TTS para contexto
- ~70ms de Tempo para o Primeiro Áudio (TTFA) em solicitação única — abaixo dos ~100ms na geração anterior
- Melhoria de mais de 2x no throughput sob carga de alta concorrência
Para o embasamento técnico completo, veja nosso artigo: Aqui
Cobertura de Idiomas
O S2.1 Pro suporta 83 idiomas, incluindo inglês, japonês, chinês, coreano, espanhol, árabe, francês, alemão, português, russo e dezenas de outros. O mesmo modelo lida com todos os idiomas — sem endpoints separados, sem preços por idioma.
Latência
O S2.1-Pro entrega ~90ms de TTFA (Tempo para o Primeiro Áudio) na API padrão, tornando-o viável para agentes de voz ao vivo e sistemas de diálogo com alternância de turnos. Se você precisa de controle refinado sobre a prosódia e a entrega, veja também as capacidades de controle de voz ao nível da palavra do S2.
Por que a Fish Audio pode oferecer isso gratuitamente agora
A versão curta: reconstruímos a pilha de inferência do zero, e o custo por solicitação caiu o suficiente para que pudéssemos absorvê-lo.
Kernels de GPU Personalizados
Desenvolvemos o fish-scales-ops, uma biblioteca de GEMM FP8 e FlashAttention de nível de produção visando as arquiteturas NVIDIA Hopper (H100/H200) e Blackwell (RTX 6000 PRO). Nos formatos de decodificação que importam para o serviço de IA de voz, nosso caminho MXFP8 supera a referência cuBLAS fundida pelo torch.compile em 2,1–4,3×. Você não precisa entender nada disso para usar a API — mas é por isso que a camada gratuita é sustentável.
Maior Throughput
Em uma única H200 com quantização FP8, o sistema sustenta um throughput de saída de mais de 8.000 tokens/segundo em 64 solicitações simultâneas. Mais throughput por GPU significa mais solicitações atendidas por dólar, o que torna o acesso gratuito ilimitado economicamente viável.
O que "Grátis" Realmente Significa
Preferimos ser honestos sobre as restrições do que escondê-las.
O que você recebe:
- String do modelo:
s2.1-pro-free - Acesso de alto volume sem limite rígido de caracteres (sujeito à Política de Uso Justo)
- O mesmo endpoint de API dos planos pagos — sem integração separada
Limitações atuais:
- Duração:
O acesso gratuito está disponível até 24 de julho de 2026 O acesso gratuito está disponível até o final de julho de 2026O acesso gratuito está disponível até 31 de agosto de 2026 — comunicaremos quaisquer alterações com aviso prévio.- Atualização (Junho de 2026): Estamos estendendo a janela gratuita para cobrir todo o mês de julho. Queremos que os desenvolvedores tenham um mês completo e ininterrupto para construir, avaliar e lançar — sem contar os dias para um prazo final.
- Atualização (Julho de 2026): Estamos estendendo o acesso gratuito mais uma vez, até 31 de agosto de 2026. Ver o que nossos desenvolvedores Fish têm construído com o S2.1 Pro tem sido genuinamente gratificante, e queremos dar a esse impulso ainda mais espaço para crescer.
- Sem SLA: Sem garantias de tempo de atividade ou TTFA; construído para experimentação e prototipagem
- Sem garantia de latência: Melhor esforço, não contratual
- Retenção de dados: As solicitações podem ser usadas para melhorar a qualidade do modelo — consulte nossa Política de Privacidade
- Uso comercial: Alguns cenários comerciais podem ter restrições. Produtos que geram mais de US$ 1 milhão em receita anual recorrente (ARR) devem entrar em contato conosco antes de usar o S2.1 Pro Free. Veja Preços e Limites de Taxa para detalhes.
Se você precisar de garantias de produção, SLA e latência, os planos pagos estão disponíveis. Esta camada é o lugar certo para construir, avaliar e decidir.
Como Usar a API Gratuita de Texto para Fala: Guia Rápido S2.1 Pro
Obtenha sua chave de API em fish.audio/app/api-keys e faça sua primeira chamada. A API da Fish aceita solicitações codificadas em msgpack e retorna áudio no formato escolhido. Referência completa na documentação da API.
JavaScript
import { writeFile } from "fs/promises";
const body = {
text: "Olá, mundo!",
reference_id: "seu_id_de_modelo",
format: "mp3",
};
const res = await fetch("https://api.fish.audio/v1/tts", {
method: "POST",
headers: {
Authorization: "Bearer <SUA_CHAVE_API>",
"Content-Type": "application/json",
model: "s2.1-pro-free",
},
body: JSON.stringify(body),
});
if (!res.ok) {
throw new Error(`Solicitação TTS falhou: ${res.status} ${await res.text()}`);
}
const buffer = Buffer.from(await res.arrayBuffer());
await writeFile("output.mp3", buffer);
Python
import httpx
body = {
"text": "Olá, mundo!",
"reference_id": "seu_id_de_modelo",
"format": "mp3",
}
with httpx.Client() as client:
res = client.post(
"https://api.fish.audio/v1/tts",
headers={
"Authorization": "Bearer <SUA_CHAVE_API>",
"Content-Type": "application/json",
"model": "s2.1-pro-free",
},
json=body,
)
res.raise_for_status()
with open("output.mp3", "wb") as f:
f.write(res.content)
A única mudança em relação a qualquer outra chamada de API da Fish Audio: defina model: "s2.1-pro-free" nos cabeçalhos. É só isso.
Obtenha sua chave de API gratuita →
S2.1 Pro vs ElevenLabs e as Melhores APIs de TTS em 2026
As informações sobre concorrentes abaixo baseiam-se na documentação disponível publicamente e nas páginas de preços em junho de 2026. Preços e recursos podem mudar — verifique diretamente com cada provedor antes de tomar uma decisão de produção.
Para uma análise independente mais profunda, veja nossa comparação cega de provedores de TTS.
Conclusão: Entre os principais provedores de API de TTS que avaliamos, a Fish Audio oferece atualmente um dos modelos de acesso gratuito mais generosos — o único em que a camada gratuita executa o mesmo modelo de última geração que a camada paga, sem limite rígido de uso. A camada gratuita da ElevenLabs é efetivamente um teste de 10.000 créditos. O TTS mais avançado do Google (Gemini TTS) não tem nenhuma camada gratuita.
Procurando uma alternativa gratuita ao ElevenLabs que não comprometa a qualidade do modelo? O S2.1 Pro está disponível agora sem limite de uso.
Procurando uma alternativa gratuita ao OpenAI TTS? A oferta de TTS da OpenAI não tem camada gratuita — o S2.1 Pro é uma opção convincente para avaliar primeiro.
Veja a documentação completa da API e comece a construir →
O Que Você Pode Construir Com Ele
A camada gratuita é intencionalmente irrestrita quanto aos casos de uso. Aqui estão os cenários onde a combinação do S2.1 Pro de geração de voz por IA de baixa latência, suporte multilíngue e clonagem de voz tende a fazer a maior diferença.
Agentes de Voz
A IA conversacional em tempo real vive e morre pela latência. Com ~90ms de TTFA para chamadas padrão, o S2.1 Pro é rápido o suficiente para diálogos naturais com alternância de turnos. Combine-o com uma camada de fala para texto e um LLM para um pipeline de voz completo sem uma fatura por caractere. Você também pode integrar o S2.1 Pro em fluxos de trabalho de agentes através do nosso suporte a MCP e habilidades de agente.
Audiolivros e Narração de Longa Duração
O suporte a 83 idiomas e a prosódia natural tornam o S2.1 Pro bem adequado para a produção de audiolivros e síntese de fala de longa duração. O uso ilimitado significa que você pode processar manuscritos completos sem vigiar um contador de caracteres ou pré-adquirir créditos.
Clonagem de Voz
O S2.1 Pro suporta clonagem de voz a partir de áudio de referência via API — envie uma amostra de áudio de referência e o modelo sintetiza a fala naquela voz. Construa aplicativos de voz personalizados, localize conteúdo com identidade de falante consistente ou gere vozes de personagens para jogos e animação. A clonagem de voz está disponível na camada gratuita, sujeita à mesma Política de Uso Justo.
Aplicações Multilíngues
Se sua aplicação atende usuários em vários idiomas, a cobertura de 83 idiomas com uma única API de voz por IA consistente é uma simplificação significativa em relação às alternativas que exigem endpoints de modelo separados por idioma ou cobram taxas premium para síntese de fala não inglesa.
Diálogo de NPCs de Jogos
Os pipelines de áudio de jogos se beneficiam de alto throughput e custo previsível por solicitação. O uso gratuito ilimitado torna prático gerar grandes bibliotecas de diálogos e iterar livremente durante o desenvolvimento antes de comprometer um orçamento de produção.
Disponível Através do Nosso Ecossistema de Parceiros
O S2.1 Pro também está disponível através de um número crescente de plataformas parceiras, incluindo Runware, Retell, Sierra e outros.
Se você já está construindo em uma dessas plataformas, o S2.1 Pro está acessível sem integração ou configuração adicional — basta usar o que você já tem.
Estamos expandindo ativamente a rede de parceiros. Se você é um provedor de plataforma ou infraestrutura interessado em integrar o S2.1 Pro, entre em contato com nossa equipe para explorar o que é possível.
Uso Justo e O Que Vem a Seguir
A camada gratuita opera sob uma Política de Uso Justo. Reservamo-nos o direito de acelerar ou limitar o acesso para padrões de uso que pareçam abuso em vez de desenvolvimento — o objetivo é proteger o acesso para toda a comunidade de desenvolvedores, não criar limites arbitrários para casos de uso legítimos. Veja Preços e Limites de Taxa para detalhes.
Algumas coisas a esperar:
- O acesso gratuito está disponível agora por um período inicial. Avisaremos com antecedência antes que qualquer coisa mude.
- Planos pagos com garantias de SLA, compromissos de latência e licenciamento comercial estão disponíveis para cargas de trabalho de produção.
- O investimento em infraestrutura é contínuo — o trabalho de engenharia que tornou esta camada gratuita possível não é um evento único.
- Infraestrutura de código aberto: Planejamos abrir o código dos componentes de infraestrutura por trás do S2.1 Pro — a mesma pilha que torna a camada gratuita sustentável.
Se você está avaliando a Fish Audio para uma implantação em produção, a camada gratuita é o lugar certo para começar. Construa algo real, meça o que importa para sua aplicação e entre em contato quando estiver pronto para discutir os requisitos de produção.
Sem cartão de crédito. Sem lista de espera. Sem limite para o que você pode tentar.

