API de Texto para FalaLeve voz a qualquer aplicativo
Fala expressiva e direcionável com latência de ~100ms, o mesmo modelo S2.1 Pro por trás do HeyGen, Retell e Plaud.

Modelos criados para diferentes necessidades de produção
Uma API. Troque de modelo com um único header. Os dois modelos de API são cobrados na mesma taxa fixa.
S2 Pro
Preciso até nos enunciados mais curtos
- Clonagem de voz instantânea
- Suporte multilíngue completo
- Confiável em prompts muito curtos
- Mesma taxa fixa do S2.1 Pro
S2.1 Pro
O modelo mais expressivo do Fish.
- Tempo até o primeiro áudio de ~100ms (em uma única H200)
- Fator de tempo real de 0.195
- 80+ idiomas, com troca instantânea entre eles
- Tags de emoção de domínio aberto
- Múltiplos falantes nativos em uma única geração
Local
Implante na sua própria infraestrutura.
- VPC, on-prem, nuvem soberana, air-gapped
- Sem saída de dados
- Controle total do modelo
- Licença comercial disponível
Do cadastro ao primeiro áudio em 5 minutos.
Sem ligação de vendas. Obtenha uma chave de API, instale o SDK e coloque no ar.
curl https://api.fish.audio/v1/tts \-H "Authorization: Bearer YOUR_FISH_AUDIO_API_KEY" \-H "Content-Type: application/json" \-H "model: s2.1-pro" \-d '{"text": "[chuckle] When you are building something new, there is this [emphasis] mix of wonder and fear.","reference_id": "YOUR_VOICE_ID","format": "mp3"}' --output speech.mp3
from fishaudio import FishAudiofrom fishaudio.utils import saveclient = FishAudio(api_key="YOUR_FISH_AUDIO_API_KEY")audio = client.tts.convert(text="Hello from Fish Audio!",reference_id="YOUR_VOICE_ID",model="s2.1-pro",)save(audio, "output.mp3")
Tudo o que você precisapara lançar fala pronta para produção
Uma única API para criação de voz, geração expressiva e entrega em tempo real.
Emoção e entrega inline
Direção escrita como sintaxe [tag], em qualquer ponto do texto. Tags livres e ilimitadas, sem parâmetro de emoção separado.
Milhões de vozes da comunidade
Navegue e lance a partir da maior biblioteca aberta de vozes, ou clone a sua própria e construa em cima dela.




Diálogo com múltiplos falantes
Gere uma conversa completa em uma única passagem. Disponível no S2.1 Pro.
Clonagem de voz instantânea
Capture timbre e estilo de fala a partir de um clipe de referência curto. Funciona em todos os 80+ idiomas, sem treinamento extra.
Leitura natural de textos complexos
Números, moedas, datas e unidades pronunciados corretamente
Streaming e carimbos de data/hora
Transmita áudio com carimbos de data/hora por palavra.
Construa a experiência de voz que seu produto precisa
Crie uma voz reutilizável, direcione como ela atua e transmita-a para produtos em tempo real.
Clone qualquer voz instantaneamente
com o Fish Audio
A API de clonagem de voz por IA do Fish Audio transforma um clipe de referência curto em uma voz reutilizável. O clone captura o timbre e o estilo de fala e funciona em todos os 80+ idiomas, sem treinamento extra.
# Clone from reference audiovoice = session.create_model(title="My Voice",voices=[open("reference.wav", "rb").read()])# Synthesize with the cloned voicerequest = TTSRequest(text="This is my cloned voice.",reference_id=voice.id)with open("clone.mp3", "wb") as f:for chunk in session.tts(request, backend="s2-pro"):f.write(chunk)
Fish Audio TTS APIBenchmarks e especificações
Uma API. Troque de modelo com um único header. Os dois modelos de API são cobrados na mesma taxa fixa.
POST https://api.fish.audio/v1/tts
FATOR DE TEMPO REAL
Clipe curto
CLONAGEM DE VOZ
Nativo
MÚLTIPLOS FALANTES
REST + WebSocket
TRANSMISSÃO
Por palavra
CARIMBOS DE DATA/HORA
TAXA DE AMOSTRAGEM
SOLICITAÇÕES SIMULTÂNEAS
MP3 · WAV · Opus
FORMATOS DE ÁUDIO
Preços flexíveis para suas necessidades
Limites de Solicitações Simultâneas
Perguntas frequentes
Chegue à produção neste fim de semana
Obtenha uma chave de API, instale o SDK e coloque no ar. Sem necessidade de cartão de crédito.

