Um ano.

$52M de seed.

8M+ criadores.

Nossa história

API de Texto para FalaLeve voz a qualquer aplicativo

Fala expressiva e direcionável com latência de ~100ms, o mesmo modelo S2.1 Pro por trás do HeyGen, Retell e Plaud.

curl https://api.fish.audio/v1/tts \
  -H "Authorization: Bearer YOUR_FISH_AUDIO_API_KEY" \
  -H "Content-Type: application/json" \
  -H "model: s2.1-pro" \
  -d '{
    "text": "[risadinha] Quando você está construindo algo novo, existe essa [plateia rindo] mistura de fascínio e medo. [sussurro] Mas é isso que faz valer a pena construir.",
    "reference_id": "933563129e564b19a115bedd57b7406a",
    "format": "mp3"
  }' --output speech.mp3
<100ms
TEMPO ATÉ O PRIMEIRO ÁUDIO
Ilimitadas
tags de direção
80+
IDIOMAS
$15/1M UTF-8 bytes
PAGUE CONFORME O USO

Em produção em

Modelos criados para diferentes necessidades de produção

Uma API. Troque de modelo com um único header. Os dois modelos de API são cobrados na mesma taxa fixa.

O ORIGINAL

S2 Pro

Preciso até nos enunciados mais curtos

  • Clonagem de voz instantânea
  • Suporte multilíngue completo
  • Confiável em prompts muito curtos
  • Mesma taxa fixa do S2.1 Pro
Ver documentação
RECOMENDADO

S2.1 Pro

O modelo mais expressivo do Fish.

  • Tempo até o primeiro áudio de ~100ms (em uma única H200)
  • Fator de tempo real de 0.195
  • 80+ idiomas, com troca instantânea entre eles
  • Tags de emoção de domínio aberto
  • Múltiplos falantes nativos em uma única geração
Ver documentação
IMPLANTAÇÃO ENTERPRISE

Local

Implante na sua própria infraestrutura.

  • VPC, on-prem, nuvem soberana, air-gapped
  • Sem saída de dados
  • Controle total do modelo
  • Licença comercial disponível
Falar com vendas

Do cadastro ao primeiro áudio em 5 minutos.

Sem ligação de vendas. Obtenha uma chave de API, instale o SDK e coloque no ar.

cURL · REST API
curl https://api.fish.audio/v1/tts \
-H "Authorization: Bearer YOUR_FISH_AUDIO_API_KEY" \
-H "Content-Type: application/json" \
-H "model: s2.1-pro" \
-d '{
"text": "[chuckle] When you are building something new, there is this [emphasis] mix of wonder and fear.",
"reference_id": "YOUR_VOICE_ID",
"format": "mp3"
}' --output speech.mp3
Python · Fish Audio SDK
from fishaudio import FishAudio
from fishaudio.utils import save
client = FishAudio(api_key="YOUR_FISH_AUDIO_API_KEY")
audio = client.tts.convert(
text="Hello from Fish Audio!",
reference_id="YOUR_VOICE_ID",
model="s2.1-pro",
)
save(audio, "output.mp3")

Tudo o que você precisapara lançar fala pronta para produção

Uma única API para criação de voz, geração expressiva e entrega em tempo real.

Emoção e entrega inline

Direção escrita como sintaxe [tag], em qualquer ponto do texto. Tags livres e ilimitadas, sem parâmetro de emoção separado.

Aber
Hey there.Add TagsI’m so excited to share this news!Can you hear me?
[Sad]
[Excited]
[satisfied]
[angry]

Milhões de vozes da comunidade

Navegue e lance a partir da maior biblioteca aberta de vozes, ou clone a sua própria e construa em cima dela.

Diálogo com múltiplos falantes

Gere uma conversa completa em uma única passagem. Disponível no S2.1 Pro.

Aber
Sarah
Ethan

Clonagem de voz instantânea

Capture timbre e estilo de fala a partir de um clipe de referência curto. Funciona em todos os 80+ idiomas, sem treinamento extra.

Recorded Voice
My Cloned Voice
EnglishFemaleYoung

Leitura natural de textos complexos

Números, moedas, datas e unidades pronunciados corretamente

$9.99
01/24
1,999

Streaming e carimbos de data/hora

Transmita áudio com carimbos de data/hora por palavra.

Thefutureiscoming
0.02s0.05s0.01s0.04svoice0.01s0.03s

Construa a experiência de voz que seu produto precisa

Crie uma voz reutilizável, direcione como ela atua e transmita-a para produtos em tempo real.

Clone qualquer voz instantaneamente
com o Fish Audio

A API de clonagem de voz por IA do Fish Audio transforma um clipe de referência curto em uma voz reutilizável. O clone captura o timbre e o estilo de fala e funciona em todos os 80+ idiomas, sem treinamento extra.

PYTHON SDK
# Clone from reference audio
voice = session.create_model(
title="My Voice",
voices=[open("reference.wav", "rb").read()]
)
# Synthesize with the cloned voice
request = TTSRequest(
text="This is my cloned voice.",
reference_id=voice.id
)
with open("clone.mp3", "wb") as f:
for chunk in session.tts(request, backend="s2-pro"):
f.write(chunk)

Fish Audio TTS APIBenchmarks e especificações

Uma API. Troque de modelo com um único header. Os dois modelos de API são cobrados na mesma taxa fixa.

POST https://api.fish.audio/v1/tts

Comparativos
0.195

FATOR DE TEMPO REAL

Clipe curto

CLONAGEM DE VOZ

Nativo

MÚLTIPLOS FALANTES

REST + WebSocket

TRANSMISSÃO

Por palavra

CARIMBOS DE DATA/HORA

48kHz

TAXA DE AMOSTRAGEM

5inicial

SOLICITAÇÕES SIMULTÂNEAS

MP3 · WAV · Opus

FORMATOS DE ÁUDIO

Preços flexíveis para suas necessidades

Pay-as-you-go com qualquer assinaturaSaiba mais

S2.1 Pro

Texto para Fala

$0.015/ K UTF-8 bytes
Começar
Latência ultrabaixa de 70ms
80+ idiomas suportados
Carimbos de data/hora por palavra

S2 Pro

Texto para Fala

$0.015/ K UTF-8 bytes
Começar
Latência em tempo real
Suporte multilíngue completo
Clonagem de voz instantânea

Transcribe-1

Reconhecimento Automático de Fala

$0.006/ minuto de áudio
Começar
Precisão de ASR líder do setor
Multilíngue com dicas de idioma opcionais
Transcrição de entradas longas

Limites de Solicitações Simultâneas

 
Limite de GastosSimultaneidade
Inicial
< $100 pagos5 solicitações
Elevado
≥ $100 pagos15 solicitações
Alto Volume
≥ $1,000 pagos50 solicitações
Enterprise
PersonalizadoLimites personalizados

Perguntas frequentes

Fish Audio

Chegue à produção neste fim de semana

Obtenha uma chave de API, instale o SDK e coloque no ar. Sem necessidade de cartão de crédito.