API de texto a vozIntegra voz en cualquier app
Voz expresiva y dirigible con una latencia de ~100ms, el mismo modelo S2.1 Pro detrás de HeyGen, Retell y Plaud.

Modelos diseñados para distintas necesidades de producción
Una sola API. Cambia de modelo con un único encabezado. Ambos modelos de la API se facturan a la misma tarifa plana.
S2 Pro
Preciso incluso en los enunciados más cortos
- Clonación de voz instantánea
- Soporte multilingüe completo
- Fiable con prompts muy cortos
- Misma tarifa plana que S2.1 Pro
S2.1 Pro
El modelo más expresivo que ofrece Fish.
- Tiempo hasta el primer audio ~100ms (en un solo H200)
- Factor de tiempo real de 0.195
- 80+ idiomas, cambio de código instantáneo
- Etiquetas de emoción de dominio abierto
- Multi-hablante nativo en una sola generación
On-premise
Despliega en tu propia infraestructura.
- VPC, on-prem, nube soberana, air-gapped
- Sin salida de datos
- Control total del modelo
- Licencia comercial disponible
Del registro al primer audio en 5 minutos.
Sin llamada de ventas. Obtén una clave de API, instala el SDK y despliega.
curl https://api.fish.audio/v1/tts \-H "Authorization: Bearer YOUR_FISH_AUDIO_API_KEY" \-H "Content-Type: application/json" \-H "model: s2.1-pro" \-d '{"text": "[chuckle] When you are building something new, there is this [emphasis] mix of wonder and fear.","reference_id": "YOUR_VOICE_ID","format": "mp3"}' --output speech.mp3
from fishaudio import FishAudiofrom fishaudio.utils import saveclient = FishAudio(api_key="YOUR_FISH_AUDIO_API_KEY")audio = client.tts.convert(text="Hello from Fish Audio!",reference_id="YOUR_VOICE_ID",model="s2.1-pro",)save(audio, "output.mp3")
Todo lo que necesitaspara llevar voz a producción
Una sola API para creación de voz, generación expresiva y entrega en tiempo real.
Emoción e interpretación inline
Dirección escrita como sintaxis [tag], en cualquier punto del texto. Tags libres e ilimitados, sin parámetro de emoción independiente.
Millones de voces de la comunidad
Explora y lanza voces desde la biblioteca abierta más grande, o clona la tuya propia y construye sobre ella.




Diálogo multi-hablante
Genera una conversación completa en una sola pasada. Disponible en S2.1 Pro.
Clonación de voz instantánea
Captura el timbre y el estilo de habla a partir de un clip de referencia corto. Funciona en los 80+ idiomas sin entrenamiento adicional.
Lee texto complejo de forma natural
Números, divisas, fechas y unidades pronunciados correctamente
Streaming y marcas de tiempo
Transmite audio en streaming con marcas de tiempo por palabra.
Crea la experiencia de voz que tu producto necesita
Crea una voz reutilizable, dirige cómo se interpreta y transmítela en streaming a productos en tiempo real.
Clona cualquier voz al instante
con Fish Audio
La API de clonación de voz con IA de Fish Audio convierte un clip de referencia corto en una voz reutilizable. La clonación captura el timbre y el estilo de habla, y se mantiene en los 80+ idiomas sin entrenamiento adicional.
# Clone from reference audiovoice = session.create_model(title="My Voice",voices=[open("reference.wav", "rb").read()])# Synthesize with the cloned voicerequest = TTSRequest(text="This is my cloned voice.",reference_id=voice.id)with open("clone.mp3", "wb") as f:for chunk in session.tts(request, backend="s2-pro"):f.write(chunk)
Fish Audio TTS APIBenchmarks y especificaciones
Una sola API. Cambia de modelo con un único encabezado. Ambos modelos de la API se facturan a la misma tarifa plana.
POST https://api.fish.audio/v1/tts
FACTOR DE TIEMPO REAL
Clip corto
CLONACIÓN DE VOZ
Nativo
MULTI-HABLANTE
REST + WebSocket
STREAMING
Por palabra
MARCAS DE TIEMPO
FRECUENCIA DE MUESTREO
SOLICITUDES CONCURRENTES
MP3 · WAV · Opus
FORMATOS DE AUDIO
Precios flexibles para tus necesidades
Límites de solicitudes concurrentes
Preguntas frecuentes
Llega a producción este fin de semana
Obtén una clave de API, instala el SDK y despliega. Sin tarjeta requerida.

