IA de voz lista para producción.Precios de startup.Abierto como una comunidad.
Integra síntesis de voz realista, clonación de voz y transcripción con una única API. SDK oficiales para Python y TypeScript. Latencia menor a un segundo. Precios de pago por uso desde tu primera llamada.

S2.1 Pro en vivo. Elige una voz, escribe una línea y escúchala al instante. El mismo modelo que usan HeyGen, Retell y Sanas en producción — sin registro, sin llamada de ventas, sin entorno de demo.
# The same call. The (direction) tags travel with the text.
curl https://api.fish.audio/v1/tts \
-H "Authorization: Bearer $FISH_API_KEY" \
-H "Content-Type: application/json" \
-d '{
"text": "[chuckle] When you’re creating something new, there’s this [emphasis] beautiful mix of wonder and fear.",
"reference_id": "933563129e564b19a115bedd57b7406a",
"format": "mp3"
}' --output speech.mp3Del registro al primer audio en 5 minutos.
Sin llamada de ventas. Obtén una clave de API, instala el SDK y despliega.
# Text to speech in one callcurl -X POST \ https://api.fish.audio/v1/tts \-H "Authorization: Bearer $FISH_API_KEY" \-H "Content-Type: application/json" \-H "model: s2.1-pro-free" \-d '{"text": "Hello! Welcome to Fish Audio."}' \--output welcome.mp3
# Text to speech with the Python SDKfrom fish_audio_sdk import Session, TTSRequestsession = Session("YOUR_API_KEY")request = TTSRequest(text="Hello! Welcome to Fish Audio.")with open("welcome.mp3", "wb") as f:for chunk in session.tts(request):f.write(chunk)
Lo que los equipos despliegan con Fish.
Voz que aguanta en cámara
# Vídeo de avataresTTS sincronizable con labios y con conciencia emocional para productos de avatares IA. Los tags de dirección inline impulsan la actuación, no solo las palabras.
IA conversacional en tiempo real
# Agente de vozTurnos de menos de un segundo por WebSocket. TTS y ASR en streaming en un solo stack. Con detección de interrupciones.
Contenido hablado dinámico.
# Contenido de audio y compañerosNotas a audio, herramientas de preparación, compañeros IA. Precios por carácter que escalan con el uso, no con los asientos.
Clona en 30 segundos. O prescinde de la clonación.
# Apps de personajesIVC desde 30 segundos de audio. PVC para réplicas de calidad estudio. O explora la biblioteca de voces y despliega sin clonar.
Diseñado para el stack en tiempo real.
Open weights. Licencia comercial de pago.
Nuestros modelos open-source — fish-speech, S1 y S2 — se publican como open weights con licencia comercial de pago. Alójalos en tu VPC, on-prem, nube soberana o entorno air-gapped cuando la producción lo exija. El self-hosting es un contrato de nivel Enterprise — ver más abajo.
15,000+ tags de dirección. Insertados en cualquier llamada.
[warm], [near-whisper], [reassuring] — la dirección viaja con el propio texto. Sin parámetro separado, sin lista de opciones, sin migración de esquema cuando crece el conjunto de tags.
Audio Turing Test: 0.515.
Los oyentes no pueden distinguir de forma fiable S2.1 Pro de una voz humana en evaluación ciega. 581 comparaciones uno a uno. Metodología y audio sin procesar publicados.
$15 por millón de caracteres. Desde tu primera llamada.
El mismo modelo detrás de HeyGen, Pictoria, Dubbing AI y Plaud. Pago por uso desde tu primera llamada. Sin "contáctenos" para tarifas de producción.
Usa nuestra API. O aloja el modelo tú mismo.
API en la nube para cualquier equipo que construye hoy. Self-hosting como contrato Enterprise premium cuando la producción lo exige.
API alojada · Para cualquier equipo
API en la nube, pago por uso, $15 por millón de caracteres. La ruta más rápida a producción para equipos que no necesitan operar el modelo por su cuenta.
- WebSocket streaming, REST, SDK para Python + TypeScript
- $15 / 1M UTF-8 bytes — sin compromiso
- Sintaxis inline de dirección en cada llamada
- El mismo modelo que se publica como open-weight
Aloja el modelo tú mismo.
Nuestros modelos open-source — fish-speech, S1, S2 — se publican como open weights con licencia comercial de pago. Despliégalos en tu VPC, centro de datos, nube soberana o entorno air-gapped. Un contrato premium para equipos de alto volumen que necesitan residencia de datos, fine-tuning o despliegues regulados.
- WebSocket streaming, REST, SDK para Python + TypeScript
- $10k/mes
- Costo mínimo efectivo: $120–150K/año
- Acceso directo a nuestro equipo de investigación
Precios queno penalizan el crecimiento
Pago por uso desde el día uno. Sin cargos por asiento. Sin compromisos anuales. Sin "contáctenos" para tarifas de producción.
Ver precios completosPreguntas frecuentes
¿Vienes de ElevenLabs, Cartesia o Rime?
Comparativas detalladas por capacidad, precio y condiciones contractuales. API de la misma forma; la mayoría de las migraciones a producción se completan en menos de una semana.
Benchmarks, metodología y audio sin procesar
Resultados del Audio Turing Test, metodología de evaluación ciega y la licencia open-weights. Las pruebas que respaldan cada afirmación de esta página.
Llega a producción este fin de semana
Créditos gratis para empezar. Sin tarjeta. El mismo tier del prototipo a la escala.
