Fish Audio S2.1 Pro: API de Texto a Voz gratuita para desarrolladores
Resumen rápido:
S2.1 Pro, el modelo de voz más avanzado de Fish Audio, ya está disponible como una API de texto a voz gratuita.
83 idiomas, uso ilimitado bajo la Política de Uso Justo (Fair Use).
Cadena del modelo: s2.1-pro-free — simplemente añádela a tus llamadas de API de Fish existentes.
Prueba S2.1 Pro gratis — primer audio en 5 minutos →
Junio de 2026 | El modelo S2.1 Pro de Fish Audio ya está disponible como una API de texto a voz gratuita con acceso ilimitado bajo la Política de Uso Justo.
Por qué la IA de voz de alta calidad siempre ha sido cara
Si has pasado algún tiempo evaluando APIs de texto a voz, ya conoces el patrón: los modelos que realmente suenan bien cuestan dinero.
El nivel gratuito de ElevenLabs te ofrece 10,000 créditos al mes (aproximadamente de 6 a 10 minutos) antes de que aparezca el muro de pago. OpenAI TTS es de pago por uso sin ningún nivel gratuito. Los últimos modelos Gemini TTS de Google —sus más avanzados— no tienen uso gratuito: pagas desde el primer token. El patrón es consistente en toda la industria: la calidad de voz de última generación ha sido una función de pago.
Esto crea un problema real para los desarrolladores. El mercado de generadores de voz por IA crece a casi un 20% anual, pero las herramientas para crear productos con voz han permanecido tras un muro de pago. No puedes evaluar adecuadamente un modelo con 10,000 créditos. No puedes prototipar un agente de voz, probar un flujo de trabajo para audiolibros o experimentar con la clonación de voz (voice cloning) sin comprometer presupuesto por adelantado o pasar semanas luchando con alternativas de código abierto que requieren tu propia infraestructura de GPU.
Fish Audio está cambiando eso hoy.
¿Qué es S2.1 Pro?
S2.1 Pro es el modelo de voz de última generación actual de Fish Audio, el mejor modelo que tenemos, ahora disponible para todos los desarrolladores de forma gratuita a través de la API. Es un modelo de síntesis de voz neuronal diseñado para la generación de voz por IA de nivel de producción, con fortalezas particulares en el streaming de baja latencia, TTS multilingüe y clonación de voz. Se basa en los cimientos de S2, que lanzamos con pesos abiertos a principios de este año.
Rendimiento
- Tasa de victoria del 61% frente a la generación anterior S2 Pro en evaluaciones de escucha comparativas; consulta nuestra comparativa ciega de proveedores de TTS para más contexto.
- ~70ms de Tiempo hasta el primer audio (TTFA) en una sola solicitud, frente a los ~100ms de la generación anterior.
- Mejora de más del doble en el rendimiento (throughput) bajo carga de alta concurrencia.
Para conocer todos los detalles técnicos, consulta nuestro artículo: Aquí
Cobertura de idiomas
S2.1 Pro admite 83 idiomas, incluidos inglés, japonés, chino, coreano, español, árabe, francés, alemán, portugués, ruso y docenas más. El mismo modelo maneja todos los idiomas: sin puntos finales separados, sin precios por idioma.
Latencia
S2.1-Pro ofrece un TTFA (Tiempo hasta el primer audio) de ~90ms en la API estándar, lo que lo hace viable para agentes de voz en vivo y sistemas de diálogo por turnos. Si necesitas un control detallado sobre la prosodia y la entrega, consulta también las capacidades de control de voz a nivel de palabra de S2.
Por qué Fish Audio puede ofrecer esto gratis ahora
La versión corta: reconstruimos la pila de inferencia desde cero, y el coste por solicitud bajó lo suficiente como para que podamos absorberlo.
Kernels de GPU personalizados
Desarrollamos fish-scales-ops, una librería de FP8 GEMM y FlashAttention de grado de producción optimizada para las arquitecturas NVIDIA Hopper (H100/H200) y Blackwell (RTX 6000 PRO). En las formas de decodificación que importan para el servicio de IA de voz, nuestra ruta MXFP8 supera a la referencia cuBLAS fusionada con torch.compile entre 2.1 y 4.3 veces. No necesitas entender nada de esto para usar la API, pero es la razón por la que el nivel gratuito es sostenible.
Mayor rendimiento (Throughput)
En una sola H200 con cuantificación FP8, el sistema mantiene un rendimiento de salida de más de 8,000 tokens/segundo con 64 solicitudes concurrentes. Un mayor rendimiento por GPU significa más solicitudes servidas por dólar, que es lo que hace que el acceso gratuito ilimitado sea económicamente viable.
Lo que "gratis" significa realmente
Preferimos ser honestos sobre las limitaciones que ocultarlas.
Lo que obtienes:
- Cadena del modelo:
s2.1-pro-free - Acceso de alto volumen sin límite estricto de caracteres (sujeto a la Política de Uso Justo)
- El mismo punto final de API que los planes de pago, sin integración separada.
Limitaciones actuales:
- Duración:
El acceso gratuito está disponible hasta el 24 de julio de 2026. El acceso gratuito está disponible hasta finales de julio de 2026. El acceso gratuito está disponible hasta el 31 de agosto de 2026.El acceso gratuito está disponible hasta el 30 de noviembre de 2026; comunicaremos cualquier cambio con aviso previo.- Actualización (Junio de 2026): Extendemos el periodo gratuito para cubrir todo el mes de julio. Queremos que los desarrolladores tengan un mes completo e ininterrumpido para construir, evaluar y lanzar, sin tener que contar los días para una fecha límite.
- Actualización (Julio de 2026): Extendemos el acceso gratuito una vez más, hasta el 31 de agosto de 2026. Ver lo que nuestros desarrolladores han estado construyendo con S2.1 Pro ha sido realmente gratificante, y queremos dar a ese impulso aún más espacio para crecer.
- Sin SLA: Sin garantías de tiempo de actividad o TTFA; diseñado para experimentación y prototipado.
- Sin garantía de latencia: Basado en el mejor esfuerzo, no contractual.
- Retención de datos: Las solicitudes pueden utilizarse para mejorar la calidad del modelo; consulta nuestra Política de Privacidad.
- Uso comercial: Algunos escenarios comerciales pueden tener restricciones. Los productos que generen más de $1M ARR deben contactarnos antes de usar S2.1 Pro Free. Consulta Precios y límites de tasa para más detalles.
Si necesitas un SLA de producción y garantías de latencia, hay planes de pago disponibles. Este nivel es el lugar adecuado para construir, evaluar y decidir.
Cómo usar la API de Texto a Voz gratuita: Guía rápida de S2.1 Pro
Obtén tu clave de API en fish.audio/app/api-keys, luego realiza tu primera llamada. La API de Fish acepta solicitudes codificadas en msgpack y devuelve audio en el formato elegido. Referencia completa en la documentación de la API.
JavaScript
import { writeFile } from "fs/promises";
const body = {
text: "¡Hola, mundo!",
reference_id: "tu_id_de_modelo",
format: "mp3",
};
const res = await fetch("https://api.fish.audio/v1/tts", {
method: "POST",
headers: {
Authorization: "Bearer <TU_CLAVE_DE_API>",
"Content-Type": "application/json",
model: "s2.1-pro-free",
},
body: JSON.stringify(body),
});
if (!res.ok) {
throw new Error(`Error en la solicitud TTS: ${res.status} ${await res.text()}`);
}
const buffer = Buffer.from(await res.arrayBuffer());
await writeFile("output.mp3", buffer);
Python
import httpx
body = {
"text": "¡Hola, mundo!",
"reference_id": "tu_id_de_modelo",
"format": "mp3",
}
with httpx.Client() as client:
res = client.post(
"https://api.fish.audio/v1/tts",
headers={
"Authorization": "Bearer <TU_CLAVE_DE_API>",
"Content-Type": "application/json",
"model": "s2.1-pro-free",
},
json=body,
)
res.raise_for_status()
with open("output.mp3", "wb") as f:
f.write(res.content)
El único cambio respecto a cualquier otra llamada a la API de Fish Audio: establece model: "s2.1-pro-free" en los encabezados. Eso es todo.
Obtén tu clave de API gratuita →
S2.1 Pro frente a ElevenLabs y las mejores API de TTS en 2026
La información de los competidores a continuación se basa en la documentación pública y las páginas de precios a fecha de junio de 2026. Los precios y funciones pueden cambiar; verifícalo directamente con cada proveedor antes de tomar una decisión de producción.
Para un análisis independiente más profundo, consulta nuestra comparativa ciega de proveedores de TTS.
Conclusión: Entre los principales proveedores de APIs de TTS que evaluamos, Fish Audio ofrece actualmente uno de los modelos de acceso gratuito más generosos: el único donde el nivel gratuito ejecuta el mismo modelo de última generación que el nivel de pago, sin límite estricto de uso. El nivel gratuito de ElevenLabs es efectivamente una prueba de 10,000 créditos. El TTS más avanzado de Google (Gemini TTS) no tiene nivel gratuito en absoluto.
¿Buscas una alternativa gratuita a ElevenLabs que no comprometa la calidad del modelo? S2.1 Pro está disponible ahora sin límite de uso.
¿Buscas una alternativa gratuita a OpenAI TTS? La oferta de TTS de OpenAI no tiene nivel gratuito — S2.1 Pro es una opción convincente para evaluar primero.
Ver documentación completa de la API y empezar a construir →
Qué puedes construir con ello
El nivel gratuito no tiene restricciones intencionadas en cuanto a casos de uso. Aquí están los escenarios donde la combinación de generación de voz por IA de baja latencia, soporte multilingüe y clonación de voz de S2.1 Pro tiende a marcar la mayor diferencia.
Agentes de voz
La IA conversacional en tiempo real depende totalmente de la latencia. Con un TTFA de ~90ms para llamadas estándar, S2.1 Pro es lo suficientemente rápido para diálogos naturales por turnos. Combínalo con una capa de voz a texto y un LLM para una tubería de voz completa sin factura por caracteres. También puedes integrar S2.1 Pro en flujos de trabajo de agentes a través de nuestro soporte para MCP y habilidades de agente.
Audiolibros y narración de formato largo
El soporte para 83 idiomas y la prosodia natural hacen que S2.1 Pro sea ideal para la producción de audiolibros y la síntesis de voz de formato largo. El uso ilimitado significa que puedes procesar manuscritos completos sin vigilar un contador de caracteres o comprar créditos por adelantado.
Clonación de voz (Voice Cloning)
S2.1 Pro admite clonación de voz a partir de audio de referencia a través de la API: pasa una muestra de audio de referencia y el modelo sintetizará el habla con esa voz. Crea aplicaciones de voz personalizadas, localiza contenido con una identidad de hablante consistente o genera voces de personajes para juegos y animación. La clonación de voz está disponible en el nivel gratuito, sujeta a la misma Política de Uso Justo.
Aplicaciones multilingües
Si tu aplicación atiende a usuarios en varios idiomas, la cobertura de 83 idiomas con una única API de voz de IA consistente es una simplificación significativa frente a alternativas que requieren puntos finales de modelo separados por idioma o cobran tarifas premium por la síntesis de voz que no es en inglés.
Diálogos de NPC para juegos
Los flujos de trabajo de audio para juegos se benefician de un alto rendimiento y un coste predecible por solicitud. El uso gratuito ilimitado hace que sea práctico generar grandes librerías de diálogos e iterar libremente durante el desarrollo antes de comprometerse con un presupuesto de producción.
Disponible a través de nuestro ecosistema de socios
S2.1 Pro también está disponible a través de un número creciente de plataformas asociadas, incluyendo Runware, Retell, Sierra, y otros.
Si ya estás construyendo en una de estas plataformas, S2.1 Pro es accesible sin integración o configuración adicional; simplemente usa lo que ya tienes.
Estamos expandiendo activamente la red de socios. Si eres un proveedor de plataforma o infraestructura interesado en integrar S2.1 Pro, ponte en contacto con nuestro equipo para explorar las posibilidades.
Uso justo y qué viene después
El nivel gratuito funciona bajo una Política de Uso Justo (Fair Use). Nos reservamos el derecho de regular o limitar el acceso para patrones de uso que parezcan abuso en lugar de desarrollo; el objetivo es proteger el acceso para toda la comunidad de desarrolladores, no crear límites arbitrarios para casos de uso legítimos. Consulta Precios y límites de tasa para más detalles.
Algunas cosas que puedes esperar:
- El acceso gratuito está disponible ahora por un período inicial. Daremos aviso previo antes de cualquier cambio.
- Planes de pago con garantías de SLA, compromisos de latencia y licencias comerciales están disponibles para cargas de trabajo de producción.
- La inversión en infraestructura es continua: el trabajo de ingeniería que hizo posible este nivel gratuito no es un evento único.
- Infraestructura de código abierto: planeamos liberar como código abierto los componentes de infraestructura detrás de S2.1 Pro, la misma pila que hace que el nivel gratuito sea sostenible.
Si estás evaluando Fish Audio para un despliegue de producción, el nivel gratuito es el lugar adecuado para empezar. Construye algo real, mide lo que importa para tu aplicación y contáctanos cuando estés listo para discutir los requisitos de producción.
Sin tarjeta de crédito. Sin lista de espera. Sin límites para lo que puedes probar.
