Un año.

$52M de seed.

8M+ creadores.

Nuestra historia
27 jul 2026Empresa

5 modelos, 22 personas, 1 año

5 modelos, 22 personas, 1 año

Fish Audio recaudó 52 millones de dólares en financiación semilla. Cómo un proyecto personal en una sola 4090 se convirtió en esto, y qué estamos construyendo a continuación. Lee nuestra historia.

Hoy marcamos otro hito increíble para Fish Audio. Anunciamos 52 millones de dólares en financiación semilla en nuestro primer aniversario. Gracias a Coreline Ventures y Capital Today, quienes lideraron la ronda, con la participación de 359 Capital, Play Time, HF0, 645 Ventures, Parable, Carya Venture Partners, Alphalist Partners y los ángeles inversores que apostaron por nosotros cuando no había mucho que ver.

La tecnología de texto a voz (TTS) ha sido lo suficientemente buena durante aproximadamente una década, siempre y cuando solo necesites una frase. Las grietas aparecen al llegar a la décima. Toda la categoría falla en el mismo lugar, por la misma razón: lograr que las palabras sean correctas y lograr que la interpretación sea correcta son problemas diferentes, y casi todo el mundo solo ha trabajado en el primero.

Años en la IA de voz en Amazon Alexa y Meta me enseñaron dónde termina el TTS tradicional: una voz construida para leer nunca aprende a interpretar. Así que empezamos desde el otro extremo. Fish Audio no es un asistente de voz mejor. Es la capa de voz para todo lo que viene después.

Dos fundadores de la empresa sentados uno al lado del otro en sillones de madera, frente a la cámara, con un ventanal de suelo a techo y árboles al aire libre al fondo.

La 4090

Shijia Liao, nuestro científico jefe, llegó a la misma conclusión desde una dirección diferente. Como ingeniero de investigación en NVIDIA trabajando en video, pasaba su tiempo libre viendo transmisiones de VTubers y no podía ignorar lo inertes que sonaban las voces. Comenzó a entrenar modelos en una sola 4090 en su habitación, haciendo una apuesta temprana por una arquitectura autorregresiva dual que el resto de la industria tardaría otros dos años en alcanzar. Ese trabajo se convirtió en la base de S2.

Lo que hicimos en 1 año

  • Lanzamos cinco modelos de audio de vanguardia. Cuatro de texto a voz, uno de voz a texto.
  • Ampliamos el equipo de 3 a 22 personas, y seguimos contratando.
  • De cero a 21 millones de dólares en ingresos recurrentes anuales.
  • Más de 8 millones de creadores, desarrolladores y empresas en la plataforma.
  • Más de 2 millones de modelos de voz en la biblioteca de la comunidad.
  • S2.1 Pro, preferido por el 66% de los oyentes sobre los competidores líderes en pruebas de escucha a ciegas.
  • Más de 83 idiomas con cadencia nativa y control de emociones a nivel de palabra a través de más de 15.000 controles de lenguaje natural.

La comunidad construyó el modelo

Realizamos el post-entrenamiento basándonos en las preferencias reales de los usuarios, lo que significa que el modelo mejora a medida que la gente lo usa más. Por eso destacamos en inglés con acento, mandarín, japonés, coreano y español, donde los modelos entrenados principalmente en inglés estadounidense estándar fallan. Esta capacidad surgió de personas que utilizaron la herramienta en idiomas, acentos y casos extremos que nunca habríamos pensado probar.

Fish Speech pasó de ser un repositorio a una empresa gracias a desarrolladores de juegos, fans del anime y personas que doblan personajes por diversión. Desde el principio, hemos creído en la transparencia y la apertura, y en hacer que la IA de voz expresiva y de alta calidad sea accesible para todos.

Y ocho millones de ustedes confiaron en nosotros para lograrlo.

El modelo en el que ahora confían las empresas

Esa confianza es la razón por la que las empresas también están recurriendo a Fish Audio. Junto con los desarrolladores, el sector empresarial representa ahora dos tercios de nuestros ingresos.

Les ofrecemos tiempo de actividad, latencia y una postura de seguridad que supera cualquier proceso de adquisición: despliegue en las instalaciones (on-premises), políticas de retención de datos cero y configuraciones compatibles con HIPAA, integradas desde el principio. S2.1 Pro ya gana pruebas de escucha a ciegas frente a los modelos líderes, funciona a más de 8.000 tokens por segundo en una sola H200 y se mantiene firme en idiomas donde los modelos ajustados para un solo dialecto fallan silenciosamente.

Los clientes empresariales acuden a nosotros porque lograr la interpretación correcta, no solo las palabras, es exactamente el problema que nos propusimos resolver. Es la misma misión en la que ahora podemos profundizar.

¿Qué sigue?

El texto a voz nunca fue el objetivo final. Fue la parte que pudimos construir primero con una sola GPU y demostrar la teoría: la interpretación importa tanto como las palabras, y nadie lo estaba resolviendo.

Ahora vamos a por el resto de la infraestructura. Modelo de Lenguaje de Comprensión de Audio (Audio LM) y voz a voz. También estamos redoblando nuestra apuesta por las herramientas para desarrolladores y la API, expandiendo nuestro equipo empresarial y profundizando en alianzas con socios como LiveKit y Retell para llevar la voz expresiva a más lugares, más rápido.

Gratis hasta agosto

Para celebrar este gran hito, S2.1 Pro es gratuito para todos los desarrolladores a través de la API hasta finales de agosto. Este es el mismo modelo por el que pagan nuestros clientes empresariales. También ofrecemos un 50% de descuento en los planes para creadores y 3 meses gratis si migras desde otro proveedor.

La razón por la que podemos hacer esto es técnica, y el crédito es de nuestro equipo de investigación. Reconstruyeron toda nuestra pila de inferencia este año: kernels FP8 personalizados, más de 8.000 tokens por segundo en una sola H200. Eso redujo nuestro costo por solicitud lo suficiente como para que ofrecer el modelo de forma gratuita se convirtiera en una estrategia exitosa.

Gracias

Hace un año, Fish Audio era un proyecto personal que comenzó en nuestra sala de estar. Todos los que entrenaron una voz, doblaron un personaje, construyeron sobre la API o apostaron por nosotros cuando no había mucho por lo que apostar: esto es tanto suyo como nuestro.

Cometimos muchos errores en el camino. Ahora vamos a tener los recursos para acertar en muchas más cosas.

Por el segundo año.

Rissa Cao

Rissa CaoX

Rissa is the CEO and co-founder of Fish Audio, pushing breakthroughs in AI voice technology. Find her latest work at @rissa_cao.

Leer más de Rissa Cao

Crea voces que se sienten reales

Comienza a generar audio de la más alta calidad hoy mismo.

¿Ya tienes una cuenta? Iniciar sesión