Un año.

$52M de seed.

8M+ creadores.

Nuestra historia

API de texto a vozIntegra voz en cualquier app

Voz expresiva y dirigible con una latencia de ~100ms, el mismo modelo S2.1 Pro detrás de HeyGen, Retell y Plaud.

curl https://api.fish.audio/v1/tts \
  -H "Authorization: Bearer YOUR_FISH_AUDIO_API_KEY" \
  -H "Content-Type: application/json" \
  -H "model: s2.1-pro" \
  -d '{
    "text": "[chuckle] Cuando estás construyendo algo nuevo, hay esta [audience laughing] mezcla de asombro y miedo. [whisper] Pero eso es lo que hace que valga la pena construirlo.",
    "reference_id": "933563129e564b19a115bedd57b7406a",
    "format": "mp3"
  }' --output speech.mp3
<100ms
TIEMPO HASTA EL PRIMER AUDIO
Ilimitados
tags de dirección
80+
IDIOMAS
$15/1M UTF-8 bytes
PAGO POR USO

En producción en

Modelos diseñados para distintas necesidades de producción

Una sola API. Cambia de modelo con un único encabezado. Ambos modelos de la API se facturan a la misma tarifa plana.

EL ORIGINAL

S2 Pro

Preciso incluso en los enunciados más cortos

  • Clonación de voz instantánea
  • Soporte multilingüe completo
  • Fiable con prompts muy cortos
  • Misma tarifa plana que S2.1 Pro
Ver documentación
RECOMENDADO

S2.1 Pro

El modelo más expresivo que ofrece Fish.

  • Tiempo hasta el primer audio ~100ms (en un solo H200)
  • Factor de tiempo real de 0.195
  • 80+ idiomas, cambio de código instantáneo
  • Etiquetas de emoción de dominio abierto
  • Multi-hablante nativo en una sola generación
Ver documentación
DESPLIEGUE ENTERPRISE

On-premise

Despliega en tu propia infraestructura.

  • VPC, on-prem, nube soberana, air-gapped
  • Sin salida de datos
  • Control total del modelo
  • Licencia comercial disponible
Hablar con ventas

Del registro al primer audio en 5 minutos.

Sin llamada de ventas. Obtén una clave de API, instala el SDK y despliega.

cURL · REST API
curl https://api.fish.audio/v1/tts \
-H "Authorization: Bearer YOUR_FISH_AUDIO_API_KEY" \
-H "Content-Type: application/json" \
-H "model: s2.1-pro" \
-d '{
"text": "[chuckle] When you are building something new, there is this [emphasis] mix of wonder and fear.",
"reference_id": "YOUR_VOICE_ID",
"format": "mp3"
}' --output speech.mp3
Python · Fish Audio SDK
from fishaudio import FishAudio
from fishaudio.utils import save
client = FishAudio(api_key="YOUR_FISH_AUDIO_API_KEY")
audio = client.tts.convert(
text="Hello from Fish Audio!",
reference_id="YOUR_VOICE_ID",
model="s2.1-pro",
)
save(audio, "output.mp3")

Todo lo que necesitaspara llevar voz a producción

Una sola API para creación de voz, generación expresiva y entrega en tiempo real.

Emoción e interpretación inline

Dirección escrita como sintaxis [tag], en cualquier punto del texto. Tags libres e ilimitados, sin parámetro de emoción independiente.

Aber
Hey there.Add TagsI’m so excited to share this news!Can you hear me?
[Sad]
[Excited]
[satisfied]
[angry]

Millones de voces de la comunidad

Explora y lanza voces desde la biblioteca abierta más grande, o clona la tuya propia y construye sobre ella.

Diálogo multi-hablante

Genera una conversación completa en una sola pasada. Disponible en S2.1 Pro.

Aber
Sarah
Ethan

Clonación de voz instantánea

Captura el timbre y el estilo de habla a partir de un clip de referencia corto. Funciona en los 80+ idiomas sin entrenamiento adicional.

Recorded Voice
My Cloned Voice
EnglishFemaleYoung

Lee texto complejo de forma natural

Números, divisas, fechas y unidades pronunciados correctamente

$9.99
01/24
1,999

Streaming y marcas de tiempo

Transmite audio en streaming con marcas de tiempo por palabra.

Thefutureiscoming
0.02s0.05s0.01s0.04svoice0.01s0.03s

Crea la experiencia de voz que tu producto necesita

Crea una voz reutilizable, dirige cómo se interpreta y transmítela en streaming a productos en tiempo real.

Clona cualquier voz al instante
con Fish Audio

La API de clonación de voz con IA de Fish Audio convierte un clip de referencia corto en una voz reutilizable. La clonación captura el timbre y el estilo de habla, y se mantiene en los 80+ idiomas sin entrenamiento adicional.

PYTHON SDK
# Clone from reference audio
voice = session.create_model(
title="My Voice",
voices=[open("reference.wav", "rb").read()]
)
# Synthesize with the cloned voice
request = TTSRequest(
text="This is my cloned voice.",
reference_id=voice.id
)
with open("clone.mp3", "wb") as f:
for chunk in session.tts(request, backend="s2-pro"):
f.write(chunk)

Fish Audio TTS APIBenchmarks y especificaciones

Una sola API. Cambia de modelo con un único encabezado. Ambos modelos de la API se facturan a la misma tarifa plana.

POST https://api.fish.audio/v1/tts

Benchmarks
0.195

FACTOR DE TIEMPO REAL

Clip corto

CLONACIÓN DE VOZ

Nativo

MULTI-HABLANTE

REST + WebSocket

STREAMING

Por palabra

MARCAS DE TIEMPO

48kHz

FRECUENCIA DE MUESTREO

5inicial

SOLICITUDES CONCURRENTES

MP3 · WAV · Opus

FORMATOS DE AUDIO

Precios flexibles para tus necesidades

Pago por uso con cualquier suscripciónMás información

S2.1 Pro

Texto a voz

$0.015/ K UTF-8 bytes
Comenzar
70ms de latencia ultra baja
80+ idiomas compatibles
Marcas de tiempo por palabra

S2 Pro

Texto a voz

$0.015/ K UTF-8 bytes
Comenzar
Latencia en tiempo real
Soporte multilingüe completo
Clonación de voz instantánea

Transcribe-1

Reconocimiento automático del habla

$0.006/ minuto de audio
Comenzar
Precisión de ASR líder en la industria
Multilingüe con sugerencias de idioma opcionales
Transcripción de entradas largas

Límites de solicitudes concurrentes

 
Umbral de gastoConcurrencia
Inicial
< $100 pagados5 solicitudes
Elevado
≥ $100 pagados15 solicitudes
Alto volumen
≥ $1,000 pagados50 solicitudes
Enterprise
PersonalizadoLímites personalizados

Preguntas frecuentes

Fish Audio

Llega a producción este fin de semana

Obtén una clave de API, instala el SDK y despliega. Sin tarjeta requerida.