Ein Jahr.

$52M Seed.

8M+ Builder.

Unsere Geschichte

Text-to-Speech-APISprache in jede App integrieren

Ausdrucksstarke, steuerbare Sprache mit ~100ms Latenz – dasselbe S2.1 Pro-Modell hinter HeyGen, Retell und Plaud.

curl https://api.fish.audio/v1/tts \
  -H "Authorization: Bearer YOUR_FISH_AUDIO_API_KEY" \
  -H "Content-Type: application/json" \
  -H "model: s2.1-pro" \
  -d '{
    "text": "[chuckle] Wenn du etwas Neues aufbaust, gibt es diese [audience laughing] Mischung aus Staunen und Angst. [whisper] Aber genau das macht es wert, gebaut zu werden.",
    "reference_id": "933563129e564b19a115bedd57b7406a",
    "format": "mp3"
  }' --output speech.mp3
<100ms
ZEIT BIS ZUM ERSTEN AUDIO
Unbegrenzt
Stimmsteuerungs-Tags
80+
SPRACHEN
$15/1M UTF-8 bytes
PAY AS YOU GO

Im produktiven Einsatz bei

Modelle für unterschiedliche Produktionsanforderungen

Eine API. Modelle per einzelnem Header wechseln. Beide API-Modelle werden zum selben Pauschalpreis abgerechnet.

DAS ORIGINAL

S2 Pro

Präzise selbst bei kürzesten Äußerungen

  • Instant Voice Cloning
  • Umfassende mehrsprachige Unterstützung
  • Zuverlässig auch bei sehr kurzen Prompts
  • Derselbe Pauschalpreis wie S2.1 Pro
Docs ansehen
EMPFOHLEN

S2.1 Pro

Das ausdrucksstärkste Modell von Fish.

  • Zeit bis zum ersten Audio ~100ms (auf einem einzelnen H200)
  • Echtzeitfaktor 0.195
  • 80+ Sprachen, sofortiges Code-Switching
  • Open-Domain-Emotions-Tags
  • Native Mehrsprecher-Funktion in einer Generierung
Docs ansehen
ENTERPRISE-BEREITSTELLUNG

On-Premise

Bereitstellung in deiner eigenen Infrastruktur.

  • VPC, On-Prem, Sovereign Cloud, Air-Gapped-Umgebung
  • Kein Datenabfluss
  • Volle Kontrolle über das Modell
  • Kommerzielle Lizenz verfügbar
Vertrieb kontaktieren

Von der Registrierung zum ersten Audio in 5 Minuten.

Kein Sales-Call erforderlich. API-Key holen, SDK installieren und loslegen.

cURL · REST API
curl https://api.fish.audio/v1/tts \
-H "Authorization: Bearer YOUR_FISH_AUDIO_API_KEY" \
-H "Content-Type: application/json" \
-H "model: s2.1-pro" \
-d '{
"text": "[chuckle] When you are building something new, there is this [emphasis] mix of wonder and fear.",
"reference_id": "YOUR_VOICE_ID",
"format": "mp3"
}' --output speech.mp3
Python · Fish Audio SDK
from fishaudio import FishAudio
from fishaudio.utils import save
client = FishAudio(api_key="YOUR_FISH_AUDIO_API_KEY")
audio = client.tts.convert(
text="Hello from Fish Audio!",
reference_id="YOUR_VOICE_ID",
model="s2.1-pro",
)
save(audio, "output.mp3")

Alles, was du brauchst,um produktionsreife Sprache auszuliefern

Eine API für Stimmerstellung, ausdrucksstarke Generierung und Echtzeit-Auslieferung.

Inline-Emotion und Vortragsstil

Stimmsteuerung als [tag]-Syntax, an beliebiger Stelle im Text. Unbegrenzt viele frei wählbare Tags, kein separater Emotionsparameter.

Aber
Hey there.Add TagsI’m so excited to share this news!Can you hear me?
[Sad]
[Excited]
[satisfied]
[angry]

Millionen von Community-Stimmen

Durchstöbere die größte offene Stimmbibliothek und nutze sie direkt – oder klone deine eigene Stimme und baue darauf auf.

Mehrsprecher-Dialog

Erzeuge ein komplettes Gespräch in einem Durchgang. Verfügbar für S2.1 Pro.

Aber
Sarah
Ethan

Instant Voice Cloning

Erfasst Klangfarbe und Sprechstil aus einem kurzen Referenzclip. Funktioniert in allen 80+ Sprachen – ganz ohne zusätzliches Training.

Recorded Voice
My Cloned Voice
EnglishFemaleYoung

Komplexe Texte natürlich vorlesen

Zahlen, Währungen, Daten und Einheiten korrekt ausgesprochen

$9.99
01/24
1,999

Streaming und Zeitstempel

Audio streamen mit wortgenauen Zeitstempeln.

Thefutureiscoming
0.02s0.05s0.01s0.04svoice0.01s0.03s

Baue das Sprach-Erlebnis, das dein Produkt braucht

Erstelle eine wiederverwendbare Stimme, steuere ihre Performance und streame sie in Echtzeitprodukte.

Klone jede Stimme sofort
mit Fish Audio

Die KI-Voice-Cloning-API von Fish Audio verwandelt einen kurzen Referenzclip in eine wiederverwendbare Stimme. Der Klon erfasst Klangfarbe und Sprechstil und funktioniert in allen 80+ Sprachen – ganz ohne zusätzliches Training.

PYTHON SDK
# Clone from reference audio
voice = session.create_model(
title="My Voice",
voices=[open("reference.wav", "rb").read()]
)
# Synthesize with the cloned voice
request = TTSRequest(
text="This is my cloned voice.",
reference_id=voice.id
)
with open("clone.mp3", "wb") as f:
for chunk in session.tts(request, backend="s2-pro"):
f.write(chunk)

Fish Audio TTS APIBenchmarks und Specs

Eine API. Modelle per einzelnem Header wechseln. Beide API-Modelle werden zum selben Pauschalpreis abgerechnet.

POST https://api.fish.audio/v1/tts

Benchmarks
0.195

ECHTZEITFAKTOR

Kurzer Clip

VOICE CLONING

Nativ

MEHRSPRECHER

REST + WebSocket

STREAMING

Wortgenau

ZEITSTEMPEL

48kHz

SAMPLERATE

5zu Beginn

GLEICHZEITIGE ANFRAGEN

MP3 · WAV · Opus

AUDIOFORMATE

Flexible Preise für deinen Bedarf

Pay-as-you-go bei jedem AboMehr erfahren

S2.1 Pro

Text-to-Speech

$0.015/ K UTF-8 bytes
Loslegen
70ms ultraniedrige Latenz
80+ unterstützte Sprachen
Wortgenaue Zeitstempel

S2 Pro

Text-to-Speech

$0.015/ K UTF-8 bytes
Loslegen
Echtzeit-Latenz
Umfassende mehrsprachige Unterstützung
Instant Voice Cloning

Transcribe-1

Automatische Spracherkennung

$0.006/ Audiominute
Loslegen
Branchenführende ASR-Genauigkeit
Mehrsprachig mit optionalen Sprachhinweisen
Transkription langer Eingaben

Limits für gleichzeitige Anfragen

 
AusgabenschwelleGleichzeitigkeit
Starter
< $100 bezahlt5 Anfragen
Erweitert
≥ $100 bezahlt15 Anfragen
Hohes Volumen
≥ $1,000 bezahlt50 Anfragen
Enterprise
IndividuellIndividuelle Limits

Häufig gestellte Fragen

Fish Audio

Dieses Wochenende in Produktion gehen

API-Key holen, SDK installieren und loslegen. Keine Kreditkarte erforderlich.