Fish Audio S2.1 Pro: Kostenlose Text-to-Speech API für Entwickler
Kurzzusammenfassung:
S2.1 Pro, das fortschrittlichste Sprachmodell von Fish Audio, ist jetzt als kostenlose Text-to-Speech API verfügbar
83 Sprachen, unbegrenzte Nutzung unter der Fair Use Policy
Modell-String: s2.1-pro-free — fügen Sie ihn einfach in Ihre bestehenden Fish API-Aufrufe ein
S2.1 Pro kostenlos testen — erstes Audio in 5 Minuten →
Juni 2026 | Das S2.1 Pro Modell von Fish Audio ist jetzt als kostenlose Text-to-Speech API mit unbegrenztem Zugriff unter Fair Use verfügbar.
Warum hochwertige Sprach-KI bisher immer teuer war
Wenn Sie bereits Text-to-Speech APIs evaluiert haben, kennen Sie das Muster: Die Modelle, die wirklich gut klingen, kosten Geld.
Das Gratis-Kontingent von ElevenLabs bietet 10.000 Credits pro Monat (ca. 6 - 10 Minuten), bevor die Paywall greift. OpenAI TTS ist rein nutzungsbasiert ohne kostenlose Stufe. Die neuesten Gemini TTS-Modelle von Google — ihre fortschrittlichsten — bieten keinerlei kostenlose Nutzung: Sie zahlen ab dem ersten Token. Dieses Muster zieht sich durch die gesamte Branche: Spitzenqualität bei der Sprachgenerierung war bisher ein kostenpflichtiges Feature.
Dies stellt Entwickler vor ein echtes Problem. Der Markt für KI-Sprachgeneratoren wächst jährlich um fast 20 % — aber die Werkzeuge zum Erstellen sprachgesteuerter Produkte blieben hinter Paywalls verborgen. Man kann ein Modell nicht angemessen mit 10.000 Credits evaluieren. Man kann keinen Voice Agent prototypisieren, keine Hörbuch-Pipeline testen oder mit Voice Cloning experimentieren, ohne entweder vorab Budget festzulegen oder Wochen damit zu verbringen, sich mit Open-Source-Alternativen herumzuschlagen, die eine eigene GPU-Infrastruktur erfordern.
Fish Audio ändert das heute.
Was ist S2.1 Pro?
S2.1 Pro ist das aktuelle State-of-the-Art-Sprachmodell von Fish Audio — unser bestes Modell, das jetzt jedem Entwickler kostenlos über die API zur Verfügung steht. Es ist ein neuronales Sprachsynthesemodell, das für die KI-Sprachgenerierung auf Produktionsniveau entwickelt wurde, mit besonderen Stärken in Streaming mit niedriger Latenz, mehrsprachigem TTS und Voice Cloning. Es baut auf dem Fundament von S2 auf, das wir Anfang des Jahres mit offenen Gewichten veröffentlicht haben.
Performance
- 61 % Gewinnrate gegenüber der vorherigen Generation S2 Pro in Head-to-Head-Hörvergleichen — siehe unseren Blindvergleich der TTS-Anbieter für mehr Kontext
- ~70 ms Time-to-First-Audio (TTFA) bei einer einzelnen Anfrage — weniger als die ~100 ms der vorherigen Generation
- Über 2-fache Durchsatzverbesserung bei hoher Auslastung
Den vollständigen technischen Hintergrund finden Sie in unserem Paper: Hier
Sprachabdeckung
S2.1 Pro unterstützt 83 Sprachen, darunter Englisch, Japanisch, Chinesisch, Koreanisch, Spanisch, Arabisch, Französisch, Deutsch, Portugiesisch, Russisch und Dutzende weitere. Dasselbe Modell verarbeitet alle Sprachen — keine separaten Endpunkte, keine Preise pro Sprache.
Latenz
S2.1-Pro liefert eine TTFA (Time to First Audio) von ca. 90 ms über die Standard-API, was es für Live-Voice-Agents und Dialogsysteme tauglich macht. Wenn Sie eine feingranulare Kontrolle über Prosodie und Vortragsweise benötigen, sehen Sie sich auch S2s Möglichkeiten zur Sprachsteuerung auf Wortebene an.
Warum Fish Audio dies jetzt kostenlos anbieten kann
Die Kurzfassung: Wir haben den Inferenz-Stack von Grund auf neu aufgebaut, und die Kosten pro Anfrage sind so stark gesunken, dass wir sie übernehmen können.
Eigene GPU-Kernel
Wir haben fish-scales-ops entwickelt, eine FP8-GEMM- und FlashAttention-Bibliothek für den Produktiveinsatz, die auf die Architekturen NVIDIA Hopper (H100/H200) und Blackwell (RTX 6000 PRO) ausgerichtet ist. Bei den für das Voice-AI-Serving entscheidenden Decode-Shapes übertrifft unser MXFP8-Pfad die torch.compile-fused cuBLAS-Referenz um das 2,1- bis 4,3-fache. Sie müssen nichts davon verstehen, um die API zu nutzen — aber es ist der Grund, warum die kostenlose Stufe nachhaltig ist.
Höherer Durchsatz
Auf einer einzelnen H200 mit FP8-Quantisierung hält das System einen Output-Durchsatz von über 8.000 Token/Sekunde bei 64 gleichzeitigen Anfragen aufrecht. Mehr Durchsatz pro GPU bedeutet mehr bediente Anfragen pro Dollar, was den unbegrenzten kostenlosen Zugang wirtschaftlich tragbar macht.
Was „kostenlos“ wirklich bedeutet
Wir sind lieber ehrlich in Bezug auf die Einschränkungen, als sie zu verstecken.
Was Sie erhalten:
- Modell-String:
s2.1-pro-free - Hochvolumiger Zugriff ohne feste Zeichenbegrenzung (unterliegt der Fair Use Policy)
- Gleicher API-Endpunkt wie bei kostenpflichtigen Tarifen — keine separate Integration
Aktuelle Einschränkungen:
- Dauer:
Kostenloser Zugang ist bis zum 24. Juli 2026 verfügbar Kostenloser Zugang ist bis Ende Juli 2026 verfügbarKostenloser Zugang ist bis zum 31. August 2026 verfügbar — wir werden alle Änderungen rechtzeitig bekannt geben.- Update (Juni 2026): Wir verlängern das kostenlose Fenster auf den gesamten Juli. Wir möchten, dass Entwickler einen vollen, ununterbrochenen Monat Zeit haben, um zu bauen, zu evaluieren und zu veröffentlichen — ohne einen Countdown im Nacken.
- Update (Juli 2026): Wir verlängern den kostenlosen Zugang noch einmal bis zum 31. August 2026. Zu sehen, was unsere Fish-Entwickler mit S2.1 Pro gebaut haben, war wirklich herzerwärmend, und wir möchten diesem Schwung noch mehr Raum zur Entfaltung geben.
- Kein SLA: Keine Garantien für Uptime oder TTFA; entwickelt für Experimente und Prototyping
- Keine Latenzgarantie: Best-Effort-Prinzip, nicht vertraglich zugesichert
- Datenspeicherung: Anfragen können verwendet werden, um die Modellqualität zu verbessern — siehe unsere Datenschutzerklärung
- Kommerzielle Nutzung: Bestimmte kommerzielle Szenarien können Einschränkungen unterliegen. Produkte, die mehr als 1 Mio. $ ARR generieren, sollten uns kontaktieren, bevor sie S2.1 Pro Free nutzen. Details finden Sie unter Preise & Rate Limits
Wenn Sie Produktions-SLA und Latenzgarantien benötigen, sind kostenpflichtige Pläne verfügbar. Diese Stufe ist der richtige Ort, um aufzubauen, zu evaluieren und zu entscheiden.
So nutzen Sie die kostenlose Text-to-Speech API: S2.1 Pro Schnellstart
Holen Sie sich Ihren API-Key unter fish.audio/app/api-keys und tätigen Sie Ihren ersten Aufruf. Die Fish API akzeptiert msgpack-kodierte Anfragen und gibt Audio im gewählten Format zurück. Vollständige Referenz in der API-Dokumentation.
JavaScript
import { writeFile } from "fs/promises";
const body = {
text: "Hallo, Welt!",
reference_id: "ihre_modell_id",
format: "mp3",
};
const res = await fetch("https://api.fish.audio/v1/tts", {
method: "POST",
headers: {
Authorization: "Bearer <IHR_API_KEY>",
"Content-Type": "application/json",
model: "s2.1-pro-free",
},
body: JSON.stringify(body),
});
if (!res.ok) {
throw new Error(`TTS-Anfrage fehlgeschlagen: ${res.status} ${await res.text()}`);
}
const buffer = Buffer.from(await res.arrayBuffer());
await writeFile("output.mp3", buffer);
Python
import httpx
body = {
"text": "Hallo, Welt!",
"reference_id": "ihre_modell_id",
"format": "mp3",
}
with httpx.Client() as client:
res = client.post(
"https://api.fish.audio/v1/tts",
headers={
"Authorization": "Bearer <IHR_API_KEY>",
"Content-Type": "application/json",
"model": "s2.1-pro-free",
},
json=body,
)
res.raise_for_status()
with open("output.mp3", "wb") as f:
f.write(res.content)
Die einzige Änderung gegenüber jedem anderen Fish Audio API-Aufruf: Setzen Sie model: "s2.1-pro-free" in den Headern. Das ist alles.
Holen Sie sich Ihren kostenlosen API-Key →
S2.1 Pro vs. ElevenLabs und die besten TTS-APIs im Jahr 2026
Die untenstehenden Informationen zu Wettbewerbern basieren auf öffentlich zugänglichen Dokumentationen und Preislisten Stand Juni 2026. Preise und Funktionen können sich ändern — prüfen Sie diese direkt beim jeweiligen Anbieter, bevor Sie eine Entscheidung für den Produktiveinsatz treffen.
Für eine tiefergehende unabhängige Analyse siehe unseren Blindvergleich der TTS-Anbieter.
Fazit: Unter den großen TTS-API-Anbietern, die wir evaluiert haben, bietet Fish Audio derzeit eines der großzügigsten kostenlosen Zugangsmodelle an — das einzige, bei dem die kostenlose Stufe dasselbe State-of-the-Art-Modell nutzt wie die kostenpflichtige Stufe, ohne feste Nutzungsobergrenze. Das Gratis-Kontingent von ElevenLabs ist faktisch eine Testversion mit 10.000 Credits. Das fortschrittlichste TTS von Google (Gemini TTS) bietet überhaupt keine kostenlose Stufe an.
Suchen Sie nach einer kostenlosen ElevenLabs-Alternative ohne Kompromisse bei der Modellqualität? S2.1 Pro ist ab sofort ohne Nutzungsobergrenze verfügbar.
Suchen Sie nach einer kostenlosen OpenAI TTS-Alternative? Das TTS-Angebot von OpenAI bietet keine kostenlose Stufe — S2.1 Pro ist eine überzeugende Option für die erste Evaluierung.
Vollständige API-Dokumentation ansehen und mit dem Bauen beginnen →
Was Sie damit bauen können
Die kostenlose Stufe ist bewusst nicht auf bestimmte Anwendungsfälle beschränkt. Hier sind Szenarien, in denen die Kombination aus KI-Sprachgenerierung mit niedriger Latenz, Mehrsprachigkeit und Voice Cloning von S2.1 Pro den größten Unterschied macht.
Voice Agents
Echtzeit-KI für Konversationen steht und fällt mit der Latenz. Mit ca. 90 ms TTFA für Standardaufrufe ist S2.1 Pro schnell genug für natürlichen Dialog. Kombinieren Sie es mit einer Speech-to-Text-Ebene und einem LLM für eine vollständige Voice-Pipeline ohne Abrechnung pro Zeichen. Sie können S2.1 Pro auch über unseren Support für MCP und Agent-Skills in Agent-Workflows integrieren.
Hörbücher und lange Texte
Die Unterstützung von 83 Sprachen und die natürliche Prosodie machen S2.1 Pro ideal für die Produktion von Hörbüchern und die Synthese langer Texte. Unbegrenzte Nutzung bedeutet, dass Sie vollständige Manuskripte verarbeiten können, ohne auf einen Zeichenzähler zu achten oder Credits vorab kaufen zu müssen.
Voice Cloning
S2.1 Pro unterstützt Voice Cloning aus Referenz-Audio via API — übergeben Sie ein Referenz-Audio-Sample und das Modell synthetisiert Sprache in dieser Stimme. Erstellen Sie personalisierte Sprachanwendungen, lokalisieren Sie Inhalte mit konsistenter Sprecheridentität oder generieren Sie Charakterstimmen für Spiele und Animationen. Voice Cloning ist in der kostenlosen Stufe verfügbar, unter Vorbehalt derselben Fair Use Policy.
Mehrsprachige Anwendungen
Wenn Ihre Anwendung Nutzer in mehreren Sprachen bedient, ist eine Abdeckung von 83 Sprachen mit einer einzigen konsistenten KI-Sprach-API eine erhebliche Vereinfachung gegenüber Alternativen, die separate Modell-Endpunkte pro Sprache erfordern oder Premium-Preise für nicht-englische Sprachsynthese verlangen.
NPC-Dialoge in Spielen
Audio-Pipelines in Spielen profitieren von hohem Durchsatz und vorhersagbaren Kosten pro Anfrage. Die unbegrenzte kostenlose Nutzung macht es praktikabel, große Dialogbibliotheken zu erstellen und während der Entwicklung frei zu iterieren, bevor man sich auf ein Budget für den Produktivbetrieb festlegt.
Verfügbar über unser Partner-Ökosystem
S2.1 Pro ist auch über eine wachsende Zahl von Partnerplattformen verfügbar, darunter Runware, Retell, Sierra und andere.
Wenn Sie bereits auf einer dieser Plattformen aufbauen, ist S2.1 Pro ohne zusätzliche Integration oder Einrichtung zugänglich — nutzen Sie einfach das, was Sie bereits haben.
Wir erweitern unser Partnernetzwerk aktiv. Wenn Sie ein Plattform- oder Infrastrukturanbieter sind und an der Integration von S2.1 Pro interessiert sind, kontaktieren Sie unser Team, um die Möglichkeiten auszuloten.
Fair Use & Ausblick
Die kostenlose Stufe unterliegt einer Fair Use Policy. Wir behalten uns das Recht vor, den Zugriff bei Nutzungsmustern zu drosseln oder zu begrenzen, die eher nach Missbrauch als nach Entwicklung aussehen — Ziel ist es, den Zugang für die gesamte Entwickler-Community zu schützen, nicht willkürliche Grenzen für legitime Anwendungsfälle zu setzen. Details finden Sie unter Preise & Rate Limits.
Einige Ausblicke:
- Kostenloser Zugang ist ab sofort für einen ersten Zeitraum verfügbar. Wir werden Änderungen rechtzeitig ankündigen.
- Kostenpflichtige Pläne mit SLA-Garantien, Latenzzusagen und kommerzieller Lizenzierung sind für produktive Workloads verfügbar.
- Infrastruktur-Investitionen laufen kontinuierlich — die technische Arbeit, die diese kostenlose Stufe ermöglicht hat, ist kein einmaliges Ereignis.
- Open-Source-Infrastruktur: Wir planen, die Infrastruktur-Komponenten hinter S2.1 Pro quelloffen zur Verfügung zu stellen — denselben Stack, der die kostenlose Stufe nachhaltig macht.
Wenn Sie Fish Audio für einen produktiven Einsatz evaluieren, ist die kostenlose Stufe der richtige Ausgangspunkt. Bauen Sie etwas Reales, messen Sie, was für Ihre Anwendung wichtig ist, und kontaktieren Sie uns, wenn Sie bereit sind, über Produktionsanforderungen zu sprechen.
Keine Kreditkarte. Keine Warteliste. Keine Grenzen für das, was Sie ausprobieren können.

