Ein Jahr.

$52M Seed.

8M+ Builder.

Unsere Geschichte
23. Juni 2026Forschung

Fish Audio S2.1 Pro: Kostenlose Text-to-Speech API für Entwickler

Fish Audio S2.1 Pro: Kostenlose Text-to-Speech API für Entwickler

Kurzzusammenfassung:

  • S2.1 Pro, das fortschrittlichste Sprachmodell von Fish Audio, ist jetzt als kostenlose Text-to-Speech API verfügbar

  • 83 Sprachen, unbegrenzte Nutzung unter der Fair Use Policy

  • Modell-String: s2.1-pro-free — fügen Sie ihn einfach in Ihre bestehenden Fish API-Aufrufe ein

S2.1 Pro kostenlos testen — erstes Audio in 5 Minuten →

Juni 2026 | Das S2.1 Pro Modell von Fish Audio ist jetzt als kostenlose Text-to-Speech API mit unbegrenztem Zugriff unter Fair Use verfügbar.


Warum hochwertige Sprach-KI bisher immer teuer war

Wenn Sie bereits Text-to-Speech APIs evaluiert haben, kennen Sie das Muster: Die Modelle, die wirklich gut klingen, kosten Geld.

Das Gratis-Kontingent von ElevenLabs bietet 10.000 Credits pro Monat (ca. 6 - 10 Minuten), bevor die Paywall greift. OpenAI TTS ist rein nutzungsbasiert ohne kostenlose Stufe. Die neuesten Gemini TTS-Modelle von Google — ihre fortschrittlichsten — bieten keinerlei kostenlose Nutzung: Sie zahlen ab dem ersten Token. Dieses Muster zieht sich durch die gesamte Branche: Spitzenqualität bei der Sprachgenerierung war bisher ein kostenpflichtiges Feature.

Dies stellt Entwickler vor ein echtes Problem. Der Markt für KI-Sprachgeneratoren wächst jährlich um fast 20 % — aber die Werkzeuge zum Erstellen sprachgesteuerter Produkte blieben hinter Paywalls verborgen. Man kann ein Modell nicht angemessen mit 10.000 Credits evaluieren. Man kann keinen Voice Agent prototypisieren, keine Hörbuch-Pipeline testen oder mit Voice Cloning experimentieren, ohne entweder vorab Budget festzulegen oder Wochen damit zu verbringen, sich mit Open-Source-Alternativen herumzuschlagen, die eine eigene GPU-Infrastruktur erfordern.

Fish Audio ändert das heute.


Was ist S2.1 Pro?

S2.1-Pro Benchmark: Durchsatz (tok/s) und TTFB p50 (ms) über verschiedene Parallelitätsstufen von 1 bis 512, zeigt 8.006 tok/s bei c=64 und 73,2 ms TTFB bei c=1

S2.1 Pro ist das aktuelle State-of-the-Art-Sprachmodell von Fish Audio — unser bestes Modell, das jetzt jedem Entwickler kostenlos über die API zur Verfügung steht. Es ist ein neuronales Sprachsynthesemodell, das für die KI-Sprachgenerierung auf Produktionsniveau entwickelt wurde, mit besonderen Stärken in Streaming mit niedriger Latenz, mehrsprachigem TTS und Voice Cloning. Es baut auf dem Fundament von S2 auf, das wir Anfang des Jahres mit offenen Gewichten veröffentlicht haben.

Performance

  • 61 % Gewinnrate gegenüber der vorherigen Generation S2 Pro in Head-to-Head-Hörvergleichen — siehe unseren Blindvergleich der TTS-Anbieter für mehr Kontext
  • ~70 ms Time-to-First-Audio (TTFA) bei einer einzelnen Anfrage — weniger als die ~100 ms der vorherigen Generation
  • Über 2-fache Durchsatzverbesserung bei hoher Auslastung

Den vollständigen technischen Hintergrund finden Sie in unserem Paper: Hier

Sprachabdeckung

S2.1 Pro unterstützt 83 Sprachen, darunter Englisch, Japanisch, Chinesisch, Koreanisch, Spanisch, Arabisch, Französisch, Deutsch, Portugiesisch, Russisch und Dutzende weitere. Dasselbe Modell verarbeitet alle Sprachen — keine separaten Endpunkte, keine Preise pro Sprache.

Latenz

S2.1-Pro liefert eine TTFA (Time to First Audio) von ca. 90 ms über die Standard-API, was es für Live-Voice-Agents und Dialogsysteme tauglich macht. Wenn Sie eine feingranulare Kontrolle über Prosodie und Vortragsweise benötigen, sehen Sie sich auch S2s Möglichkeiten zur Sprachsteuerung auf Wortebene an.


Warum Fish Audio dies jetzt kostenlos anbieten kann

Fish Audio S2.1-Pro Inferenz-Infrastruktur: NVIDIA H200 mit FP8 GEMM und benutzerdefiniertem Scheduler liefert 125 Audio-tok/s pro Anfrage (RTF 0,17) und ~70 ms TTFA

Die Kurzfassung: Wir haben den Inferenz-Stack von Grund auf neu aufgebaut, und die Kosten pro Anfrage sind so stark gesunken, dass wir sie übernehmen können.

Eigene GPU-Kernel

Wir haben fish-scales-ops entwickelt, eine FP8-GEMM- und FlashAttention-Bibliothek für den Produktiveinsatz, die auf die Architekturen NVIDIA Hopper (H100/H200) und Blackwell (RTX 6000 PRO) ausgerichtet ist. Bei den für das Voice-AI-Serving entscheidenden Decode-Shapes übertrifft unser MXFP8-Pfad die torch.compile-fused cuBLAS-Referenz um das 2,1- bis 4,3-fache. Sie müssen nichts davon verstehen, um die API zu nutzen — aber es ist der Grund, warum die kostenlose Stufe nachhaltig ist.

Höherer Durchsatz

Auf einer einzelnen H200 mit FP8-Quantisierung hält das System einen Output-Durchsatz von über 8.000 Token/Sekunde bei 64 gleichzeitigen Anfragen aufrecht. Mehr Durchsatz pro GPU bedeutet mehr bediente Anfragen pro Dollar, was den unbegrenzten kostenlosen Zugang wirtschaftlich tragbar macht.


Was „kostenlos“ wirklich bedeutet

Wir sind lieber ehrlich in Bezug auf die Einschränkungen, als sie zu verstecken.

Was Sie erhalten:

  • Modell-String: s2.1-pro-free
  • Hochvolumiger Zugriff ohne feste Zeichenbegrenzung (unterliegt der Fair Use Policy)
  • Gleicher API-Endpunkt wie bei kostenpflichtigen Tarifen — keine separate Integration

Aktuelle Einschränkungen:

  • Dauer: Kostenloser Zugang ist bis zum 24. Juli 2026 verfügbar Kostenloser Zugang ist bis Ende Juli 2026 verfügbar Kostenloser Zugang ist bis zum 31. August 2026 verfügbar — wir werden alle Änderungen rechtzeitig bekannt geben.
    • Update (Juni 2026): Wir verlängern das kostenlose Fenster auf den gesamten Juli. Wir möchten, dass Entwickler einen vollen, ununterbrochenen Monat Zeit haben, um zu bauen, zu evaluieren und zu veröffentlichen — ohne einen Countdown im Nacken.
    • Update (Juli 2026): Wir verlängern den kostenlosen Zugang noch einmal bis zum 31. August 2026. Zu sehen, was unsere Fish-Entwickler mit S2.1 Pro gebaut haben, war wirklich herzerwärmend, und wir möchten diesem Schwung noch mehr Raum zur Entfaltung geben.
  • Kein SLA: Keine Garantien für Uptime oder TTFA; entwickelt für Experimente und Prototyping
  • Keine Latenzgarantie: Best-Effort-Prinzip, nicht vertraglich zugesichert
  • Datenspeicherung: Anfragen können verwendet werden, um die Modellqualität zu verbessern — siehe unsere Datenschutzerklärung
  • Kommerzielle Nutzung: Bestimmte kommerzielle Szenarien können Einschränkungen unterliegen. Produkte, die mehr als 1 Mio. $ ARR generieren, sollten uns kontaktieren, bevor sie S2.1 Pro Free nutzen. Details finden Sie unter Preise & Rate Limits

Wenn Sie Produktions-SLA und Latenzgarantien benötigen, sind kostenpflichtige Pläne verfügbar. Diese Stufe ist der richtige Ort, um aufzubauen, zu evaluieren und zu entscheiden.


So nutzen Sie die kostenlose Text-to-Speech API: S2.1 Pro Schnellstart

Holen Sie sich Ihren API-Key unter fish.audio/app/api-keys und tätigen Sie Ihren ersten Aufruf. Die Fish API akzeptiert msgpack-kodierte Anfragen und gibt Audio im gewählten Format zurück. Vollständige Referenz in der API-Dokumentation.

JavaScript

import { writeFile } from "fs/promises";

const body = {
  text: "Hallo, Welt!",
  reference_id: "ihre_modell_id",
  format: "mp3",
};

const res = await fetch("https://api.fish.audio/v1/tts", {
  method: "POST",
  headers: {
    Authorization: "Bearer <IHR_API_KEY>",
    "Content-Type": "application/json",
    model: "s2.1-pro-free",
  },
  body: JSON.stringify(body),
});

if (!res.ok) {
  throw new Error(`TTS-Anfrage fehlgeschlagen: ${res.status} ${await res.text()}`);
}

const buffer = Buffer.from(await res.arrayBuffer());
await writeFile("output.mp3", buffer);

Python

import httpx

body = {
    "text": "Hallo, Welt!",
    "reference_id": "ihre_modell_id",
    "format": "mp3",
}

with httpx.Client() as client:
    res = client.post(
        "https://api.fish.audio/v1/tts",
        headers={
            "Authorization": "Bearer <IHR_API_KEY>",
            "Content-Type": "application/json",
            "model": "s2.1-pro-free",
        },
        json=body,
    )

res.raise_for_status()

with open("output.mp3", "wb") as f:
    f.write(res.content)

Die einzige Änderung gegenüber jedem anderen Fish Audio API-Aufruf: Setzen Sie model: "s2.1-pro-free" in den Headern. Das ist alles.

Holen Sie sich Ihren kostenlosen API-Key →


S2.1 Pro vs. ElevenLabs und die besten TTS-APIs im Jahr 2026

Die untenstehenden Informationen zu Wettbewerbern basieren auf öffentlich zugänglichen Dokumentationen und Preislisten Stand Juni 2026. Preise und Funktionen können sich ändern — prüfen Sie diese direkt beim jeweiligen Anbieter, bevor Sie eine Entscheidung für den Produktiveinsatz treffen.

Vergleich kostenloser TTS-APIs im Jahr 2026: Fish Audio S2.1-Pro vs. ElevenLabs vs. OpenAI TTS vs. Google Cloud TTS

Für eine tiefergehende unabhängige Analyse siehe unseren Blindvergleich der TTS-Anbieter.

Fazit: Unter den großen TTS-API-Anbietern, die wir evaluiert haben, bietet Fish Audio derzeit eines der großzügigsten kostenlosen Zugangsmodelle an — das einzige, bei dem die kostenlose Stufe dasselbe State-of-the-Art-Modell nutzt wie die kostenpflichtige Stufe, ohne feste Nutzungsobergrenze. Das Gratis-Kontingent von ElevenLabs ist faktisch eine Testversion mit 10.000 Credits. Das fortschrittlichste TTS von Google (Gemini TTS) bietet überhaupt keine kostenlose Stufe an.

Suchen Sie nach einer kostenlosen ElevenLabs-Alternative ohne Kompromisse bei der Modellqualität? S2.1 Pro ist ab sofort ohne Nutzungsobergrenze verfügbar.

Suchen Sie nach einer kostenlosen OpenAI TTS-Alternative? Das TTS-Angebot von OpenAI bietet keine kostenlose Stufe — S2.1 Pro ist eine überzeugende Option für die erste Evaluierung.

Vollständige API-Dokumentation ansehen und mit dem Bauen beginnen →


Was Sie damit bauen können

Die kostenlose Stufe ist bewusst nicht auf bestimmte Anwendungsfälle beschränkt. Hier sind Szenarien, in denen die Kombination aus KI-Sprachgenerierung mit niedriger Latenz, Mehrsprachigkeit und Voice Cloning von S2.1 Pro den größten Unterschied macht.

Voice Agents

Echtzeit-KI für Konversationen steht und fällt mit der Latenz. Mit ca. 90 ms TTFA für Standardaufrufe ist S2.1 Pro schnell genug für natürlichen Dialog. Kombinieren Sie es mit einer Speech-to-Text-Ebene und einem LLM für eine vollständige Voice-Pipeline ohne Abrechnung pro Zeichen. Sie können S2.1 Pro auch über unseren Support für MCP und Agent-Skills in Agent-Workflows integrieren.

Hörbücher und lange Texte

Die Unterstützung von 83 Sprachen und die natürliche Prosodie machen S2.1 Pro ideal für die Produktion von Hörbüchern und die Synthese langer Texte. Unbegrenzte Nutzung bedeutet, dass Sie vollständige Manuskripte verarbeiten können, ohne auf einen Zeichenzähler zu achten oder Credits vorab kaufen zu müssen.

Voice Cloning

S2.1 Pro unterstützt Voice Cloning aus Referenz-Audio via API — übergeben Sie ein Referenz-Audio-Sample und das Modell synthetisiert Sprache in dieser Stimme. Erstellen Sie personalisierte Sprachanwendungen, lokalisieren Sie Inhalte mit konsistenter Sprecheridentität oder generieren Sie Charakterstimmen für Spiele und Animationen. Voice Cloning ist in der kostenlosen Stufe verfügbar, unter Vorbehalt derselben Fair Use Policy.

Mehrsprachige Anwendungen

Wenn Ihre Anwendung Nutzer in mehreren Sprachen bedient, ist eine Abdeckung von 83 Sprachen mit einer einzigen konsistenten KI-Sprach-API eine erhebliche Vereinfachung gegenüber Alternativen, die separate Modell-Endpunkte pro Sprache erfordern oder Premium-Preise für nicht-englische Sprachsynthese verlangen.

NPC-Dialoge in Spielen

Audio-Pipelines in Spielen profitieren von hohem Durchsatz und vorhersagbaren Kosten pro Anfrage. Die unbegrenzte kostenlose Nutzung macht es praktikabel, große Dialogbibliotheken zu erstellen und während der Entwicklung frei zu iterieren, bevor man sich auf ein Budget für den Produktivbetrieb festlegt.


Verfügbar über unser Partner-Ökosystem

S2.1 Pro ist auch über eine wachsende Zahl von Partnerplattformen verfügbar, darunter Runware, Retell, Sierra und andere.

Wenn Sie bereits auf einer dieser Plattformen aufbauen, ist S2.1 Pro ohne zusätzliche Integration oder Einrichtung zugänglich — nutzen Sie einfach das, was Sie bereits haben.

Wir erweitern unser Partnernetzwerk aktiv. Wenn Sie ein Plattform- oder Infrastrukturanbieter sind und an der Integration von S2.1 Pro interessiert sind, kontaktieren Sie unser Team, um die Möglichkeiten auszuloten.


Fair Use & Ausblick

Die kostenlose Stufe unterliegt einer Fair Use Policy. Wir behalten uns das Recht vor, den Zugriff bei Nutzungsmustern zu drosseln oder zu begrenzen, die eher nach Missbrauch als nach Entwicklung aussehen — Ziel ist es, den Zugang für die gesamte Entwickler-Community zu schützen, nicht willkürliche Grenzen für legitime Anwendungsfälle zu setzen. Details finden Sie unter Preise & Rate Limits.

Einige Ausblicke:

  • Kostenloser Zugang ist ab sofort für einen ersten Zeitraum verfügbar. Wir werden Änderungen rechtzeitig ankündigen.
  • Kostenpflichtige Pläne mit SLA-Garantien, Latenzzusagen und kommerzieller Lizenzierung sind für produktive Workloads verfügbar.
  • Infrastruktur-Investitionen laufen kontinuierlich — die technische Arbeit, die diese kostenlose Stufe ermöglicht hat, ist kein einmaliges Ereignis.
  • Open-Source-Infrastruktur: Wir planen, die Infrastruktur-Komponenten hinter S2.1 Pro quelloffen zur Verfügung zu stellen — denselben Stack, der die kostenlose Stufe nachhaltig macht.

Wenn Sie Fish Audio für einen produktiven Einsatz evaluieren, ist die kostenlose Stufe der richtige Ausgangspunkt. Bauen Sie etwas Reales, messen Sie, was für Ihre Anwendung wichtig ist, und kontaktieren Sie uns, wenn Sie bereit sind, über Produktionsanforderungen zu sprechen.

Keine Kreditkarte. Keine Warteliste. Keine Grenzen für das, was Sie ausprobieren können.

Holen Sie sich Ihren kostenlosen API-Key →

Häufig Gestellte Fragen

Was ist eine Text-to-Speech API?
Eine Text-to-Speech API (TTS-API) ist ein Webdienst, der geschriebenen Text in gesprochenes Audio umwandelt. Entwickler senden eine Textzeichenfolge an den API-Endpunkt und erhalten eine Audiodatei zurück — typischerweise im Format MP3, WAV oder Opus —, die in Anwendungen abgespielt, gespeichert oder in Echtzeit gestreamt werden kann. Moderne KI-Sprach-APIs wie S2.1 Pro nutzen neuronale Sprachsynthesemodelle, um natürlich klingendes Audio zu erzeugen, das kaum von menschlicher Sprache zu unterscheiden ist.
Ist Fish Audio S2.1 Pro wirklich kostenlos?
Ja. S2.1 Pro ist kostenlos über die Fish API mit dem Modell-String `s2.1-pro-free` verfügbar. Es gibt keine feste Zeichenbegrenzung — die Nutzung unterliegt einer Fair Use Policy, um Missbrauch zu verhindern. Die kostenlose Stufe bietet keine SLA- oder Latenzgarantien, und Anfragen können zur Modellverbesserung gespeichert werden. Sie ist für Entwicklung, Prototyping und Evaluierung konzipiert. Details finden Sie unter [Preise & Rate Limits](https://docs.fish.audio/developer-guide/models-pricing/pricing-and-rate-limits).
Was ist die beste kostenlose TTS-API im Jahr 2026?
Die beste kostenlose TTS-API hängt von Ihrem Anwendungsfall ab. Unter den großen Anbietern bietet Fish Audio S2.1 Pro einen großzügigen kostenlosen Zugang zu einem Modell der aktuellen Generation, ohne feste Nutzungsobergrenze und mit Unterstützung für 83 Sprachen. ElevenLabs bietet 10.000 kostenlose Credits pro Monat für seine Sprachbibliothek an. Die alten WaveNet-Stimmen von Google sind bis zu 4 Millionen Zeichen pro Monat kostenlos. OpenAI TTS und das neueste Gemini TTS von Google haben keine kostenlose Stufe. Für Entwickler, die eine hochmoderne KI-Sprach-API ohne Budgeteinschränkungen evaluieren möchten, ist S2.1 Pro ein starker Ausgangspunkt.
Wie schneidet Fish Audio im Vergleich zu ElevenLabs ab?
Sowohl Fish Audio als auch ElevenLabs bieten hochwertige neuronale Sprachgenerierung und Voice Cloning. Die wichtigsten praktischen Unterschiede in der kostenlosen Stufe: Bei Fish Audio läuft das gleiche S2.1 Pro Modell wie in der bezahlten Stufe ohne feste Nutzungsobergrenze; bei ElevenLabs ist die kostenlose Stufe auf 10.000 Credits pro Monat begrenzt. Bei der Sprachabdeckung unterstützt Fish Audio 83 Sprachen gegenüber den über 70 von ElevenLabs. ElevenLabs verfügt über eine größere Bibliothek mit vordefinierten Stimmen. Fish Audio ist tendenziell stärker für entwicklerfokussierte Anwendungsfälle, die niedrige Latenz, hohe Parallelität oder umfassende Mehrsprachigkeit erfordern. Siehe unseren [Blindvergleich der TTS-Anbieter](https://fish.audio/blog/blind-tts-provider-comparison-2026/) für einen unabhängigen Benchmark.
Unterstützt Fish Audio Voice Cloning?
Ja. S2.1 Pro unterstützt [Voice Cloning aus Referenz-Audio](https://docs.fish.audio/features/voice-cloning). Sie können ein Referenz-Audio-Sample übergeben, und das Modell synthetisiert Sprache in dieser Stimme. Dies funktioniert in allen 83 unterstützten Sprachen, was besonders nützlich für die Inhaltslokalisierung ist, bei der eine konsistente Sprecheridentität entscheidend ist. Unser Voice-Cloning-System liefert hohe Sprecherkonsistenz und natürliche Prosodie. Voice Cloning ist in der kostenlosen Stufe verfügbar, unter Vorbehalt derselben Fair Use Policy wie alle anderen Nutzungen von s2.1-pro-free.
Kann ich Fish Audio kommerziell nutzen?
Die kostenlose Stufe (`s2.1-pro-free`) kann Einschränkungen für bestimmte kommerzielle Szenarien haben. Für die produktive kommerzielle Nutzung mit vollständiger Lizenzierung, SLA und ohne Datenspeicherung nutzen Sie bitte die kostenpflichtigen Pläne von Fish Audio. Aktuelle Informationen finden Sie in den [Preisen & Rate Limits](https://docs.fish.audio/developer-guide/models-pricing/pricing-and-rate-limits) und den [Nutzungsbedingungen](https://fish.audio/terms/).
Welche Sprachen unterstützt Fish Audio?
S2.1 Pro unterstützt 83 Sprachen, darunter Englisch, Japanisch, Koreanisch, Chinesisch, Spanisch, Portugiesisch, Arabisch, Französisch, Deutsch, Russisch, Italienisch, Türkisch, Niederländisch, Polnisch, Vietnamesisch, Thai, Indonesisch und viele mehr. Alle Sprachen werden von demselben Modell bedient — es gibt keine separaten Endpunkte oder länderspezifischen Preisstufen.
Shijia Liao

Shijia LiaoX

Founder & Chief-Scientist of Fish Audio.

Mehr von Shijia Liao lesen

Erstelle Stimmen, die echt wirken

Beginnen Sie noch heute mit der Erstellung von Audio in höchster Qualität.

Haben Sie bereits ein Konto? Einloggen