Ein Jahr.

$52M Seed.

8M+ Builder.

Unsere Geschichte
27. Juli 2026Unternehmen

5 Modelle, 22 Personen, 1 Jahr

5 Modelle, 22 Personen, 1 Jahr

Fish Audio hat 52 Millionen US-Dollar in einer Seed-Finanzierungsrunde erhalten. Wie ein Hobbyprojekt auf einer einzelnen 4090 dazu wurde und was wir als Nächstes bauen. Lesen Sie unsere Geschichte.

Heute feiern wir einen weiteren unglaublichen Meilenstein für Fish Audio. Wir geben an unserem ersten Jahrestag eine Seed-Finanzierung in Höhe von 52 Millionen US-Dollar bekannt. Unser Dank gilt Coreline Ventures und Capital Today, die die Runde angeführt haben, unter Beteiligung von 359 Capital, Play Time, HF0, 645 Ventures, Parable, Carya Venture Partners, Alphalist Partners und den Business Angels, die investiert haben, als es noch nicht viel zu sehen gab.

Text-to-Speech ist seit etwa einem Jahrzehnt gut genug – solange man nur einen Satz benötigt. Ab dem zehnten Satz zeigen sich die Risse. Die gesamte Kategorie scheitert an derselben Stelle und aus demselben Grund: Die Wörter richtig auszusprechen und die Darbietung (Delivery) richtig hinzubekommen, sind unterschiedliche Probleme, und fast jeder hat bisher nur am ersten gearbeitet.

Jahre in der Voice AI bei Amazon Alexa und Meta haben mich gelehrt, wo traditionelles TTS endet: Eine Stimme, die zum Vorlesen gebaut wurde, lernt nie, zu performen. Also haben wir am anderen Ende angefangen. Fish Audio ist kein besserer Sprachassistent. Es ist die Sprachschicht für alles, was danach kommt.

Zwei Firmengründer sitzen nebeneinander in hölzernen Sesseln mit Blick in die Kamera, im Hintergrund ein bodentiefes Fenster und Bäume im Freien.

Die 4090

Shijia Liao, unser Chief Scientist, kam aus einer anderen Richtung zum selben Schluss. Als Forschungsingenieur bei NVIDIA, der an Video arbeitete, verbrachte er seine Freizeit damit, VTuber-Streams zu schauen und konnte nicht darüber hinwegsehen, wie leblos die Stimmen klangen. Er begann, Modelle auf einer einzelnen 4090 in seinem Schlafzimmer zu trainieren und setzte früh auf eine duale autoregressive Architektur, die der Rest der Branche erst zwei Jahre später einholen sollte. Diese Arbeit wurde zur Grundlage von S2.

Was wir in einem Jahr erreicht haben

  • Fünf hochmoderne Audiomodelle veröffentlicht. Vier Text-to-Speech, eines Speech-to-Text.
  • Das Team von 3 auf 22 Personen vergrößert, und wir stellen weiter ein.
  • Von Null auf 21 Millionen US-Dollar jährlich wiederkehrender Umsatz (ARR).
  • Über 8 Millionen Creator, Entwickler und Unternehmen auf der Plattform.
  • Über 2 Millionen Sprachmodelle in der Community-Bibliothek.
  • S2.1 Pro, von 66 % der Hörer in Blindtests gegenüber führenden Wettbewerbern bevorzugt.
  • Über 83 Sprachen mit nativer Kadenz und Emotionssteuerung auf Wortebene über mehr als 15.000 natürlichsprachliche Steuerungen.

Die Community hat das Modell gebaut

Wir führen das Post-Training auf Basis echter Nutzerpräferenzen durch, was bedeutet, dass das Modell besser wird, je mehr Leute es nutzen. Deshalb sind wir so stark bei Englisch mit Akzent, Mandarin, Japanisch, Koreanisch und Spanisch – dort, wo Modelle, die hauptsächlich auf Standard-Amerikanischem Englisch trainiert wurden, scheitern. Diese Fähigkeit entstand durch Menschen, die das Tool in Sprachen, Akzenten und Grenzfällen nutzten, an deren Testen wir nie gedacht hätten.

Fish Speech entwickelte sich dank Spieleentwicklern, Anime-Fans und Leuten, die Charaktere zum Spaß synchronisieren, von einem Repository zu einem Unternehmen. Von Anfang an haben wir an Transparenz und Offenheit geglaubt und daran, ausdrucksstarke, hochwertige Voice AI für jeden zugänglich zu machen.

Und acht Millionen von Ihnen haben uns das Vertrauen geschenkt.

Das Modell, dem Unternehmen jetzt vertrauen

Dieses Vertrauen ist der Grund, warum sich auch Unternehmen an Fish Audio wenden. Zusammen mit den Entwicklern machen Unternehmen inzwischen zwei Drittel unseres Umsatzes aus.

Wir bieten ihnen Betriebszeit, Latenz und ein Sicherheitsniveau, das jede Beschaffungsprüfung besteht: On-Premises-Bereitstellung, Zero-Data-Retention-Richtlinien und HIPAA-konforme Konfigurationen, von Anfang an integriert. S2.1 Pro gewinnt bereits Blindtests gegen die führenden Modelle, läuft mit über 8.000 Token pro Sekunde auf einer einzelnen H200 und behauptet sich in Sprachen, in denen Modelle, die nur auf einen Dialekt abgestimmt sind, stillschweigend versagen.

Unternehmenskunden kommen zu uns, weil die richtige Darbietung, nicht nur die Wörter, genau das Problem ist, das wir lösen wollten. Es ist dieselbe Mission, die wir nun noch weiter vorantreiben können.

Was kommt als Nächstes?

Text-to-Speech war nie das alleinige Ziel. Es war der Teil, den wir zuerst mit einer einzelnen GPU bauen konnten, um die Theorie zu beweisen: Die Darbietung zählt genauso viel wie die Wörter, und niemand hat dieses Problem gelöst.

Jetzt nehmen wir uns den Rest des Stacks vor. Audio Understanding Language Model (Audio LM) und Speech-to-Speech. Wir verstärken zudem unsere Bemühungen bei den Entwickler-Tools und der API, erweitern unser Enterprise-Team und vertiefen die Zusammenarbeit mit Partnern wie LiveKit und Retell, um ausdrucksstarke Stimmen schneller an mehr Orte zu bringen.

Kostenlos bis Ende August

Um diesen wichtigen Meilenstein zu feiern, ist S2.1 Pro für jeden Entwickler über die API bis Ende August kostenlos. Dies ist dasselbe Modell, für das unsere Unternehmenskunden bezahlen. Außerdem bieten wir 50 % Rabatt auf Creator-Pläne und 3 Monate kostenlos an, wenn Sie von einem anderen Anbieter wechseln.

Der Grund, warum wir das tun können, ist technischer Natur, und das Lob gebührt unserem Forschungsteam. Sie haben in diesem Jahr unseren gesamten Inference-Stack neu aufgebaut: maßgeschneiderte FP8-Kernel, über 8.000 Token pro Sekunde auf einer einzelnen H200. Das hat unsere Kosten pro Anfrage so weit gesenkt, dass die kostenlose Bereitstellung des Modells zu einer erfolgreichen Strategie wurde.

Vielen Dank

Vor einem Jahr war Fish Audio ein Hobbyprojekt, das in unserem Wohnzimmer begann. Jeder, der eine Stimme trainiert, einen Charakter synchronisiert, auf der API aufgebaut oder auf uns gesetzt hat, bevor es viel gab, worauf man setzen konnte – dies gehört Ihnen genauso wie uns.

Wir haben auf dem Weg vieles falsch gemacht. Wir werden bald die Ressourcen haben, viel mehr Dinge richtig zu machen.

Auf das zweite Jahr.

Rissa Cao

Rissa CaoX

Rissa is the CEO and co-founder of Fish Audio, pushing breakthroughs in AI voice technology. Find her latest work at @rissa_cao.

Mehr von Rissa Cao lesen

Erstelle Stimmen, die echt wirken

Beginnen Sie noch heute mit der Erstellung von Audio in höchster Qualität.

Haben Sie bereits ein Konto? Einloggen