Dubbing AI wollte einen Voice Agent, der wie ein Mensch wirkt, nicht wie ein Sprachassistent
Dubbing AI hatte bereits eine Plattform rund um die Stimme aufgebaut. Nutzer konnten ihre Stimme in Echtzeit verändern, klonen, Akzente verfeinern und zwischen Sprachen übersetzen. Voice Agent erweiterte das Produkt in eine neue Richtung: Die KI konnte nun für den Nutzer sprechen.
Die Einsatzmöglichkeiten lagen auf der Hand. Ein Gamer konnte den Agenten im Gespräch antworten lassen. Wer zu beschäftigt für einen Anruf war, konnte ihn dem Agenten überlassen. Auch wer vorübergehend nicht selbst sprechen konnte, blieb in Echtzeit im Austausch.
Doch das funktionierte nur, wenn die Stimme echt klang.
Eine merkliche Pause ließ die Interaktion künstlich wirken, ebenso eine monotone oder roboterhafte Antwort. Für Dubbing AI ging es bei Echtzeit-TTS nicht nur um schnelle Spracherzeugung. Die Stimme musste natürlich klingen, Emotionen vermitteln, die Identität des Sprechers bewahren und die Sprachen der weltweiten Nutzer unterstützen.
Auch das schnellste Modell reichte nicht, wenn es monoton klang
Dubbing AI prüfte mehrere TTS-Anbieter anhand der Anforderungen von Voice Agent. Das Team legte fünf Kriterien fest: Natürlichkeit, emotionale Tiefe, Qualität des Stimmklonens, Latenz und Mehrsprachigkeit.
Dabei zeigten sich schwierige Zielkonflikte. Modelle mit geringer Latenz konnten an emotionalem Ausdruck verlieren. Ausdrucksstarke Modelle konnten Verzögerungen verursachen, die Gespräche unterbrachen. Andere funktionierten in einer Sprache gut, ließen aber beim Sprachwechsel nach.
Für ein Produkt mit mehr als 10 Millionen Nutzern in Gaming, Unterhaltung und kommerziellen Anwendungen genügte es nicht, nur in einem Teilbereich hervorragend zu sein.
Dubbing AI brauchte ein Modell, das alle Anforderungen zugleich erfüllte.
Fish Audio liefert aussergewoehnliche Stimmnatuerlichkeit, reiche emotionale Ausdruckskraft und verlaessliches Low-Latency-TTS, das die zentrale Voice-Agent-Produktexperience perfekt stuetzt.

Tiange Ling
CEO von Dubbing AI
Fish Audio erfüllte als einziges Modell alle fünf Anforderungen
Fish Audio überzeugte mit der Kombination, die Dubbing AI für Voice Agent benötigte: natürliche Sprache, emotionale Tiefe, hochwertiges Voice Cloning, geringe Latenz und Mehrsprachigkeit.
Dieser Unterschied war entscheidend, weil die Kriterien zusammenhingen. Natürlichkeit machte die Stimme glaubwürdig. Emotionen ließen sie menschlich wirken. Stimmklonen bewahrte die Identität des Sprechers. Geringe Latenz hielt das Gespräch im Fluss. Mehrsprachigkeit ermöglichte dasselbe Erlebnis für Dubbing AIs weltweite Nutzer.
Fish Audio unterstützte mehr als 80 Sprachen mit nativem Sprachwechsel und behielt dabei die für Echtzeitinteraktionen erforderliche Reaktionsgeschwindigkeit bei.
Natürlichkeit
Sprache, die menschlich statt synthetisch klingt
Emotionale Tiefe
Ausdruck, der jede Nuance vermittelt
Stimmklonen
Geklonte Stimmen, die die Identität des Sprechers bewahren
Niedrige Latenz
Antworten in Echtzeit ohne merkliche Verzögerung
Mehrsprachigkeit
Über 80 Sprachen mit nativem Code-Switching
Fish Audio schafft Raum für das Wachstum von Dubbing AIs Voice Agent
Voice Agent entwickelt sich von einer technischen Möglichkeit zu einem Produkt für Dubbing AIs weltweite Nutzer. Da Fish Audio die Echtzeit-Sprachsynthese übernimmt, kann Dubbing AI neue Kommunikationswege entwickeln und dabei das erforderliche Tempo, den Ausdruck und die Sprachqualität bewahren.
Das Ergebnis ist ein Sprachagent, der nicht nur antwortet, sondern wie jemand klingt, mit dem man weiterreden möchte.