Bildgenerierungs-MCP: Bilder, Videos & Lip-Sync mit Fish Audio
Der MCP-Server von Fish Audio generiert und bearbeitet jetzt Bilder, erstellt Videos, synchronisiert Lippen zu neuem Audio und verwandelt Porträts in Talking Avatars – direkt aus Claude Code, Claude.ai, Cursor, Codex, Windsurf und Devin. Ein Login, Dutzende von Modellen und ein Kostenvoranschlag vor jedem Bild-, Video-, Lip-Sync- oder Avatar-Auftrag.
Oktober 2026 | Fish Audio MCP unterstützt jetzt Bildgenerierung, Videogenerierung und Lip-Sync
Fragen Sie Ihren Coding-Agenten nach einem Produktfoto, einem Fünf-Sekunden-Teaser oder einem Talking-Head-Update, und Sie werden normalerweise gegen eine Wand laufen. Einige Agenten können überhaupt keine Bilder erstellen, andere bieten nur ein einziges integriertes Bildmodell an, und Video ist selten eine Option. Die übliche Lösung ist ein Bildgenerierungs-MCP-Server, aber die meisten davon verbinden nur ein einzelnes Modell und verlangen von Ihnen, für jeden Anbieter einen separaten API-Schlüssel zu erstellen und einzufügen.
Fish Audio verfolgt einen anderen Ansatz. Dieselbe MCP-Verbindung, die Ihr Agent bereits für Text-to-Speech, Transkription und Stimmensuche nutzt, kann jetzt Bilder generieren und bearbeiten, Videos erstellen, Lippen zu neuem Audio synchronisieren und ein Porträt in einen Talking Avatar verwandeln. Sie melden sich einmal an, wählen aus Dutzenden von Bild-, Video- und Lip-Sync-Modellen und bestätigen ein Angebot, bevor ein Bild-, Video-, Lip-Sync- oder Avatar-Auftrag abgerechnet wird.
Da die Voice-Tools auf demselben Server liegen, kann Ihr Agent auch etwas tun, was kein Single-Purpose-MCP kann: ein Skript schreiben, es mit Fish Audio vertonen und dieses Audio direkt an ein Talking-Avatar-Modell übergeben – in einer einzigen Konversation.
Bereits mit dem Fish Audio MCP-Server verbunden? Kein Update erforderlich. Bitten Sie Ihren Agenten, die „Fish Audio Medienmodelle aufzulisten“, und die neuen Tools sind einsatzbereit.
Neu bei Fish Audio? Kostenlos registrieren → und in weniger als einer Minute mit Ihrem Agenten verbinden.
Neuerungen im Fish Audio MCP-Server
Beginnen wir mit den Ergänzungen des Updates. Damit fungiert der Fish Audio MCP-Server gleichzeitig als Bildgenerierungs-MCP, Videogenerierungs-MCP und Lip-Sync-Tool. Die neuen Medien-Tools stehen neben den bestehenden Audio-Tools und nutzen dieselben Credits wie die Fish Audio Web-App.
Warum eine Verbindung statt eines MCP pro Modell?
- Keine API-Schlüssel sammeln. Sie melden sich mit Ihrem Fish Audio-Konto an. Es gibt keinen Anbieter-Schlüssel, den Sie anfordern, in eine Konfigurationsdatei kopieren oder rotieren müssten.
- Ein Guthaben. Jedes Modell nutzt die Credits Ihres Fish Audio-Abos. Der Wechsel von einem Bildmodell zu einem Videomodell bedeutet also nicht, ein weiteres Konto aufladen zu müssen.
- Modellwechsel per Satz, nicht per Setup. Fragen Sie in natürlicher Sprache nach einem anderen Modell, und der Agent sucht die Optionen heraus und nennt den Preis für den neuen Auftrag.
Das kann Ihr Agent jetzt tun:
| Funktion | Eingabe | Verfügbare Modelle (u.a.) |
|---|---|---|
| Text-to-Image | Ein Prompt | GPT Image 2, GPT Image 2.5 (Flare und Sunburst), Seedream 4.5 und 5.0, Nano Banana Modelle |
| Bildbearbeitung und Upscaling | Ein Bild + Anweisungen | Die oben genannten Modelle, plus Topaz HD für Upscaling |
| Text-to-Video und Image-to-Video | Ein Prompt, optional ein Startbild | Seedance, Kling, Veo 3.1, MiniMax H3, WAN 3.0, Gemini Omni Flash |
| Lip-Sync (Video-basiert) | Ein Video + neues Audio | Sync LipSync v3, Sync LipSync v2 Pro, PixVerse Lip Sync, Veed Lip Sync |
| Talking Avatars (Bild-basiert) | Ein Porträt + Audio | Creatify Aurora Avatar, HeyGen Avatar 4, Veed Fabric 1.0 Avatar, Infinitalk Avatar |
Die Modellauswahl ändert sich mit der Zeit. Ihr Agent arbeitet immer mit der Live-Liste, sodass er neue Modelle sieht, sobald diese hinzugefügt werden.
Bildgenerierung, -bearbeitung und Upscaling sind im Free-Abo verfügbar. Videogenerierung, Lip-Sync und Talking Avatars erfordern ein Paid Plus Abo oder höher.
Bilder generieren, bearbeiten und hochskalieren
Beschreiben Sie das Bild, und der Agent wählt ein Modell aus, liest dessen Optionen (wie Seitenverhältnis, Auflösung und Qualität) und nennt den Preis. Zur Bearbeitung geben Sie ihm ein Bild und eine Anweisung wie „Behalte das Motiv bei, ändere den Hintergrund in einen warmen Sonnenuntergang“. Bilder sind meist in unter einer Minute fertig, und Sie können je nach Abo mehrere gleichzeitig anfordern.
Videos aus Text, Bildern oder Referenzvideos erstellen
Die Video-Tools machen den MCP-Server zu einem Videogenerierungs-MCP für jeden Agenten, der Remote-MCP-Server unterstützt. Starten Sie mit einem Text-Prompt, animieren Sie ein Standbild oder steuern Sie das Ergebnis – bei Modellen, die dies unterstützen – mit Referenzmedien. Die Optionen für Seitenverhältnis, Auflösung und Dauer variieren je nach Modell und werden vom Agenten vor dem Angebot ausgelesen. Videos können einige Minuten dauern; der Agent prüft den Fortschritt selbstständig und liefert einen Link, sobald die Datei bereitsteht.
Lip-Sync und Talking Avatars
Beide Funktionen lassen eine Person auf dem Bildschirm eine neue Audiospur sprechen. Der Unterschied liegt in der Ausgangsbasis: ein vorhandenes Video oder ein einzelnes Bild.
Video-basiert: Vorhandenes Material neu synchronisieren. Geben Sie dem Modell ein Video einer sprechenden Person und eine neue Audiospur, und es passt die Mundbewegungen an das neue Audio an. Dies ist ideal, um bestehendes Material zu aktualisieren: Ändern einer Zeile in einem Produktvideo, Korrigieren einer Aufnahme ohne Nachdreh oder Lokalisieren eines Talking-Head-Clips in eine andere Sprache. Diese Modelle arbeiten nur mit Video und Audio und akzeptieren keinen Text-Prompt.
Bild-basiert: Ein Porträt animieren. Geben Sie dem Modell ein einzelnes Porträt und eine Audiodatei, und es animiert Gesicht, Kopf und Ausdruck passend zur Sprache. Creatify Aurora Avatar akzeptiert zudem einen optionalen Prompt zur Steuerung von Bildausschnitt, Hintergrund und Beleuchtung, während Infinitalk Avatar einen Prompt erfordert und einen expressiveren Look erzeugt.
Nutzen Sie Material, für das Sie die Rechte besitzen. Vor jedem Lip-Sync- oder Avatar-Auftrag erinnert Sie die Bestätigungsmeldung daran, nur Material, Porträts und Stimmen zu verwenden, für deren Nutzung Sie die Erlaubnis haben.
Jedes dieser Tools ist für sich genommen nützlich. Die größere Veränderung ergibt sich jedoch aus ihrem Zusammenspiel.
Vom Skript zum Talking Avatar in einer einzigen Konversation
Hier zahlt es sich aus, Audio und Video auf demselben MCP-Server zu haben. Die meisten Avatar-Tools setzen voraus, dass Sie bereits fertiges Audio mitbringen. Mit Fish Audio kann Ihr Agent das Audio selbst produzieren und direkt an das Avatar-Modell weiterreichen.
So sieht der Ablauf aus:
- Skript schreiben. Fügen Sie es ein oder lassen Sie den Agenten einen Entwurf erstellen.
- Vertonen. Der Agent ruft
text_to_speechmit einer Stimme aus der Fish Audio Voice Library, Ihrem eigenen Voice Clone oder einer mit Voice Design erstellten Stimme auf. Fügen Sie Audio-Tags wie[excited]oder[whispering]hinzu, um die Betonung zu steuern. Text-to-Speech wird nach der Textlänge abgerechnet und sofort bei der Generierung belastet, ohne separates Angebot. - Ein Gesicht wählen. Laden Sie ein Porträt hoch oder generieren Sie eines mit einem Bildmodell in derselben Sitzung.
- Animieren. Der Agent sendet das Porträt und das gerade generierte Audio an ein Avatar-Modell. Es ist nicht nötig, das Audio erst herunter- und dann wieder hochzuladen – das fertige Audio wird direkt übergeben.
- Bestätigen und Erhalten. Sie sehen ein Angebot für das Avatar-Video, bestätigen es und erhalten einen Link zur fertigen Datei.
Wir haben genau diesen Pfad getestet: Ein sechs Sekunden langer Clip, der mit text_to_speech generiert wurde, wurde direkt als Audio-Input für den Avatar akzeptiert, und das Angebot spiegelte die exakte Dauer wider – ganz ohne Download und erneuten Upload.
Kopieren Sie dies in Ihren Agenten, um es auszuprobieren:
Nutze Fish Audio, um ein 9:16 Talking-Avatar-Video zu erstellen:
1. Verwandle dieses Skript in Sprache mit einer warmen, weiblichen englischen Stimme:
"Hi, welcome to Fish Audio. Today I'll show you lip sync and talking avatars."
2. Nutze mein hochgeladenes Porträt mit HeyGen Avatar 4 bei 720p und lass sie dieses Audio sprechen.
3. Nenne mir zuerst den Preis. Generiere erst nach meiner Bestätigung und sende mir dann den Link.
Dasselbe Prinzip funktioniert für Lip-Sync. Verweisen Sie den Agenten auf ein bestehendes Talking-Head-Video und geben Sie ihm eine neue Textzeile:
Nutze Fish Audio, um meinem hochgeladenen Talking-Head-Video eine neue Textzeile zu geben:
1. Generiere Sprache mit meiner geklonten Stimme: "Today's new arrivals are 20% off. Link in the comments."
2. Nutze Sync LipSync v3, um die Lippen im Video an das neue Audio anzupassen.
Nenne zuerst den Preis und generiere erst nach meiner Bestätigung.
Talking Avatars und Lip-Sync erfordern ein bezahltes Plus-Abo oder höher. Abos ansehen →
Jedes Ergebnis als neuen Input wiederverwenden
Das Verketten ist nicht auf Audio beschränkt. Jedes fertige Ergebnis in Ihrem Workspace kann den nächsten Auftrag speisen, ohne die Konversation zu verlassen: Generieren Sie ein Bild und bitten Sie den Agenten dann: „Mache aus dem Bild, das du gerade erstellt hast, ein viersekündiges Video mit einem langsamen Zoom-in“. Der Agent gibt das Bild per Referenz weiter – nichts muss heruntergeladen oder neu hochgeladen werden.
Für Dateien auf Ihrem Computer erstellt der Agent einen temporären Upload-Slot und lädt die Datei für Sie hoch. Falls Ihr Agent keine Dateien direkt hochladen kann, gibt er Ihnen einen Link, über den Sie die Datei per Browser hineinziehen können.
All dies geschieht innerhalb des Agenten selbst. Das ist wichtiger, als es scheint: Für sich genommen können die meisten KI-Agenten keine Videos oder Talking Avatars erstellen, und selbst diejenigen, die Bilder generieren, sind an ein einziges integriertes Modell gebunden. Die Anbindung eines MCP-Servers schließt diese Lücke.
Warum KI-Agenten MCP für die Bild- und Videogenerierung benötigen
Heutige KI-Agenten sind bemerkenswert leistungsfähig. Sie können eine Kampagne planen, das Skript schreiben und die Seite erstellen, auf der sie erscheint. Bei visuellen Inhalten ist die Unterstützung jedoch ungleichmäßig. Einige Assistenten, wie Claude, generieren keine Fotos oder Illustrationen, wie es Bildgenerierungstools tun. Andere, wie ChatGPT und Codex, enthalten eine Bildgenerierung, die jedoch an das Modell eines Anbieters gebunden ist. Video, Lip-Sync und Talking Avatars sind meist außer Reichweite.
Diese Lücke führt zu einer vertrauten Routine: Sie schreiben einen Prompt in Ihrem Agenten, kopieren ihn in eine separate Bild- oder Video-App, warten, laden die Datei herunter und bringen sie zurück in Ihr Projekt. Jede Revision wiederholt diesen Kreislauf. Die Alternative, zu der viele Entwickler greifen, ist ein MCP-Server pro Modell, was einen separaten Anbieter-API-Schlüssel und einen Konfigurationseintrag für jedes einzelne bedeutet.
Das Model Context Protocol (MCP) ist der Standardweg, um einem Agenten neue Tools zu geben. Es ermöglicht Fish Audio, diese zusätzlichen Schritte zu entfernen und eine Auswahl an Modellen zu eröffnen. Ihr Agent ruft die Generierungstools direkt auf, die Ergebnisse kommen als Links zurück, und der nächste Schritt – sei es eine Revision, eine Animation oder ein Voiceover – findet in derselben Konversation statt. Die Bildgenerierung in Claude Code, Cursor oder jedem anderen unterstützten Agenten wird zu einem weiteren Tool-Aufruf.
Der Weg dorthin erfordert nur einen einzigen Befehl.
So richten Sie das Bildgenerierungs-MCP ein
Der Server befindet sich unter https://api.fish.audio/mcp und nutzt streambares HTTP. Die Anmeldung erfolgt in Ihrem Browser mit Ihrem Fish Audio-Konto – kein API-Schlüssel, keine Umgebungsvariablen. Wählen Sie unten Ihren Agenten aus.
Suchen Sie den Docs-MCP? Unser früherer Leitfaden zu llms.txt, MCP und Agent Skills behandelt
docs.fish.audio/mcp, einen Nur-Lese-Server, mit dem Coding-Agenten die Fish Audio API-Dokumentation nachschlagen können. Der Server in diesem Beitrag ist anders: Er meldet sich in Ihrem Konto an und erstellt Inhalte. Sie können beide parallel betreiben.
Claude Code
claude mcp add --transport http fish-audio https://api.fish.audio/mcp
Führen Sie dann /mcp innerhalb von Claude Code aus, um sich anzumelden.
Claude.ai
Gehen Sie zu Settings → Connectors → Add custom connector und geben Sie https://api.fish.audio/mcp ein. Claude führt Sie durch die Anmeldung.
Cursor
Öffnen Sie die Befehlspalette (Cmd/Ctrl+Shift+P) → Open MCP settings → Add custom MCP und geben Sie ein:
{
"mcpServers": {
"fish-audio": { "url": "https://api.fish.audio/mcp" }
}
}
Cursor fordert Sie bei der ersten Nutzung zur Anmeldung auf.
Codex CLI
codex mcp add fish-audio https://api.fish.audio/mcp
codex mcp login fish-audio
Der Login-Befehl öffnet ein Browserfenster. Prüfen Sie die Verbindung mit codex mcp get fish-audio.
Windsurf
Gehen Sie zu Settings → Cascade → MCP Servers → View raw config (~/.codeium/windsurf/mcp_config.json) und fügen Sie hinzu:
{
"mcpServers": {
"fish-audio": { "url": "https://api.fish.audio/mcp" }
}
}
Devin CLI
devin mcp add fish-audio --transport http --scope user --url https://api.fish.audio/mcp --scopes mcp
devin mcp login fish-audio --scopes mcp
Bestätigen Sie die Verbindung mit devin mcp list. Da Devin in Ihrer Shell arbeitet, kann er Ergebnisse auch lokal speichern – in unserem Test lud er ein fertiges Video auf Anfrage in den Downloads-Ordner herunter.
Anmelden und Team wählen
Jeder Client öffnet dieselbe Fish Audio-Anmeldeseite. Sie genehmigen die Verbindung einmal und wählen aus, in welchem Team sie arbeiten soll; der Client erneuert den Zugriff danach automatisch.
Eine Verbindung ist an das von Ihnen gewählte Team gebunden. Sie kann nur die Workspaces dieses Teams sehen und dessen Credits nutzen. Um in einem anderen Team zu arbeiten, fügen Sie den Server erneut hinzu und wählen dieses Team bei der Anmeldung aus.
Verbunden? Versuchen Sie Ihren ersten Prompt: „Erstelle ein 16:9 Aquarellbild eines Leuchtturms bei Dämmerung. Zeig mir erst den Preis, dann generiere es.“ Kostenlos starten mit Fish Audio →
So funktioniert die Generierung: Angebot, Bestätigung, Ausführung
Einmal verbunden, kann Ihr Agent bezahlte Modelle in Ihrem Namen ausführen. Das wirft eine berechtigte Frage auf: Was hindert ihn daran, mehr auszugeben, als Sie beabsichtigt haben? Die Antwort ist im Server eingebaut und wird nicht dem Urteilsvermögen des Agenten überlassen.
- Entdecken. Der Agent listet verfügbare Modelle auf und liest das benötigte aus – unterstützte Optionen, Standardwerte und Eingabelimits.
- Angebot. Vor jedem Bild-, Video-, Lip-Sync- oder Avatar-Auftrag fordert der Agent eine Schätzung an. Schätzungen sind kostenlos. Hier werden auch die Abo-Limits geprüft. Wenn eine Anfrage also ein höheres Abo erfordert, erfahren Sie das, bevor Sie um eine Genehmigung gebeten werden.
- Bestätigen. Der Agent zeigt Ihnen den Preis und wartet. Nichts wird abgerechnet, bis Sie zustimmen.
- Generieren. Der Agent übermittelt exakt die Anfrage, die Sie genehmigt haben. Der Server berechnet den Preis bei der Übermittlung erneut; falls sich der Preis geändert hat, wird der Auftrag abgelehnt und der Agent muss ein neues Angebot einholen. Die Gebühr übersteigt niemals den von Ihnen genehmigten Betrag.
- Liefern. Der Agent prüft alle paar Sekunden den Fortschritt und liefert einen Link zur fertigen Datei zusammen mit den abgerechneten Kosten.
Audio-Tools werden anders abgerechnet. Text-to-Speech und Speech-to-Text durchlaufen keinen Angebotsschritt. Sie werden sofort bei Ausführung berechnet, wobei Text-to-Speech nach der Textlänge abgerechnet wird.
Zwei weitere Sicherheitsmechanismen laufen im Hintergrund:
- Fehlgeschlagene Aufträge werden automatisch erstattet. Wenn eine Generierung fehlschlägt, kehren die Credits ohne Ihr Zutun zurück.
- Wiederholung derselben Anfrage wird nicht doppelt berechnet. Jede bezahlte Anfrage trägt einen eindeutigen Schlüssel. Wenn der Agent dieselbe Anfrage mit demselben Schlüssel nach einem Timeout erneut sendet, kehrt der Server zum ursprünglichen Auftrag zurück, anstatt einen neuen zu starten und zu berechnen.
Viele Agenten fügen eine eigene Ebene hinzu: Codex fragt zum Beispiel vor jedem Tool-Aufruf um Erlaubnis.
Ein Blick unter die Haube: Die MCP Medien-Tools
Für Entwickler sind dies die Medien-Tools, die der Agent hinter den Kulissen aufruft:
| Tool | Credits fällig? | Funktion |
|---|---|---|
| list_my_workspaces | Nein | Listet Workspaces im verbundenen Team auf |
| list_media_models / get_media_model | Nein | Listet Modelle auf und liest Optionen sowie Eingabelimits |
| create_media_upload | Nein | Erstellt einen einstündigen Upload-Slot für Bild-, Video- oder Audiodateien |
| estimate_image_generation / estimate_image_edit / estimate_video_generation | Nein | Validiert eine Anfrage und liefert ein Angebot |
| generate_image / generate_image_edit / generate_video | Ja | Übermittelt den genehmigten Auftrag |
| get_generation_status / get_generation_result | Nein | Verfolgt den Fortschritt und liefert fertige Dateien und Abrechnung |
Lip-Sync und Talking Avatars laufen über generate_video. Das Tool erkennt den Auftrag anhand der Eingaben: Video plus Audio bedeutet Lip-Sync, Porträt plus Audio bedeutet Avatar. Audio-Tools wie text_to_speech, speech_to_text, search_voices, create_voice_clone und die Story Studio Tools befinden sich auf demselben Server.
Sie müssen jedoch keines dieser Tools selbst aufrufen. In der Praxis beschreiben Sie das gewünschte Ergebnis, und der Agent verkettet die richtigen Aufrufe.
Beispiel-Prompts nach Anwendungsfall
Hier sind einige Ausgangspunkte, gruppiert nach dem, was Sie erstellen:
| Anwendungsfall | Was Sie sagen | Was der Agent tut |
|---|---|---|
| Produkt- und App-Assets | „Generiere ein 1:1 Bild einer Keramik-Kaffeetasse auf einer Marmorplatte in weichem Morgenlicht. Gib mir ein paar Variationen und zeig mir zuerst den Preis.“ | Wählt ein Bildmodell, nennt den Preis für den Batch, generiert nach Bestätigung |
| Produkt- und App-Assets | „Lade screenshot.png hoch und ersetze den Hintergrund durch einen sauberen Verlauf für unseren App Store Eintrag. Schätze zuerst die Kosten.“ | Lädt Ihre Datei hoch, nennt den Preis für die Bearbeitung, führt sie nach Bestätigung aus |
| Marketing- und Social-Video | „Erstelle ein 9:16, fünfsekündiges Video von Sneakern, die in Zeitlupe durch eine Pfütze spritzen. Nenne die Credits, dann generiere.“ | Nennt den Preis für Text-to-Video und liefert einen Video-Link |
| Marketing- und Social-Video | „Mache aus dem Bild, das du gerade generiert hast, ein kurzes Video mit einem langsamen Zoom-in.“ | Nutzt das Bild direkt als Startbild (Starting Frame) |
| Video aktualisieren/lokalisieren | „Übersetze dieses Skript ins Spanische, vertone es mit meinem Voice Clone und synchronisiere dann demo.mp4 mit Sync LipSync v2 Pro dazu. Nenne den Preis vorab.“ | Übersetzt das Skript, generiert die Sprache, lädt das Video hoch und nennt den Preis für den Lip-Sync |
| Moderatoren und Avatars | „Generiere ein Porträt einer freundlichen Moderatorin in einem hellen Studio und lass sie release-notes.md als 9:16 Talking-Avatar-Video mit Creatify Aurora Avatar lesen.“ | Erstellt das Porträt und die Sprache, nennt dann den Preis für das Avatar-Video |
| Konto | „Wie viele Fish Audio Credits habe ich noch übrig?“ | Prüft Ihr Guthaben |
In Coding-Agenten wie Claude Code, Codex und Devin arbeiten diese Tools Hand in Hand mit der Shell. Der Agent kann Bilder für jedes Produkt in einem Ordner im Batch generieren, lokale Aufnahmen hochladen oder fertige Dateien direkt in Ihr Projekt herunterladen.
Abos, Credits und Limits
Bevor Sie loslegen, ist es hilfreich zu wissen, wie Credits funktionieren und welches Abo für welche Funktion benötigt wird.
Welche Credits werden genutzt?
Die Mediengenerierung über MCP nutzt Ihre Fish Audio Web-Abo-Credits, dieselben Credits, die Sie in der Web-App ausgeben. Es werden keine Developer API Credits genutzt, die ein separates Guthaben für die Fish Audio API darstellen. Beide werden an unterschiedlichen Stellen erworben, daher sollten Sie wissen, welche Sie aufladen müssen.
Um Web-Credits hinzuzufügen oder Abos zu ändern, gehen Sie zu Team → Pläne. Da jede MCP-Verbindung an das bei der Anmeldung gewählte Team gebunden ist, werden die Generierungen von den Credits dieses Teams abgezogen.
Welches Abo benötigen Sie?
Was Ihr Agent generieren kann, hängt von Ihrem Abo ab. Die Abo-Limits werden geprüft, wenn der Agent ein Angebot anfordert. Ein Auftrag, der nicht durch Ihr Abo abgedeckt ist, wird markiert, bevor Sie um Genehmigung gebeten werden.
- Bildgenerierung, -bearbeitung und Upscaling sind im Free-Abo verfügbar, das ein tägliches Bildkontingent enthält.
- Bei der Generierung von Bildern aus Text kann jede Text-to-Image-Anfrage bis zu 2 Bilder im Free-Abo, 4 im Plus-Abo und 8 im Pro- oder Max-Abo anfordern. Bildbearbeitungen liefern ein Bild pro Anfrage.
- Videogenerierung, Lip-Sync und Talking Avatars erfordern ein bezahltes Plus-, Pro- oder Max-Abo.
- Video-, Lip-Sync- und Avatar-Aufträge liefern ein Ergebnis pro Anfrage.
Wenn Sie mit dem Free-Abo starten, ist die Bildgenerierung der einfachste Weg, den Workflow zu testen. Wenn Sie bereit für Video, Lip-Sync oder Talking Avatars sind, schaltet ein Upgrade auf das Plus-Abo oder höher diese Funktionen frei.
Preise
Jedes Modell hat unterschiedliche Preise, und die Kosten eines Auftrags hängen auch von den gewählten Einstellungen wie Auflösung, Dauer oder Anzahl der Bilder ab. Anstatt sich auf eine Preisliste zu verlassen, fragen Sie Ihren Agenten nach einem Angebot: Es ist kostenlos und spiegelt den aktuellen Preis wider. Beachten Sie jedoch, dass Text-to-Speech die Ausnahme ist: Es wird nach der Textlänge abgerechnet und sofort bei Ausführung belastet.
Da Angebote nichts kosten, können Sie verschiedene Modelle oder Einstellungen für dieselbe Idee vergleichen und das auswählen, das in Ihr Budget passt, bevor der Auftrag abgerechnet wird.
Uploads
Manche Aufträge beginnen mit Ihren eigenen Dateien: ein Bild zum Bearbeiten oder Animieren, ein Video für Lip-Sync oder Audio für einen Avatar. Der Agent übernimmt den Upload für Sie, innerhalb dieser Limits:
- Bilder: JPEG, PNG oder WebP, bis zu 20 MB
- Video: MP4, MOV, WebM oder MKV, bis zu 1 GB
- Audio: MP3, WAV, M4A, AAC, OGG oder FLAC, bis zu 50 MB
Einzelne Modelle können engere Limits haben. Beispielsweise akzeptiert Creatify Aurora Avatar 1 bis 60 Sekunden Audio. Der Agent liest die Limits jedes Modells vor dem Angebot aus. Falls ein Anbieter den Input nach der Übermittlung ablehnt, wird der fehlgeschlagene Auftrag erstattet. Ergebnisse, die Sie bereits im selben Workspace generiert haben, müssen nicht erneut hochgeladen werden; der Agent gibt sie direkt weiter.
Dauer
Bilder sind meist innerhalb einer Minute fertig. Videos, Lip-Sync und Avatars können mehrere Minuten dauern. Sie müssen den Fortschritt nicht ständig prüfen: Der Agent verfolgt ihn selbstständig und liefert einen Link, sobald die Datei bereit ist.
Fazit: Ihr Agent wird zum Medienstudio
KI-Agenten können bereits einen Launch planen, die Landingpage entwerfen und den Code ausliefern. Bisher war bei visuellen Inhalten meist Schluss: Bestenfalls gab es ein einzelnes integriertes Bildmodell; Video, Lip-Sync und Talking Avatars mussten von einer Person mit separaten Tools erledigt werden. Dieses Update schließt die Lücke. Ein einziger Bildgenerierungs-MCP gibt Ihrem Agenten Stimme, Bilder, Videos, Lip-Sync und Talking Avatars – ohne API-Schlüssel-Management und mit einem Angebot vor jedem Medienauftrag.
Der größere Wandel liegt darin, wie diese Teile zusammenfinden. Ein Skript wird zu einer Stimme, die Stimme wird zu einem Talking Avatar und ein Bild wird zu einem Video, wobei jeder Schritt sein Ergebnis an den nächsten übergibt, anstatt Dateien mühsam zwischen Apps hin- und herzuschieben. Die Stimme sorgt dafür, dass sich ein Video so anfühlt, als würde wirklich jemand zu Ihnen sprechen – sie steht im Zentrum dessen, was Fish Audio entwickelt. Die Integration in dieselbe Konversation wie Bilder und Video bedeutet, dass Ihr Agent eine Idee von wenigen Textzeilen bis zum fertigen Clip führen kann.
Wenn neue Modelle hinzugefügt werden, erscheinen sie in der Live-Modellliste Ihres Agenten, ohne dass Sie etwas neu konfigurieren müssen. Am einfachsten lässt sich das Potenzial erleben, indem Sie den Server verbinden und etwas anfordern, für das Sie normalerweise drei verschiedene Tools öffnen würden.
Neu bei Fish Audio? Kostenlos registrieren → Verbinden Sie den MCP-Server in weniger als einer Minute und starten Sie mit der Bildgenerierung, die im Free-Abo enthalten ist.
Bereit für Video, Lip-Sync und Avatars? Abos ansehen → Plus und höher schalten Videogenerierung, Lip-Sync und Talking Avatars über MCP frei.
Häufig Gestellte Fragen
Kann Claude Code Bilder generieren?
Gibt es ein Videogenerierungs-MCP für Claude Code und Cursor?
Benötige ich einen API-Schlüssel, um den Fish Audio MCP-Server zu nutzen?
Nutzt es meine Developer API Credits?
Kann der Agent Credits ausgeben, ohne mich zu fragen?
Was passiert, wenn eine Generierung fehlschlägt?
Kann ich mit Fish Audio Text-to-Speech generiertes Audio für Lip-Sync oder Avatars nutzen?
Welche KI-Agenten funktionieren mit dem Fish Audio MCP-Server?
Sabrina is part of Fish Audio's support and marketing team, helping users get the most out of AI voice products while turning launches, updates, and customer insights into clear, practical content.
Mehr von Sabrina Shu lesen