MCP de génération d'images : images, vidéo et synchronisation labiale avec Fish Audio
Le serveur MCP de Fish Audio génère et modifie désormais des images, crée des vidéos, synchronise les lèvres sur un nouvel audio et transforme des portraits en avatars parlants — depuis Claude Code, Claude.ai, Cursor, Codex, Windsurf et Devin. Une seule connexion, des dizaines de modèles et un devis avant chaque tâche d'image, de vidéo, de synchronisation labiale ou d'avatar.
Octobre 2026 | Le MCP Fish Audio prend désormais en charge la génération d'images, la génération de vidéos et la synchronisation labiale
Demandez à votre agent de programmation une photo de produit, un teaser de cinq secondes ou une mise à jour avec une tête parlante, et vous vous heurterez généralement à un mur. Certains agents ne peuvent pas du tout créer d'images, d'autres ne proposent qu'un seul modèle d'image intégré, et la vidéo est rarement une option. La solution habituelle est un serveur MCP de génération d'images, mais la plupart d'entre eux ne connectent qu'un seul modèle et vous demandent de créer et de coller une clé API distincte pour chaque fournisseur.
Fish Audio adopte une approche différente. La même connexion MCP que votre agent utilise déjà pour la synthèse vocale, la transcription et la recherche vocale peut désormais générer et modifier des images, créer des vidéos, synchroniser les lèvres sur un nouvel audio et transformer un portrait en avatar parlant. Vous vous connectez une seule fois, choisissez parmi des dizaines de modèles d'image, de vidéo et de synchronisation labiale, et approuvez un devis avant que toute tâche d'image, de vidéo, de synchronisation labiale ou d'avatar ne soit facturée.
Parce que les outils vocaux résident sur le même serveur, votre agent peut également faire ce qu'aucun MCP spécialisé dans une seule tâche ne peut faire : écrire un script, le sonoriser avec Fish Audio et transmettre cet audio directement à un modèle d'avatar parlant — le tout en une seule conversation.
Déjà connecté au serveur MCP Fish Audio ? Aucune mise à jour nécessaire. Demandez à votre agent de « lister les modèles de médias Fish Audio » et les nouveaux outils seront prêts à l'emploi.
Nouveau sur Fish Audio ? Inscrivez-vous gratuitement → et connectez-vous avec votre agent en moins d'une minute.
Quoi de neuf dans le serveur MCP Fish Audio
Commençons par les nouveautés de la mise à jour. Avec elle, le serveur MCP Fish Audio fonctionne à la fois comme un MCP de génération d'images, un MCP de génération de vidéos et un outil de synchronisation labiale. Les nouveaux outils multimédias côtoient les outils audio existants et utilisent les mêmes crédits que l'application web Fish Audio.
Pourquoi une seule connexion au lieu d'un MCP par modèle ?
- Pas de clés API à collecter. Vous vous connectez avec votre compte Fish Audio. Il n'y a pas de clé fournisseur à demander, à coller dans un fichier de configuration ou à renouveler.
- Un seul solde. Chaque modèle puise dans les crédits de votre plan Fish Audio. Passer d'un modèle d'image à un modèle vidéo ne signifie donc pas recharger un autre compte.
- Changer de modèle se fait par une simple phrase, pas par une configuration. Demandez un modèle différent en langage naturel, et l'agent consultera ses options et proposera un devis pour la nouvelle tâche.
Voici ce que votre agent peut faire désormais :
| Capacité | Ce que vous lui fournissez | Modèles disponibles inclus |
|---|---|---|
| Texte-vers-image | Une instruction (prompt) | GPT Image 2, GPT Image 2.5 (Flare et Sunburst), Seedream 4.5 et 5.0, modèles Nano Banana |
| Édition d'image et mise à l'échelle | Une image + instructions | Les modèles ci-dessus, plus Topaz HD pour la mise à l'échelle |
| Texte-vers-vidéo et image-vers-vidéo | Un prompt, optionnellement une image de départ | Seedance, Kling, Veo 3.1, MiniMax H3, WAN 3.0, Gemini Omni Flash |
| Synchronisation labiale (basée sur la vidéo) | Une vidéo + nouvel audio | Sync LipSync v3, Sync LipSync v2 Pro, PixVerse Lip Sync, Veed Lip Sync |
| Avatars parlants (basés sur une image) | Un portrait + audio | Creatify Aurora Avatar, HeyGen Avatar 4, Veed Fabric 1.0 Avatar, Infinitalk Avatar |
La liste des modèles évolue avec le temps. Votre agent travaille toujours à partir de la liste en direct, il voit donc les nouveaux modèles dès qu'ils sont ajoutés.
La génération, l'édition et la mise à l'échelle d'images sont disponibles avec le plan Gratuit. La génération de vidéos, la synchronisation labiale et les avatars parlants nécessitent un plan Plus payant ou supérieur.
Générer, modifier et mettre à l'échelle des images
Décrivez l'image, et l'agent choisit un modèle, lit ses options (telles que le format, la résolution et la qualité), puis propose un devis. Pour éditer, donnez-lui une image et une instruction telle que « garde le sujet, remplace le fond par un coucher de soleil chaleureux ». Les images sont généralement prêtes en moins d'une minute, et vous pouvez en demander plusieurs à la fois selon votre plan.
Générer des vidéos à partir de texte, d'images ou de vidéos de référence
Les outils vidéo transforment le serveur MCP en un MCP de génération vidéo pour tout agent prenant en charge les serveurs MCP distants. Partez d'un prompt textuel, animez une image fixe ou — sur les modèles qui le permettent — guidez le résultat avec des médias de référence. Le format, la résolution et la durée varient selon le modèle, et l'agent les lit avant de proposer un devis. Les vidéos peuvent prendre quelques minutes ; l'agent vérifie lui-même la progression et renvoie un lien quand le fichier est prêt.
Synchronisation labiale et avatars parlants
Ces deux capacités permettent de faire prononcer une nouvelle piste audio à quelqu'un à l'écran. La différence réside dans l'élément de départ : une vidéo existante ou une image unique.
Basé sur la vidéo : synchronisez à nouveau des séquences existantes. Donnez au modèle une vidéo de quelqu'un qui parle et une nouvelle piste audio, et il recalera les mouvements de la bouche pour qu'ils correspondent. C'est conçu pour mettre à jour des séquences que vous possédez déjà : changer une réplique dans une vidéo de produit, enregistrer une correction sans retourner la scène, ou localiser un clip de tête parlante dans une autre langue. Ces modèles fonctionnent uniquement à partir de la vidéo et de l'audio et ne prennent pas de prompt textuel.
Basé sur l'image : animez un portrait. Donnez au modèle un portrait unique et un fichier audio, et il animera le visage, la tête et l'expression pour correspondre au discours. Creatify Aurora Avatar accepte également un prompt optionnel pour contrôler le cadrage, l'arrière-plan et l'éclairage, tandis qu'Infinitalk Avatar nécessite un prompt et produit un rendu plus expressif.
Utilisez du matériel dont vous détenez les droits. Avant chaque tâche de synchronisation labiale ou d'avatar, le message de confirmation vous rappelle de n'utiliser que des séquences, des portraits et des voix que vous êtes autorisé à utiliser.
Chacun de ces outils est utile en soi. Le changement majeur réside dans ce qui se passe lorsqu'ils fonctionnent ensemble.
Du script à l'avatar parlant en une seule conversation
C'est là que le fait d'avoir la voix et la vidéo sur le même serveur MCP porte ses fruits. La plupart des outils d'avatar supposent que vous arriviez avec un audio finalisé. Avec Fish Audio, votre agent peut produire l'audio lui-même et le transmettre directement au modèle d'avatar.
Voici le flux de travail :
- Écrire le script. Collez-le ou laissez l'agent le rédiger.
- Le sonoriser. L'agent appelle
text_to_speechavec une voix de la bibliothèque de voix Fish Audio, votre propre clonage de voix, ou une voix que vous avez créée avec Voice Design. Ajoutez des balises audio comme[excited]ou[whispering]pour moduler la diction. La synthèse vocale est facturée à la longueur du texte dès que la parole est générée, sans devis séparé. - Choisir un visage. Importez un portrait ou générez-en un avec un modèle d'image dans la même session.
- L'animer. L'agent envoie le portrait et le discours qu'il vient de générer à un modèle d'avatar. Pas besoin de télécharger l'audio pour le réimporter — le discours finalisé est transmis directement.
- Approuver et recevoir. Vous voyez un devis pour la vidéo de l'avatar, vous le confirmez et vous recevez un lien vers le fichier terminé.
Nous avons testé ce parcours exact : un clip de six secondes généré avec text_to_speech a été accepté directement comme entrée audio de l'avatar, et le devis reflétait sa durée exacte — sans téléchargement ni nouvel envoi.
Copiez ceci dans votre agent pour essayer :
Utilise Fish Audio pour créer une vidéo d'avatar parlant au format 9:16 :
1. Transforme ce script en parole avec une voix féminine anglaise chaleureuse :
"Hi, welcome to Fish Audio. Today I'll show you lip sync and talking avatars."
2. Utilise mon portrait importé avec HeyGen Avatar 4 en 720p et fais-lui prononcer cet audio.
3. Donne-moi le devis d'abord. Génère après ma confirmation, puis envoie-moi le lien.
Le même principe fonctionne pour la synchronisation labiale. Dirigez l'agent vers une vidéo de tête parlante existante et donnez-lui une nouvelle réplique :
Utilise Fish Audio pour donner une nouvelle réplique à ma vidéo de tête parlante importée :
1. Génère la parole avec ma voix clonée : "Today's new arrivals are 20% off. Link in the comments."
2. Utilise Sync LipSync v3 pour faire correspondre les lèvres de la vidéo au nouvel audio.
Devis d'abord, et génère après ma confirmation.
Les avatars parlants et la synchronisation labiale nécessitent un plan Plus payant ou supérieur. Voir les plans →
Réutiliser tout résultat comme entrée suivante
Le chaînage ne se limite pas à l'audio. Tout résultat terminé dans votre espace de travail peut alimenter la tâche suivante sans quitter la conversation : générez une image, puis demandez à l'agent de « transformer l'image que tu viens de créer en une vidéo de quatre secondes avec un zoom avant lent ». L'agent transmet l'image par référence — rien à télécharger, rien à renvoyer.
Pour les fichiers sur votre ordinateur, l'agent crée un emplacement d'importation temporaire et importe le fichier pour vous. Si votre agent ne peut pas importer de fichiers directement, il vous donne un lien où vous pouvez faire glisser le fichier depuis votre navigateur.
Tout cela se passe à l'intérieur de l'agent lui-même. C'est plus important qu'il n'y paraît : à eux seuls, la plupart des agents IA ne peuvent pas créer de vidéo ou d'avatars parlants, et même ceux qui génèrent des images sont liés à un seul modèle intégré. La connexion à un serveur MCP est ce qui comble cette lacune.
Pourquoi les agents IA ont besoin du MCP pour la génération d'images et de vidéos
Aujourd'hui, les agents IA sont remarquablement capables. Ils peuvent planifier une campagne, écrire le script et construire la page qui l'héberge. Cependant, en ce qui concerne les visuels, le support est inégal. Certains assistants, comme Claude, ne génèrent pas de photos ou d'illustrations comme le font les outils de génération d'images. D'autres, comme ChatGPT et Codex, incluent la génération d'images, mais elle est liée au modèle d'un seul fournisseur. La vidéo, la synchronisation labiale et les avatars parlants sont généralement hors de portée.
Cette lacune crée une routine familière. Vous écrivez un prompt dans votre agent, le collez dans une application d'image ou de vidéo séparée, attendez, téléchargez le fichier et le ramenez dans votre projet. Chaque révision répète cette boucle. L'alternative vers laquelle se tournent de nombreux développeurs est un serveur MCP par modèle, ce qui signifie une clé API et une entrée de configuration distinctes pour chacun.
Le Model Context Protocol (MCP) est la norme pour donner de nouveaux outils à un agent, et c'est ce qui permet à Fish Audio de supprimer ces étapes supplémentaires et d'ouvrir un choix de modèles. Votre agent appelle directement les outils de génération, les résultats reviennent sous forme de liens, et l'étape suivante, qu'il s'agisse d'une révision, d'une animation ou d'une voix off, se déroule dans la même conversation. La génération d'images dans Claude Code, Cursor ou tout autre agent pris en charge devient un simple appel d'outil supplémentaire.
Y parvenir ne demande qu'une seule commande.
Comment configurer le MCP de génération d'images
Le serveur réside à l'adresse https://api.fish.audio/mcp et utilise du HTTP en streaming. La connexion se fait dans votre navigateur avec votre compte Fish Audio — pas de clé API, pas de variables d'environnement. Choisissez votre agent ci-dessous.
Vous cherchez le MCP de documentation ? Notre guide précédent sur llms.txt, MCP et Agent Skills couvre
docs.fish.audio/mcp, un serveur en lecture seule qui permet aux agents de programmation de consulter la documentation de l'API Fish Audio. Le serveur de cet article est différent : il se connecte à votre compte et crée du contenu. Vous pouvez faire fonctionner les deux côte à côte.
Claude Code
claude mcp add --transport http fish-audio https://api.fish.audio/mcp
Puis lancez /mcp dans Claude Code pour vous connecter.
Claude.ai
Allez dans Settings → Connectors → Add custom connector et saisissez https://api.fish.audio/mcp. Claude vous guidera pour la connexion.
Cursor
Ouvrez la palette de commandes (Cmd/Ctrl+Shift+P) → Open MCP settings → Add custom MCP, et ajoutez :
{
"mcpServers": {
"fish-audio": { "url": "https://api.fish.audio/mcp" }
}
}
Cursor vous invitera à vous connecter lors de la première utilisation.
Codex CLI
codex mcp add fish-audio https://api.fish.audio/mcp
codex mcp login fish-audio
La commande de connexion ouvre une fenêtre de navigateur. Vérifiez la connexion avec codex mcp get fish-audio.
Windsurf
Allez dans Settings → Cascade → MCP Servers → View raw config (~/.codeium/windsurf/mcp_config.json) et ajoutez :
{
"mcpServers": {
"fish-audio": { "url": "https://api.fish.audio/mcp" }
}
}
Devin CLI
devin mcp add fish-audio --transport http --scope user --url https://api.fish.audio/mcp --scopes mcp
devin mcp login fish-audio --scopes mcp
Confirmez la connexion avec devin mcp list. Comme Devin fonctionne dans votre terminal, il peut également enregistrer les résultats localement — lors de notre test, il a téléchargé une vidéo terminée dans le dossier Téléchargements sur simple demande.
Connectez-vous et choisissez votre équipe
Chaque client ouvre la même page de connexion Fish Audio. Vous approuvez la connexion une fois et choisissez l'équipe dans laquelle elle fonctionne ; le client renouvelle l'accès automatiquement par la suite.
Une connexion est liée à l'équipe que vous choisissez. Elle ne peut voir que les espaces de travail de cette équipe et utiliser les crédits de cette équipe. Pour travailler dans une autre équipe, ajoutez à nouveau le serveur et choisissez cette équipe lors de la connexion.
Connecté ? Essayez votre premier prompt : « Crée une image à l'aquarelle d'un phare à l'aube au format 16:9. Montre-moi le prix d'abord, puis génère-la. » Commencez gratuitement avec Fish Audio →
Fonctionnement de chaque génération : Devis, Confirmation, Génération
Une fois connecté, votre agent peut exécuter des modèles payants en votre nom. Cela soulève une question légitime : qu'est-ce qui l'empêche de dépenser plus que prévu ? La réponse est intégrée au serveur, et ne repose pas sur le jugement de l'agent.
- Découvrir. L'agent liste les modèles disponibles et lit celui dont il a besoin — options prises en charge, valeurs par défaut et limites d'entrée.
- Devis. Avant toute tâche d'image, de vidéo, de synchronisation labiale ou d'avatar, l'agent demande une estimation. Les estimations sont gratuites. Les limites de plan sont également vérifiées ici. Ainsi, si une demande nécessite un plan supérieur, vous le savez avant même qu'on ne vous demande d'approuver quoi que ce soit.
- Confirmer. L'agent vous montre le prix et attend. Rien n'est facturé tant que vous n'avez pas approuvé.
- Générer. L'agent soumet la demande exacte que vous avez approuvée. Le serveur recalcule le prix lors de la soumission ; si le prix a changé, la tâche est rejetée et l'agent doit refaire un devis. La facturation ne dépasse jamais le montant que vous avez approuvé.
- Livrer. L'agent vérifie la progression toutes les quelques secondes et renvoie un lien vers le fichier terminé, ainsi que le montant facturé.
Les outils vocaux sont facturés différemment. La synthèse vocale et la reconnaissance vocale ne passent pas par l'étape du devis. Elles sont facturées dès qu'elles sont exécutées, la synthèse vocale étant facturée à la longueur du texte.
Deux autres protections fonctionnent en arrière-plan :
- Les tâches échouées sont remboursées automatiquement. Si une génération échoue, les crédits sont restitués sans que vous ayez à le demander.
- Réessayer la même demande ne facturera pas deux fois. Chaque demande payante porte une clé unique. Si l'agent renvoie la même demande avec la même clé après l'expiration du délai (timeout), le serveur renvoie à la tâche d'origine au lieu d'en démarrer une nouvelle et de la facturer.
De nombreux agents ajoutent leur propre couche de sécurité : Codex, par exemple, demande votre permission avant chaque appel d'outil.
Sous le capot : Les outils multimédias MCP
Pour les développeurs, voici les outils multimédias que l'agent appelle en coulisses :
| Outil | Facture des crédits ? | Ce qu'il fait |
|---|---|---|
| list_my_workspaces | Non | Liste les espaces de travail de l'équipe connectée |
| list_media_models / get_media_model | Non | Liste les modèles et lit les options et limites d'un modèle |
| create_media_upload | Non | Crée un emplacement d'importation d'une heure pour un fichier |
| estimate_image_generation / estimate_image_edit / estimate_video_generation | Non | Valide une demande et renvoie un devis |
| generate_image / generate_image_edit / generate_video | Oui | Soumet la tâche approuvée |
| get_generation_status / get_generation_result | Non | Suit la progression et renvoie les fichiers terminés et la facture |
La synchronisation labiale et les avatars parlants passent par generate_video. L'outil reconnaît la tâche grâce à ses entrées : une vidéo plus de l'audio signifie une synchronisation labiale, et un portrait plus de l'audio signifie un avatar. Les outils audio tels que text_to_speech, speech_to_text, search_voices, create_voice_clone, et les outils du Story Studio résident sur le même serveur.
Vous n'avez cependant jamais besoin d'appeler ces outils vous-même. En pratique, vous décrivez le résultat souhaité, et l'agent enchaîne les bons appels.
Exemples de prompts par cas d'utilisation
Voici quelques points de départ, regroupés par ce que vous créez :
| Cas d'utilisation | Ce que vous dites | Ce que fait l'agent |
|---|---|---|
| Actifs produit et application | « Génère une image 1:1 d'un mug en céramique sur un comptoir en marbre dans une douce lumière matinale. Donne-moi quelques variantes et montre le prix d'abord. » | Choisit un modèle d'image, chiffre le lot, génère après votre confirmation |
| Actifs produit et application | « Importe screenshot.png et remplace l'arrière-plan par un dégradé propre pour notre fiche App Store. Estime d'abord. » | Importe votre fichier, chiffre l'édition, l'applique après votre confirmation |
| Vidéo marketing et réseaux sociaux | « Fais une vidéo 9:16 de cinq secondes de baskets éclaboussant dans une flaque d'eau au ralenti. Devis en crédits, puis génère. » | Chiffre une tâche texte-vers-vidéo et renvoie un lien vidéo |
| Vidéo marketing et réseaux sociaux | « Transforme l'image que tu viens de générer en une courte vidéo avec un zoom avant lent. » | Réutilise l'image directement comme image de départ |
| Mise à jour et localisation vidéo | « Traduis ce script en espagnol, sonorise-le avec mon propre clone de voix, puis synchronise demo.mp4 sur l'audio espagnol avec Sync LipSync v2 Pro. Devis avant de générer. » | Traduit le script, génère la parole, importe la vidéo et chiffre la tâche de synchronisation labiale |
| Présentateurs et avatars | « Génère le portrait d'une présentatrice amicale dans un studio lumineux, puis fais-lui lire release-notes.md sous forme de vidéo d'avatar parlant 9:16 avec Creatify Aurora Avatar. » | Crée le portrait et le discours, puis chiffre la vidéo de l'avatar |
| Compte | « Combien de crédits Fish Audio me reste-t-il ? » | Vérifie votre solde |
Dans les agents de programmation comme Claude Code, Codex et Devin, ces outils fonctionnent aux côtés du terminal. L'agent peut générer par lots des images pour chaque produit d'un dossier, importer des enregistrements locaux ou rapatrier des fichiers terminés dans votre projet.
Plans, crédits et limites
Avant d'essayer, il est utile de savoir comment fonctionnent les crédits et quel plan est requis pour chaque capacité.
Quels crédits sont utilisés ?
La génération de médias via MCP utilise vos crédits de plan web Fish Audio, les mêmes que ceux que vous dépensez sur l'application web. Elle n'utilise pas les crédits d'API Développeur, qui constituent un solde distinct pour l'API Fish Audio. Les deux s'achètent à des endroits différents, il est donc important de savoir lequel recharger.
Pour ajouter des crédits web ou changer de plan, allez dans Équipe → Plans. Comme chaque connexion MCP est liée à l'équipe choisie lors de la connexion, les générations puisent dans les crédits de cette équipe.
De quel plan avez-vous besoin ?
Ce que votre agent peut générer dépend de votre plan. Les limites de plan sont vérifiées lorsque l'agent demande un devis. Ainsi, une tâche non couverte par votre plan est signalée avant même qu'on ne vous demande d'approuver quoi que ce soit.
- La génération, l'édition et la mise à l'échelle d'images sont disponibles avec le plan Gratuit, qui comprend une allocation quotidienne d'images.
- Lors de la génération d'images à partir de texte, chaque demande peut demander jusqu'à 2 images en Gratuit, 4 en Plus, et 8 en Pro et Max. Les modifications d'images renvoient une image par demande.
- La génération de vidéos, la synchronisation labiale et les avatars parlants nécessitent un plan Plus payant, Pro ou Max.
- Les tâches de vidéo, de synchronisation labiale et d'avatar renvoient un résultat par demande.
Si vous débutez avec le plan Gratuit, la génération d'images est le moyen le plus simple de tester le flux de travail. Lorsque vous serez prêt pour la vidéo, la synchronisation labiale ou les avatars parlants, passer au plan Plus payant ou supérieur les débloquera.
Tarifs
Chaque modèle a un prix différent, et le coût d'une tâche dépend également des paramètres choisis, tels que la résolution, la durée ou le nombre d'images. Plutôt que de vous fier à une liste de prix, demandez un devis à votre agent : c'est gratuit et cela reflète le prix actuel. Notez toutefois que la synthèse vocale est l'exception : elle est facturée à la longueur du texte et débitée dès son exécution.
Comme les devis ne coûtent rien, vous pouvez comparer quelques modèles ou paramètres pour la même idée et choisir celui qui correspond à votre budget avant que la tâche ne soit facturée.
Importation de fichiers
Certaines tâches commencent par vos propres fichiers : une image à éditer ou à animer, une vidéo pour la synchronisation labiale ou de l'audio pour un avatar. L'agent gère l'importation pour vous, dans ces limites :
- Images : JPEG, PNG ou WebP, jusqu'à 20 Mo
- Vidéo : MP4, MOV, WebM ou MKV, jusqu'à 1 Go
- Audio : MP3, WAV, M4A, AAC, OGG ou FLAC, jusqu'à 50 Mo
Les modèles individuels peuvent avoir des limites plus strictes. Par exemple, Creatify Aurora Avatar accepte de 1 à 60 secondes d'audio. L'agent lit les limites de chaque modèle avant de proposer un devis, et si un fournisseur rejette l'entrée après soumission, la tâche échouée est remboursée. Les résultats déjà générés dans le même espace de travail n'ont pas besoin d'être importés à nouveau ; l'agent les transmet directement.
Délais
Les images sont généralement prêtes en moins d'une minute. Les vidéos, la synchronisation labiale et les avatars peuvent prendre plusieurs minutes. Vous n'avez pas besoin de vérifier sans cesse : l'agent suit la progression de lui-même et renvoie un lien dès que le fichier est prêt.
Conclusion : Votre agent est désormais un studio multimédia
Les agents IA peuvent déjà planifier un lancement, rédiger la page de destination et déployer le code. Jusqu'à présent, les visuels étaient le point où la plupart s'arrêtaient : au mieux un seul modèle d'image intégré, tandis que la vidéo, la synchronisation labiale et les avatars parlants étaient renvoyés à une personne et à un outil séparé. Cette mise à jour comble cette lacune. Un seul MCP de génération d'images donne à votre agent la voix, les images, la vidéo, la synchronisation labiale et les avatars parlants, sans clés API à gérer et avec un devis avant chaque tâche multimédia.
Le changement le plus profond réside dans la manière dont ces éléments se connectent. Un script devient une voix, la voix devient un avatar parlant, et une image devient une vidéo, chaque étape transmettant son résultat à la suivante au lieu que des fichiers ne naviguent entre plusieurs applications. La voix est ce qui donne l'impression que quelqu'un vous parle réellement dans une vidéo, et c'est au cœur de ce que Fish Audio construit. En l'intégrant dans la même conversation que les images et la vidéo, votre agent peut porter une idée depuis quelques lignes de texte jusqu'à un clip finalisé.
À mesure que de nouveaux modèles sont ajoutés, ils apparaissent dans la liste de modèles en direct de votre agent, sans rien avoir à reconfigurer. La meilleure façon de voir ce que cela permet est de connecter le serveur et de demander quelque chose pour lequel vous ouvririez normalement trois outils différents.
Nouveau sur Fish Audio ? Inscrivez-vous gratuitement → Connectez le serveur MCP en moins d'une minute et commencez par la génération d'images, incluse dans le plan gratuit.
Prêt pour la vidéo, la synchronisation labiale et les avatars ? Voir les plans → Les plans Plus et supérieurs débloquent la génération de vidéos, la synchronisation labiale et les avatars parlants via MCP.
Questions Fréquemment Posées
Est-ce que Claude Code peut générer des images ?
Existe-t-il un MCP de génération vidéo pour Claude Code et Cursor ?
Ai-je besoin d'une clé API pour utiliser le serveur MCP Fish Audio ?
Est-ce qu'il utilise mes crédits d'API Développeur ?
L'agent peut-il dépenser des crédits sans me demander ?
Que se passe-t-il si une génération échoue ?
Puis-je utiliser l'audio généré avec la synthèse vocale Fish Audio pour la synchronisation labiale ou les avatars ?
Quels agents IA fonctionnent avec le serveur MCP Fish Audio ?
Sabrina is part of Fish Audio's support and marketing team, helping users get the most out of AI voice products while turning launches, updates, and customer insights into clear, practical content.
Lire plus de Sabrina Shu