Fish Audio pour les agents de codage IA : llms.txt, MCP et Skills
Fish Audio propose désormais trois interfaces natives conçues pour les agents IA — llms.txt pour la navigation, un serveur MCP de documentation pour la recherche d'API en direct, et des compétences (skills) Claude Code installables pour une génération de code privilégiant le mode hors ligne. Voici ce que chacune fait, pourquoi c'est important et comment les configurer en moins de cinq minutes.
Mai 2026 | Les outils d'agent Fish Audio sont désormais disponibles via llms.txt, MCP et Skills
La plupart des documentations pour développeurs sont écrites pour les humains. Elles supposent que vous ouvrez un navigateur, lisez un guide, copiez un extrait et revenez à votre éditeur. Ce flux de travail convient parfaitement lorsque vous travaillez seul. Il s'effondre dès lors que c'est votre agent de codage qui effectue la lecture.
Les agents de codage IA — Claude Code, Cursor, Codex, Windsurf et bien d'autres — ont besoin d'une documentation adaptée aux LLM sous une forme fondamentalement différente. Ils ne naviguent pas. Ils récupèrent. Ils ne survolent pas les titres ; ils analysent la structure. Et lorsqu'une fenêtre de contexte se remplit, une documentation non structurée devient un bruit qui évince le code.
Nous l'avons constaté par nous-mêmes. Les développeurs intégrant Fish Audio dans des pipelines de LLM rencontraient toujours le même type d'erreurs : des agents de codage générant du code d'authentification pour le mauvais endpoint, extrayant des identifiants de modèles obsolètes à partir des données d'entraînement, ou construisant des charges utiles WebSocket basées sur un schéma périmé. Le problème ne venait pas de l'API — c'était que les agents n'avaient aucun moyen fiable d'accéder à une documentation actuelle et structurée au moment de la génération.
Fish Audio propose désormais trois interfaces dédiées pour résoudre ce problème : llms.txt pour la navigation des agents IA, un serveur MCP de documentation pour la recherche de documentation en direct, et des Agent Skills pour une génération de code privilégiant le mode hors ligne. Fish Audio déploie ces trois fonctionnalités comme des outils de premier plan pour les développeurs — chacune étant utilisable indépendamment, et les trois étant conçues pour fonctionner ensemble comme une couche de documentation native pour tout flux de travail d'agent de codage.
Vous utilisez déjà Fish Audio ? Récupérez https://docs.fish.audio/llms.txt et pointez votre agent dessus dès maintenant — aucune configuration supplémentaire n'est requise. Commencer dans le Panneau Développeur →
llms.txt : Comment les agents IA naviguent dans votre documentation
Qu'est-ce que llms.txt ?
llms.txt est un standard ouvert émergent qui donne aux agents IA un index propre et structuré du contenu le plus important d'un site web. Défini sur llmstxt.org, le format est un fichier Markdown placé à la racine d'un domaine — une liste organisée de liens avec de courtes descriptions, classés par catégories pertinentes.
Considérez cela comme un robots.txt pour les LLM — sauf qu'au lieu de dire aux agents ce qu'ils doivent éviter, llms.txt leur indique exactement par où commencer. Fish Audio utilise llms.txt pour donner aux agents de codage un point d'entrée structuré et sans bruit dans sa documentation API.
La plupart des sites de documentation comptent des centaines de pages. Lorsqu'un agent de codage récupère l'intégralité d'un site de documentation sans guide, il gaspille les jetons de sa fenêtre de contexte sur du contenu non pertinent — entrées de journal des modifications, points de terminaison obsolètes, textes marketing. Un fichier llms.txt bien conçu filtre tout cela pour ne proposer qu'un ensemble de points d'entrée à fort signal, ce qui signifie des réponses plus rapides, des coûts de jetons réduits et une génération de code plus précise.
Le standard définit également llms-full.txt — une variante plus large qui inclut le contenu complet des pages pour les agents nécessitant un contexte plus profond. Les deux sont en Markdown simple, que tout LLM peut analyser sans aucun prétraitement.
Les fichiers llms.txt et llms-full.txt de Fish Audio
Fish Audio publie deux versions, toutes deux disponibles sans authentification :
docs.fish.audio/llms.txt — un index organisé et sans bruit en six catégories : Commencer ici, Spécifications API, API REST principale, SDK, Guides produits et Documentation opérationnelle. Le fichier s'ouvre sur un lien Quickstart Agent et un chemin direct vers le guide des agents de codage IA, afin que n'importe quel agent puisse s'orienter en une seule requête. Chaque lien pointe vers un fichier .md — pas du HTML — pour que les agents analysent le contenu directement sans avoir à nettoyer le balisage.
docs.fish.audio/llms-full.txt — une version plus complète qui inclut la référence complète des émotions, toutes les pages du SDK, chaque endpoint REST et WebSocket, ainsi que des guides étendus pour le clonage de voix, le streaming en temps réel et le contrôle des phonèmes en anglais, chinois et japonais.
Voici un exemple simplifié de llms.txt montrant la structure utilisée par Fish Audio :
# Fish Audio
> Index canonique de la documentation pour les API, SDK, modèles,
> clonage de voix, streaming en temps réel et auto-hébergement Fish Audio.
## Commencer ici
- [Agent Quickstart]: Point d'entrée à bruit minimal pour les agents IA
- [Quick Start]: Générez votre première voix IA en moins de 5 minutes
- [AI Coding Agents]: Connectez des assistants de codage via MCP
## API REST principale
- [Text to Speech Endpoint]: Convertir du texte en parole
- [Speech to Text Endpoint]: Transcrire de l'audio en texte
- [WebSocket TTS Streaming]: Streaming en temps réel via WebSocket
...
Le standard llms.txt a connu une adoption rapide dans l'écosystème des outils de développement et de l'infrastructure IA — avec des entreprises comme Anthropic Claude, Perplexity, Cloudflare, Vercel, Cursor, ElevenLabs et Coinbase publiant déjà leurs propres implémentations. Fish Audio propose une implémentation entièrement structurée via llms.txt, MCP et les compétences d'agent installables — chaque couche étant utilisable indépendamment et conçue pour fonctionner en synergie. La section "Commencer ici" est spécifiquement conçue pour offrir aux agents de codage un arbre de décision, et pas seulement une liste de liens.
Comment un agent l'utilise en pratique
Lorsque vous demandez à un agent de codage d'« implémenter le TTS Fish Audio en Python », un agent bien configuré récupère d'abord llms.txt, identifie les pages pertinentes (SDK Python, Endpoint TTS, Authentification), récupère ces pages en Markdown et génère du code à partir de la documentation actuelle — et non à partir de données d'entraînement qui pourraient dater de plusieurs mois.
C'est plus important qu'il n'y paraît. Les schémas d'API changent. Les identifiants de modèles deviennent obsolètes. La syntaxe des balises d'émotion évolue entre les générations de modèles. Sans une récupération de la documentation en direct, un agent génère du code par rapport à un instantané de l'API qui pourrait ne plus fonctionner.
L'approche par deux fichiers offre aux agents un chemin d'escalade naturel : commencer par llms.txt pour un index ciblé et économe en jetons ; passer à llms-full.txt lorsqu'une tâche nécessite un contexte plus approfondi comme la référence complète des émotions ou des comportements de streaming spécifiques.
Vous développez déjà avec Fish Audio ? Pointez votre agent de codage vers docs.fish.audio/llms.txt et arrêtez de générer des appels API obsolètes. Commencer dans le Panneau Développeur →
Docs MCP : Recherche d'API en temps réel pour les agents de codage
Qu'est-ce que MCP ?
MCP (Model Context Protocol) est un protocole ouvert qui permet aux agents de codage IA comme Claude Code et Cursor de récupérer la documentation en direct et des données externes pendant la génération de code — sans quitter l'éditeur.
Fish Audio utilise MCP pour exposer l'intégralité de sa documentation API comme une couche de récupération en temps réel à l'intérieur des agents de codage. Lorsque vous connectez le serveur MCP de Fish Audio, votre agent peut répondre à des questions telles que « quelles balises d'émotion Fish Audio prend-il en charge ? » ou « quelle est la limite de débit sur l'endpoint TTS ? » en récupérant la réponse actuelle dans la documentation publiée, plutôt qu'en se fiant à des données d'entraînement potentiellement périmées.
Configuration du serveur MCP Fish Audio
Le serveur MCP de la documentation Fish Audio est disponible à l'adresse https://docs.fish.audio/mcp. La configuration ne nécessite qu'une seule commande.
Configuration MCP : Tutoriel étape par étape
Le guide suivant utilise Claude Code comme exemple. Le serveur MCP de Fish Audio prend également en charge Cursor et Windsurf — consultez les liens de configuration spécifiques aux éditeurs ci-dessous.
Étape 1 — Exécutez la commande d'installation
Ouvrez votre terminal dans le répertoire de votre projet et exécutez :
claude mcp add --transport http fish-audio --scope project https://docs.fish.audio/mcp
Cela crée un fichier de configuration .mcp.json à la racine de votre projet. Le drapeau --scope project signifie que le serveur est disponible pour tous ceux qui travaillent directement sur ce projet.
Étape 2 — Vérifiez la connexion
claude mcp list
Vous devriez voir fish-audio dans la liste des serveurs configurés. S'il n'apparaît pas, vérifiez que vous exécutez la commande à l'intérieur d'un répertoire de projet.
Étape 3 — Testez-le
Demandez directement à Claude Code : « Quels modèles Fish Audio sont actuellement disponibles ? » ou « Comment puis-je m'authentifier auprès de l'API Fish Audio ? ». Si le serveur MCP est connecté, Claude Code récupérera la réponse dans la documentation en direct plutôt que de se fier aux données d'entraînement.
Problèmes courants :
Si le serveur n'apparaît pas dans la liste claude mcp list, confirmez que vous avez installé la dernière version de Claude Code. Si vous préférez que le serveur soit disponible pour tous vos projets plutôt qu'un seul, remplacez --scope project par --scope user.
Nouveau sur l'API Fish Audio ? Commencez par l'Introduction à l'API → pour comprendre l'authentification, les endpoints et les formats de réponse avant de connecter le serveur MCP.
Claude Code (référence rapide) :
claude mcp add --transport http fish-audio --scope project https://docs.fish.audio/mcp
Cela crée un fichier .mcp.json à la racine de votre projet. Vérifiez la connexion :
claude mcp list
# Vous devriez voir : fish-audio
Cursor : Configurez via la palette de commandes. Consulter le guide de configuration Cursor →
Windsurf : Configurez via File > Preferences > Windsurf Settings. Consulter le guide de configuration Windsurf →
Une fois connecté, votre agent de codage a un accès en temps réel à :
- La référence complète de l'API REST avec tous les paramètres et schémas de réponse
- Les guides des SDK Python et JavaScript avec des exemples fonctionnels
- Les meilleures pratiques pour le clonage de voix et le streaming en temps réel
- La comparaison des modèles et les tableaux de tarifs et limites de débit actuels
- Des guides de dépannage pour les problèmes d'intégration courants
Ce que vous pouvez demander une fois connecté
Le serveur MCP de Fish Audio est conçu pour les requêtes en langage naturel à l'intérieur de votre éditeur. Quelques exemples :
| Requête | Ce que l'agent récupère |
|---|---|
| « Comment m'authentifier avec Fish Audio ? » | Guide d'authentification des docs SDK Python ou JS |
| « Quelles balises d'émotion sont disponibles ? » | Référence complète des émotions — plus de 64 balises (Basique, Avancé, Ton, Effets audio) |
| « Montre-moi le code Python pour le streaming WebSocket » | Guide WebSocket TTS avec le protocole de streaming actuel |
| « Quelle est la différence entre S1 et S2 ? » | Aperçu des modèles avec comparaison des capacités — voir aussi : Fish Audio Open-Sources S2 → |
| « Comment cloner une voix ? » | Guide de clonage vocal avec les exigences pour l'audio de référence |
Étant donné que le serveur MCP utilise la récupération d'API en direct à partir de la documentation publiée, les réponses reflètent la dernière référence API disponible. Lorsque Fish Audio lance un nouveau modèle ou met à jour un endpoint, votre agent le voit dès la requête suivante.
Sécurité : Le serveur MCP fournit un accès en lecture seule à la documentation publique. Aucune clé API n'est transmise via la connexion. Toutes les requêtes utilisent HTTPS. Aucune requête ou donnée d'utilisation n'est stockée.
Vous n'utilisez pas encore Fish Audio ? Commencer gratuitement → — ajoutez le serveur MCP en moins de 30 secondes et générez des intégrations TTS fonctionnelles directement à partir de la documentation en direct.
Agent Skills : Instructions API privilégiant le mode hors ligne pour plus de 50 agents de codage
Que sont les Agent Skills ?
Les Agent Skills sont des ensembles d'instructions réutilisables pour les agents de codage — des fichiers SKILL.md structurés qui indiquent précisément à un agent comment gérer une tâche spécifique, sans nécessiter de récupération de documentation en direct au moment de la génération.
Chaque compétence contient un nom, une description et des instructions étape par étape que l'agent suit automatiquement lorsqu'une tâche correspondante se présente.
Les compétences sont installées dans le répertoire local des compétences de l'agent. Le chemin exact varie selon l'agent — par exemple, Claude Code utilise ~/.claude/skills/ globalement ou .claude/skills/ par projet. Une fois installée, l'agent lit la compétence sans aucune sollicitation supplémentaire. Aucun serveur MCP n'est requis. Aucun appel réseau au moment de la génération.
L'écosystème ouvert des compétences d'agent (maintenu par Vercel Labs) définit la spécification et propose une interface en ligne de commande (CLI) — npx skills — pour installer, mettre à jour et gérer les compétences. Il prend actuellement en charge plus de 50 agents, dont Claude Code, Codex, Cursor, Windsurf, OpenCode, Gemini CLI et GitHub Copilot.
Installation de la Skill Fish Audio
Fish Audio publie une Agent Skill prête à l'emploi qui couvre l'intégralité des API REST et WebSocket : authentification, chaque endpoint du schéma OpenAPI, règles d'encodage MessagePack vs JSON vs multipart, configuration de dialogues multi-locuteurs et protocole de streaming WebSocket.
npx skills add https://docs.fish.audio --skill fish-audio-api
La compétence est installée dans le répertoire local de votre agent. Une fois installée, essayez de demander à votre agent de codage :
- « Appelle l'API TTS de Fish Audio avec curl »
- « Streame du TTS via WebSocket en Python »
- « Configure un dialogue multi-locuteurs avec des balises d'émotion comme [happy] et [sad] »
- « Génère de la parole avec S2 en utilisant un style [whispering] »
Pour la liste complète des balises d'émotion prises en charge et les contrôles de débit avancés, consultez le Guide de contrôle granulaire Fish Audio S2 →
Vous construisez un projet avec plusieurs personnages ? Consultez Synthèse vocale avec plusieurs voix → pour un guide de configuration pratique.
La compétence fournit les conventions — l'agent les suit sans avoir à récupérer la documentation au préalable.
Pour installer pour un agent spécifique :
# Claude Code uniquement
npx skills add https://docs.fish.audio --skill fish-audio-api -a claude-code
# Codex uniquement
npx skills add https://docs.fish.audio --skill fish-audio-api -a codex
# Tous les agents détectés à la fois
npx skills add https://docs.fish.audio --skill fish-audio-api --all
Exécutez npx skills --help pour la liste complète des drapeaux d'agents pris en charge.
MCP vs Skills : Lequel devriez-vous utiliser ?
Les deux outils améliorent la précision de votre agent de codage avec Fish Audio. Ils sont optimisés pour différents scénarios.
| MCP | Agent Skills | |
|---|---|---|
| Fraîcheur de la documentation | Toujours à jour — récupère en direct | Fixée au moment de l'installation — exécutez npx skills update pour rafraîchir |
| Réseau requis | Oui | Non — fonctionne entièrement hors ligne après installation |
| Idéal pour | Questions ouvertes, exploration de nouvelles fonctionnalités, débogage de cas limites | Tâches répétitives, génération de code standardisée, environnements CI/CD |
| Configuration | Une commande mcp add | Une commande npx skills add |
| Compatible avec | Claude Code, Cursor, Windsurf | Plus de 50 agents incluant Claude Code, Codex, Cursor, Windsurf, Gemini CLI |
La règle pratique : utilisez MCP pour la recherche de documentation en direct et les requêtes exploratoires. Utilisez les compétences pour une génération de code fiable et hors ligne sur des modèles connus.
Dans la plupart des configurations de production, l'utilisation des deux est logique. La compétence gère les modèles standard — authentification, appels TTS de base, configuration WebSocket — sans aller-retour réseau. MCP gère les questions que vous n'aviez pas anticipées : nouveaux paramètres de modèle, limites de débit mises à jour, cas particuliers dans le protocole de streaming.
Pourquoi les documentations traditionnelles ne suffisent pas pour les agents IA
La documentation API traditionnelle est optimisée pour la navigation humaine. Les agents de codage IA ont besoin d'autre chose : des index structurés, du Markdown sans bruit et des chemins de récupération en direct qui réduisent les générations obsolètes et le gaspillage de jetons de contexte.
La plupart des documentations API ont été conçues pour un flux de travail spécifique : un développeur ouvre un navigateur, recherche l'endpoint dont il a besoin, lit la page et copie un extrait. Ce flux a bien fonctionné pendant des années.
L'hypothèse sous-jacente — que le lecteur est un humain avec un navigateur — mérite désormais d'être examinée. Les agents de codage IA n'utilisent pas de navigateurs. Ils récupèrent le contenu brut, l'analysent et génèrent du code à partir de ce qu'ils extraient. L'infrastructure qui rend les docs lisibles pour les humains — menus de navigation, barres de recherche, HTML rendu, médias intégrés — ajoute de la friction pour les agents plutôt que de l'éliminer.
Quelques schémas spécifiques causent le plus de problèmes :
Le HTML comme format principal. Les agents peuvent techniquement analyser le HTML, mais il contient une grande quantité de balisage structurel non pertinent pour la tâche — balises de mise en page, scripts, éléments de navigation. Une page de 10 000 caractères HTML peut ne contenir que 2 000 caractères de documentation réelle. Cet écart a un coût réel lorsque les fenêtres de contexte sont limitées.
Pas de point d'entrée clair. Un site de documentation de 200 pages ne donne aucun signal à un agent sur par où commencer. Sans index structuré, les agents récupèrent soit trop de contenu (gaspillage de jetons), soit les mauvaises pages (génération de code incorrect).
Un contenu qui vieillit mal. Les identifiants de modèles, les chemins d'endpoints et les noms de paramètres changent. Une documentation qui n'a pas de signal clair de versionnage ou d'obsolescence amène les agents à générer du code selon des spécifications qui ne sont plus exactes.
Rien de tout cela n'est une critique de la façon dont la documentation a été construite — elle a été conçue pour le bon public à l'époque. La question pratique aujourd'hui est la suivante : alors que les agents de codage IA deviennent une part importante de la façon dont les développeurs interagissent avec les API, votre documentation pour agents IA fonctionne-t-elle pour les deux publics ?
Le llms.txt, le serveur MCP et les Agent Skills de Fish Audio sont notre réponse à cette question — trois couches qui permettent à la même documentation de fonctionner à la fois comme une documentation API lisible par l'homme et une documentation lisible par l'IA pour les LLM et les agents de codage.
Vue d'ensemble : comment les trois collaborent
Voici à quoi ressemble la configuration complète à trois couches dans un flux de travail réel :
-
L'agent ouvre votre projet et rencontre une tâche Fish Audio. Il récupère d'abord
llms.txt— obtenant une carte structurée de toute la documentation disponible adaptée aux LLM avant de récupérer des pages individuelles. Coût en jetons : minimal. Temps d'orientation : une seule requête. -
L'agent génère du code. Si la compétence fish-audio-api est installée, il s'appuie sur les conventions de la compétence pour l'authentification, le format d'encodage et le protocole de streaming — aucune récupération de documentation n'est requise pour les schémas standard. Le résultat correspond à la spécification de l'API dès la première génération.
-
L'agent doit vérifier quelque chose de spécifique — un identifiant de modèle actuel, une limite de débit, une syntaxe de balise d'émotion pour S2. Il interroge le serveur MCP et obtient la réponse directement à partir de la documentation publiée — réduisant le risque de générations périmées ou incorrectes.
Le résultat est un agent de codage qui génère des intégrations Fish Audio précises dès la première tentative, avec moins de corrections et sans avoir à deviner si un endpoint ou un identifiant de modèle a changé depuis son entraînement.
Déployez des fonctionnalités vocales plus rapidement avec une documentation native pour les agents. Installez la compétence Fish Audio une fois et réutilisez des modèles TTS sûrs pour la production dans chaque projet. Connectez le serveur MCP et laissez votre agent de codage lire la documentation lui-même.
Configurer MCP → · Installer la Skill → · Commencer dans le Panneau Développeur →
Questions Fréquemment Posées
Est-ce que Claude Code prend en charge MCP nativement ?
Cursor et Windsurf peuvent-ils lire llms.txt automatiquement ?
Quelle est la différence entre MCP et une référence API standard ?
Ai-je besoin des trois — llms.txt, MCP et la compétence ?
Quels agents de codage prennent en charge le serveur MCP Fish Audio ?
Est-ce que l'Agent Skill fonctionne avec d'autres agents que Claude Code ?
Est-ce que MCP expose ma clé API Fish Audio ?
Quelle est la différence entre llms.txt et llms-full.txt ?
Comment fonctionnent les balises d'émotion dans Fish Audio ?
Comment garder la compétence à jour ?
Sabrina is part of Fish Audio's support and marketing team, helping users get the most out of AI voice products while turning launches, updates, and customer insights into clear, practical content.
Lire plus de Sabrina Shu