Fish Audio для AI-агентов программирования: llms.txt, MCP и навыки (Skills)
Fish Audio теперь предлагает три нативных интерфейса, созданных для ИИ-агентов: llms.txt для навигации, сервер Docs MCP для поиска API в реальном времени и устанавливаемые навыки (skills) Claude Code для генерации кода с приоритетом офлайн-работы. Вот что делает каждый из них, почему это важно и как настроить их менее чем за пять минут.
Май 2026 | Инструментарий Fish Audio для агентов теперь доступен через llms.txt, MCP и Skills
Большая часть документации для разработчиков написана для людей. Предполагается, что вы откроете браузер, прочитаете руководство, скопируете фрагмент кода и вернетесь в редактор. Этот рабочий процесс хорош, когда вы работаете в одиночку. Он ломается в тот момент, когда чтением занимается ваш агент программирования.
AI-агентам для программирования — Claude Code, Cursor, Codex, Windsurf и многим другим — документация нужна в фундаментально ином виде, удобном для LLM. Они не просматривают страницы, они извлекают данные. Они не пробегают глазами заголовки, они анализируют структуру. И когда окно контекста заполняется, неструктурированная документация превращается в шум, вытесняющий сам код.
Мы видели это на практике. Разработчики, интегрирующие Fish Audio в конвейеры LLM, постоянно сталкивались с одними и теми же ошибками: агенты генерировали код аутентификации для неправильной конечной точки, брали устаревшие ID моделей из обучающих данных или создавали полезную нагрузку WebSocket на основе устаревшей схемы. Проблема была не в API, а в том, что у агентов не было надежного способа получить доступ к актуальной структурированной документации во время генерации.
Fish Audio теперь предоставляет три специализированных интерфейса для решения этой проблемы: llms.txt для навигации ИИ-агентов, сервер Docs MCP для поиска документации в реальном времени и Agent Skills для генерации кода в режиме «офлайн прежде всего». Fish Audio выпускает все три как первоклассные функции для разработчиков — каждая из них может использоваться независимо, и все три разработаны для совместной работы в качестве нативного слоя документации для любого рабочего процесса с AI-агентами.
Уже используете Fish Audio? Загрузите https://docs.fish.audio/llms.txt и направьте своего агента на него прямо сейчас — никакой дополнительной настройки не требуется. Начните работу в панели разработчика →
llms.txt: Как ИИ-агенты ориентируются в вашей документации
Что такое llms.txt?
llms.txt — это новый открытый стандарт, который предоставляет ИИ-агентам чистый, структурированный индекс наиболее важного контента веб-сайта. Определенный на llmstxt.org, этот формат представляет собой Markdown-файл, размещенный в корне домена — курируемый список ссылок с краткими описаниями, организованный по смысловым категориям.
Думайте об этом как о robots.txt для LLM — только вместо того, чтобы говорить агентам, чего избегать, llms.txt точно указывает им, с чего начать. Fish Audio использует llms.txt, чтобы предоставить агентам программирования структурированную точку входа в документацию API с низким уровнем шума.
Большинство сайтов документации содержат сотни страниц. Когда агент загружает весь сайт целиком, он тратит токены окна контекста на неактуальный контент: записи в журнале изменений, устаревшие эндпоинты, маркетинговые тексты. Продуманный llms.txt фильтрует это до набора высокосигнальных точек входа, что означает более быстрые ответы, меньшие затраты на токены и более точную генерацию кода.
Стандарт также определяет llms-full.txt — более широкий вариант, включающий полное содержание страниц для агентов, которым нужен глубокий контекст. Оба файла представляют собой обычный Markdown, который любая LLM может обработать без предварительной подготовки.
Fish Audio llms.txt и llms-full.txt
Fish Audio публикует две версии, обе доступны без аутентификации:
docs.fish.audio/llms.txt — курируемый индекс с низким уровнем шума, организованный в шесть категорий: С чего начать, Спецификации API, Основной REST API, SDK, Руководства по продукту и Операционная документация. Файл открывается ссылкой Agent Quickstart и прямым путем к руководству по AI Coding Agents, чтобы любой агент мог сориентироваться за один запрос. Каждая ссылка указывает на .md файл, а не на HTML, поэтому агенты анализируют содержимое напрямую.
docs.fish.audio/llms-full.txt — расширенная версия, включающая полный справочник эмоций, все страницы SDK, каждый эндпоинт REST и WebSocket, а также подробные руководства по клонированию голоса, потоковой передаче в реальном времени и управлению фонемами для английского, китайского и японского языков.
Вот упрощенный пример llms.txt, показывающий структуру, которую использует Fish Audio:
# Fish Audio
> Канонический индекс документации для API, SDK, моделей Fish Audio,
> клонирования голоса, потоковой передачи в реальном времени и селф-хостинга.
## С чего начать
- [Agent Quickstart]: Точка входа с минимальным шумом для ИИ-агентов
- [Quick Start]: Создайте свой первый ИИ-голос менее чем за 5 минут
- [AI Coding Agents]: Подключение помощников по кодингу через MCP
## Основной REST API
- [Text to Speech Endpoint]: Преобразование текста в речь
- [Speech to Text Endpoint]: Транскрибация аудио в текст
- [WebSocket TTS Streaming]: Потоковая передача в реальном времени через WebSocket
...
Стандарт llms.txt быстро внедряется в инструментах для разработчиков и ИИ-инфраструктуре — такие компании, как Anthropic Claude, Perplexity, Cloudflare, Vercel, Cursor, ElevenLabs и Coinbase, уже опубликовали свои реализации. Fish Audio предлагает полностью структурированную реализацию через llms.txt, MCP и устанавливаемые навыки агента — каждый уровень может использоваться независимо и разработан для совместной работы. Раздел «С чего начать» специально создан, чтобы дать агентам дерево принятия решений, а не просто список ссылок.
Как агент использует это на практике
Когда вы просите агента «реализовать Fish Audio TTS на Python», правильно настроенный агент сначала загружает llms.txt, определяет нужные страницы (Python SDK, эндпоинт TTS, аутентификация), извлекает их в формате Markdown и генерирует код на основе актуальной документации, а не на базе обучающих данных, которые могут быть устаревшими.
Это важнее, чем кажется. Схемы API меняются. ID моделей устаревают. Синтаксис тегов эмоций эволюционирует между поколениями моделей. Без загрузки живой документации агент генерирует код по слепку API, который может уже не работать.
Подход с двумя файлами дает агентам естественный путь эскалации: начать с llms.txt для сфокусированного индекса; перейти к llms-full.txt, когда задача требует более глубокого контекста, например, полного справочника эмоций или нюансов потоковой передачи.
Уже разрабатываете с Fish Audio? Направьте своего агента на docs.fish.audio/llms.txt и перестаньте генерировать устаревшие вызовы API. Начните работу в панели разработчика →
Docs MCP: Поиск API в реальном времени для агентов
Что такое MCP?
MCP (Model Context Protocol) — это открытый протокол, который позволяет ИИ-агентам, таким как Claude Code и Cursor, извлекать актуальную документацию и внешние данные во время написания кода, не выходя из редактора.
Fish Audio использует MCP для предоставления всей своей документации API в качестве слоя извлечения данных в реальном времени. Когда вы подключаете сервер Fish Audio MCP, ваш агент может отвечать на вопросы типа «какие теги эмоций поддерживает Fish Audio?» или «какой лимит запросов у эндпоинта TTS?», извлекая актуальный ответ из опубликованной документации.
Настройка сервера Fish Audio MCP
Сервер Fish Audio Docs MCP доступен по адресу https://docs.fish.audio/mcp. Настройка занимает одну команду.
Настройка MCP: Пошаговое руководство
В следующем примере используется Claude Code. Сервер MCP от Fish Audio также поддерживает Cursor и Windsurf — ссылки на настройки для конкретных редакторов приведены ниже.
Шаг 1 — Запустите команду установки
Откройте терминал в директории вашего проекта и выполните:
claude mcp add --transport http fish-audio --scope project https://docs.fish.audio/mcp
Это создаст конфигурационный файл .mcp.json в корне вашего проекта. Флаг --scope project означает, что сервер будет доступен всем, кто работает напрямую над этим проектом.
Шаг 2 — Проверьте соединение
claude mcp list
Вы должны увидеть fish-audio в списке настроенных серверов. Если он не появился, убедитесь, что вы запускаете команду внутри директории проекта.
Шаг 3 — Протестируйте
Спросите Claude Code напрямую: «Какие модели Fish Audio доступны на данный момент?» или «Как мне пройти аутентификацию в API Fish Audio?». Если сервер MCP подключен, Claude Code извлечет ответ из живой документации.
Общие проблемы:
Если сервер не появляется в claude mcp list, убедитесь, что у вас установлена последняя версия Claude Code. Если вы хотите, чтобы сервер был доступен во всех ваших проектах, замените --scope project на --scope user.
Впервые работаете с API Fish Audio? Начните с Введения в API →, чтобы понять принципы аутентификации, эндпоинты и форматы ответов перед подключением сервера MCP.
Claude Code (быстрая справка):
claude mcp add --transport http fish-audio --scope project https://docs.fish.audio/mcp
Это создает файл .mcp.json в корне вашего проекта. Проверьте соединение:
claude mcp list
# Вы должны увидеть: fish-audio
Cursor: Настраивается через палитру команд. См. руководство по настройке Cursor →
Windsurf: Настраивается через File > Preferences > Windsurf Settings. См. руководство по настройке Windsurf →
После подключения ваш агент получает доступ в реальном времени к:
- Полному справочнику REST API со всеми параметрами и схемами ответов
- Руководствам по SDK для Python и JavaScript с примерами
- Лучшим практикам клонирования голоса и потоковой передачи
- Таблицам сравнения моделей, цен и лимитов
- Руководствам по устранению распространенных проблем интеграции
Что можно спросить после подключения
Сервер Fish Audio MCP предназначен для запросов на естественном языке внутри вашего редактора. Несколько примеров:
| Запрос | Что извлекает агент |
|---|---|
| «Как пройти аутентификацию в Fish Audio?» | Руководство по аутентификации из документации Python или JS SDK |
| «Какие теги эмоций доступны?» | Полный справочник эмоций — все 64+ тега в категориях Basic, Advanced, Tone и Audio Effect |
| «Покажи код на Python для потоковой передачи через WebSocket» | Руководство по WebSocket TTS с актуальным протоколом потоковой передачи |
| «В чем разница между S1 и S2?» | Обзор моделей с поиском сравнения возможностей — см. также: Fish Audio открывает исходный код S2 → |
| «Как мне клонировать голос?» | Руководство по клонированию голоса с требованиями к эталонному аудио |
Поскольку сервер MCP использует извлечение данных в реальном времени, ответы отражают самые свежие изменения. Когда Fish Audio выпускает новую модель или обновляет эндпоинт, ваш агент увидит это при следующем запросе.
Безопасность: Сервер MCP предоставляет доступ только для чтения к публичной документации. Ключи API не передаются через соединение. Все запросы используют HTTPS. Никакие запросы или данные об использовании не сохраняются.
Еще не используете Fish Audio? Начните бесплатно → — добавьте сервер MCP менее чем за 30 секунд и генерируйте работающие интеграции TTS прямо из живой документации.
Agent Skills: офлайн-инструкции к API для 50+ агентов
Что такое Agent Skills?
Agent Skills (навыки агента) — это наборы инструкций многократного использования для ИИ-агентов. Это структурированные файлы SKILL.md, которые точно говорят агенту, как выполнять ту или иную задачу, не требуя обращения к онлайн-документации в момент генерации.
Каждый навык содержит имя, описание и пошаговые инструкции, которым агент следует автоматически при возникновении соответствующей задачи.
Навыки устанавливаются в локальную директорию навыков агента. Точный путь зависит от агента — например, Claude Code использует ~/.claude/skills/ глобально или .claude/skills/ для конкретного проекта. После установки агент считывает навык без дополнительных подсказок. Сервер MCP не требуется. Сетевой вызов во время генерации не нужен.
Открытая экосистема навыков агентов (поддерживаемая Vercel Labs) определяет спецификацию и предоставляет CLI — npx skills — для установки, обновления и управления навыками. В настоящее время она поддерживает более 50 агентов, включая Claude Code, Codex, Cursor, Windsurf, OpenCode, Gemini CLI и GitHub Copilot.
Установка навыка Fish Audio
Fish Audio публикует готовый навык Agent Skill, охватывающий весь REST и WebSocket API: аутентификацию, каждый эндпоинт в схеме OpenAPI, правила кодирования MessagePack vs JSON vs multipart, настройку диалогов с несколькими дикторами и протокол потоковой передачи WebSocket.
npx skills add https://docs.fish.audio --skill fish-audio-api
Навык устанавливается в локальную директорию вашего агента. После установки попробуйте спросить своего агента:
- «Вызови Fish Audio TTS API с помощью curl»
- «Сделай потоковую передачу TTS через WebSocket на Python»
- «Настрой диалог с несколькими дикторами и тегами эмоций, такими как [happy] и [sad]»
- «Сгенерируй речь с помощью S2, используя стиль [whispering]»
Полный список поддерживаемых тегов эмоций и расширенных средств управления речью см. в руководстве Fish Audio S2 по детальному управлению →
Создаете проект с несколькими персонажами? Посмотрите Text to Speech с несколькими голосами → — практическое руководство по настройке.
Навык предоставляет соглашения — агент следует им, не обращаясь предварительно к документации.
Для установки для конкретного агента:
# Только для Claude Code
npx skills add https://docs.fish.audio --skill fish-audio-api -a claude-code
# Только для Codex
npx skills add https://docs.fish.audio --skill fish-audio-api -a codex
# Для всех обнаруженных агентов сразу
npx skills add https://docs.fish.audio --skill fish-audio-api --all
Запустите npx skills --help для получения полного списка флагов поддерживаемых агентов.
MCP или Skills: Что использовать?
Оба инструмента делают работу вашего агента с Fish Audio более точной. Они оптимизированы для разных сценариев.
| MCP | Agent Skills | |
|---|---|---|
| Актуальность документации | Всегда актуальна — загружается в реальном времени | Фиксируется в момент установки — запустите npx skills update для обновления |
| Требуется интернет | Да | Нет — после установки работает полностью офлайн |
| Лучше всего для | Свободных вопросов, изучения новых функций, отладки сложных случаев | Повторяющихся задач, стандартизированной генерации кода, сред CI/CD |
| Настройка | Одна команда mcp add | Одна команда npx skills add |
| Работает в | Claude Code, Cursor, Windsurf | 50+ агентов, включая Claude Code, Codex, Cursor, Windsurf, Gemini CLI |
Практическое правило: используйте MCP для поиска по живой документации и исследовательских запросов. Используйте навыки (skills) для надежной офлайн-генерации кода по известным шаблонам.
В большинстве рабочих сред имеет смысл использовать оба инструмента. Навык обрабатывает стандартные паттерны — аутентификацию, базовые вызовы TTS, настройку WebSocket — без лишних сетевых запросов. MCP обрабатывает вопросы, которые вы не предусмотрели: новые параметры моделей, обновленные лимиты, нюансы протокола потоковой передачи.
Почему традиционная документация не подходит для ИИ-агентов
Традиционная документация API оптимизирована для просмотра человеком. ИИ-агентам нужно нечто иное: структурированные индексы, чистый Markdown и пути извлечения в реальном времени, которые уменьшают количество устаревших генераций и лишних трат токенов.
Большая часть документации была разработана для определенного процесса: разработчик открывает браузер, ищет нужный эндпоинт, читает страницу и копирует фрагмент кода. Эта схема работала годами.
Лежащее в ее основе предположение — что читателем является человек с браузером — теперь стоит пересмотреть. ИИ-агенты не используют браузеры. Они извлекают необработанный контент, анализируют его и генерируют код. Инфраструктура, которая делает документацию удобной для людей (меню навигации, строки поиска, отрисованный HTML, встроенные медиа), создает для агентов скорее трение, чем удобство.
Несколько конкретных проблемных моментов:
HTML как основной формат. Агенты технически могут анализировать HTML, но он содержит огромное количество структурной разметки, не относящейся к задаче: теги макета, скрипты, элементы навигации. Страница из 10 000 символов HTML может содержать лишь 2 000 символов реальной документации. Этот разрыв обходится дорого при ограниченных окнах контекста.
Отсутствие четкой точки входа. Сайт документации с 200 страницами не дает агенту сигнала, с чего начать. Без структурированного индекса агенты либо загружают слишком много контента (тратя токены), либо загружают не те страницы (генерируя неверный код).
Контент, который быстро устаревает. ID моделей, пути эндпоинтов и имена параметров меняются. Документация без четких сигналов о версии или устаревании заставляет агентов генерировать код по спецификациям, которые могут быть уже неточными.
Это не критика того, как строилась документация — она создавалась для правильной аудитории в свое время. Практический вопрос сейчас таков: когда AI-агенты становятся важной частью взаимодействия разработчиков с API, работает ли ваша документация для обеих аудиторий?
llms.txt, сервер MCP и Agent Skills от Fish Audio — это наш ответ на этот вопрос: три уровня, которые заставляют одну и ту же документацию работать и как удобную для человека справку, и как пригодные для чтения ИИ данные для LLM и агентов программирования.
Полная картина: Как все три уровня работают вместе
Вот как выглядит полная трехуровневая настройка в реальном рабочем процессе:
-
Агент открывает ваш проект и сталкивается с задачей Fish Audio. Сначала он загружает
llms.txt, получая структурированную карту всей доступной документации в формате, удобном для LLM, прежде чем извлекать отдельные страницы. Затраты токенов: минимальны. Время ориентации: один запрос. -
Агент генерирует код. Если навык fish-audio-api установлен, он опирается на соглашения навыка по аутентификации, формату кодирования и протоколу потоковой передачи — для стандартных паттернов загрузка документации не требуется. Результат соответствует спецификации API с первой попытки.
-
Агенту нужно проверить что-то специфическое — текущий ID модели, лимит запросов, синтаксис тега эмоций для S2. Он запрашивает сервер MCP и получает ответ напрямую из опубликованной документации, что снижает риск создания устаревшего или неверного кода.
В результате вы получаете агента, который создает точные интеграции с Fish Audio с первой попытки, без бесконечных исправлений и гаданий о том, изменился ли эндпоинт или ID модели с момента его обучения.
Внедряйте голосовые функции быстрее с документацией, нативной для агентов. Установите навык Fish Audio один раз и используйте проверенные шаблоны TTS в каждом проекте. Подключите сервер MCP, и пусть ваш агент сам читает документацию.
Настроить MCP → · Установить Skill → · Начать работу в панели разработчика →
Часто задаваемые вопросы
Поддерживает ли Claude Code MCP нативно?
Могут ли Cursor и Windsurf читать llms.txt автоматически?
В чем разница между MCP и обычным справочником API?
Нужны ли мне все три инструмента — llms.txt, MCP и навык (skill)?
какие агенты поддерживают сервер MCP от Fish Audio?
Работает ли Agent Skill с другими агентами, кроме Claude Code?
Раскрывает ли MCP мой API-ключ Fish Audio?
В чем разница между llms.txt и llms-full.txt?
Как работают теги эмоций в Fish Audio?
Как поддерживать навык (skill) в актуальном состоянии?
Sabrina is part of Fish Audio's support and marketing team, helping users get the most out of AI voice products while turning launches, updates, and customer insights into clear, practical content.
Читать больше от Sabrina Shu