MCP для генерации изображений, видео и синхронизации губ — Fish Audio
MCP-сервер Fish Audio теперь генерирует и редактирует изображения, создает видео, синхронизирует движения губ с новым звуком и превращает портреты в говорящих аватаров — прямо в Claude Code, Claude.ai, Cursor, Codex, Windsurf и Devin. Одна авторизация, десятки моделей и расчет стоимости перед каждым заданием по созданию изображений, видео, синхронизации губ или аватаров.
Октябрь 2026 | MCP Fish Audio теперь поддерживает генерацию изображений, видео и синхронизацию губ
Если вы попросите своего ИИ-агента для написания кода сделать снимок продукта, пятисекундный тизер или видео с говорящим диктором, вы, скорее всего, столкнетесь с трудностями. Некоторые агенты вообще не умеют создавать изображения, другие предлагают одну встроенную модель, а видео почти никогда не поддерживается. Обычное решение — использовать отдельный MCP-сервер для генерации изображений, но большинство из них подключают только одну модель и требуют создания и вставки отдельного ключа API для каждого провайдера.
Fish Audio выбирает другой путь. То же самое MCP-подключение, которое ваш агент уже использует для преобразования текста в речь, транскрибации и голосового поиска, теперь может генерировать и редактировать изображения, создавать видео, синхронизировать губы с новым аудио и превращать портрет в говорящего аватара. Вы авторизуетесь один раз, выбираете из десятков моделей для изображений, видео и синхронизации губ, и подтверждаете стоимость перед тем, как с вас будет списана оплата за любое задание по созданию изображений, видео, синхронизации губ или аватаров.
Поскольку голосовые инструменты находятся на том же сервере, ваш агент может делать то, что не под силу узкоспециализированным MCP: написать сценарий, озвучить его с помощью Fish Audio и передать это аудио напрямую в модель говорящего аватара — и все это в рамках одного диалога.
Уже подключены к MCP-серверу Fish Audio? Обновление не требуется. Попросите вашего агента «list the Fish Audio media models» (вывести список медиа-моделей Fish Audio), и новые инструменты будут готовы к использованию.
Впервые в Fish Audio? Зарегистрируйтесь бесплатно → и подключитесь к своему агенту менее чем за минуту.
Что нового в MCP-сервере Fish Audio
Начнем с того, что добавляет это обновление. С ним MCP-сервер Fish Audio работает как MCP для генерации изображений, видео и инструмент для синхронизации губ в одном флаконе. Новые медиа-инструменты расположены рядом с существующими аудио-инструментами и используют те же кредиты, что и веб-приложение Fish Audio.
Почему одно подключение лучше, чем отдельный MCP для каждой модели?
- Не нужно собирать API-ключи. Вы входите в систему под своей учетной записью Fish Audio. Вам не нужно запрашивать ключ провайдера, вставлять его в файл конфигурации или периодически обновлять.
- Единый баланс. Каждая модель расходует кредиты вашего тарифного плана Fish Audio, поэтому переход от модели изображений к видео-модели не означает пополнение другого счета.
- Смена модели — это одна фраза, а не настройка. Запросите другую модель простым текстом, и агент сам найдет доступные варианты и рассчитает стоимость нового задания.
Вот что ваш агент умеет теперь:
| Возможность | Что вы ему даете | Доступные модели включают |
|---|---|---|
| Текст в изображение | Промпт | GPT Image 2, GPT Image 2.5 (Flare и Sunburst), Seedream 4.5 и 5.0, модели Nano Banana |
| Редактирование и апскейлинг | Изображение + инструкции | Модели выше, плюс Topaz HD для апскейлинга |
| Текст в видео и изображение в видео | Промпт, опционально начальное фото | Seedance, Kling, Veo 3.1, MiniMax H3, WAN 3.0, Gemini Omni Flash |
| Синхронизация губ (на базе видео) | Видео + новое аудио | Sync LipSync v3, Sync LipSync v2 Pro, PixVerse Lip Sync, Veed Lip Sync |
| Говорящие аватары (на базе фото) | Портрет + аудио | Creatify Aurora Avatar, HeyGen Avatar 4, Veed Fabric 1.0 Avatar, Infinitalk Avatar |
Список моделей со временем меняется. Ваш агент всегда работает с актуальным списком, поэтому он видит новые модели сразу после их добавления.
Генерация, редактирование и апскейлинг изображений доступны на бесплатном тарифе (Free). Генерация видео, синхронизация губ и говорящие аватары требуют платного тарифа Plus или выше.
Генерация, редактирование и апскейлинг изображений
Опишите изображение, и агент выберет модель, изучит её параметры, такие как соотношение сторон, разрешение и качество, а затем назовет стоимость. Чтобы отредактировать, дайте ему изображение и инструкцию, например: «сохрани объект, но измени фон на теплый закат». Изображения обычно создаются менее чем за минуту, и вы можете запрашивать несколько штук сразу в зависимости от вашего тарифа.
Генерация видео из текста, изображений или референсного видео
Инструменты для работы с видео превращают MCP-сервер в мощный инструмент генерации видео для любого агента, поддерживающего удаленные MCP-серверы. Начните с текстового промпта, анимируйте статичное изображение или — в моделях, которые это поддерживают — направьте результат с помощью референсного медиафайла. Параметры соотношения сторон, разрешения и длительности зависят от модели, и агент считывает их перед расчетом стоимости. Создание видео может занять несколько минут; агент сам проверяет прогресс и возвращает ссылку, когда файл готов.
Синхронизация губ и говорящие аватары
Обе эти возможности заставляют человека на экране произносить новую аудиодорожку. Разница лишь в том, с чего вы начинаете: с готового видео или с одной фотографии.
На базе видео: пересинхронизация существующего материала. Дайте модели видео говорящего человека и новую аудиодорожку, и она изменит движения рта в соответствии с новым звуком. Это создано для обновления уже имеющегося контента: изменения реплики в рекламном ролике, исправления ошибки без пересъемки или локализации видео с диктором на другой язык. Эти модели работают только с видео и аудио и не принимают текстовые промпты.
На базе изображения: анимация портрета. Дайте модели один портрет и аудиофайл, и она анимирует лицо, голову и мимику в такт речи. Creatify Aurora Avatar также принимает опциональный промпт для управления кадрированием, фоном и освещением, в то время как Infinitalk Avatar требует промпт и создает более экспрессивный образ.
Используйте материалы, на которые у вас есть права. Перед каждым заданием по синхронизации губ или созданию аватара в сообщении-подтверждении напоминается о необходимости использовать только те видео, портреты и голоса, на использование которых у вас есть разрешение.
Каждый из этих инструментов полезен сам по себе. Но главное преимущество проявляется тогда, когда они работают вместе.
От сценария до говорящего аватара в одном диалоге
Именно здесь наличие инструментов для работы с голосом и видео на одном MCP-сервере дает свои плоды. Большинство инструментов для создания аватаров предполагают, что у вас уже есть готовое аудио. С Fish Audio ваш агент может сам создать аудио и передать его напрямую в модель аватара.
Вот как это работает:
- Напишите сценарий. Вставьте его или позвольте агенту составить черновик.
- Озвучьте его. Агент вызывает функцию
text_to_speech, используя голос из библиотеки голосов Fish Audio, ваш собственный клон голоса или голос, созданный в Voice Design. Добавьте аудио-теги, такие как[excited](взволнованно) или[whispering](шепотом), чтобы задать характер речи. Преобразование текста в речь оплачивается по длине текста и списывается сразу после генерации речи, без отдельного подтверждения стоимости. - Выберите лицо. Загрузите портрет или сгенерируйте его с помощью модели изображений в той же сессии.
- Анимируйте. Агент отправляет портрет и только что сгенерированную речь в модель аватара. Нет необходимости скачивать аудио и загружать его снова — готовая речь передается напрямую.
- Подтвердите и получите. Вы видите стоимость видео с аватаром, подтверждаете её и получаете ссылку на готовый файл.
Мы протестировали этот процесс: шестисекундный клип, созданный через text_to_speech, был принят напрямую как аудиовход для аватара, и в расчете стоимости была отражена его точная длительность — никакого скачивания и повторной загрузки.
Скопируйте это вашему агенту, чтобы попробовать:
Используй Fish Audio, чтобы сделать видео 9:16 с говорящим аватаром:
1. Преврати этот сценарий в речь теплым женским английским голосом:
"Hi, welcome to Fish Audio. Today I'll show you lip sync and talking avatars."
2. Используй мой загруженный портрет с HeyGen Avatar 4 в разрешении 720p, чтобы она произнесла это аудио.
3. Сначала назови цену. Генерируй после моего подтверждения, затем пришли ссылку.
Та же идея работает и для синхронизации губ. Укажите агенту на существующее видео с диктором и дайте новую реплику:
Используй Fish Audio, чтобы добавить новую реплику в моё загруженное видео:
1. Сгенерируй речь моим клонированным голосом: "Today's new arrivals are 20% off. Link in the comments."
2. Используй Sync LipSync v3, чтобы синхронизировать губы в видео с новым аудио.
Сначала назови цену, генерируй после подтверждения.
Для использования говорящих аватаров и синхронизации губ требуется платный тариф Plus или выше. Посмотреть тарифы →
Повторное использование любого результата как входных данных
Цепочки действий не ограничиваются только аудио. Любой готовый результат в вашем рабочем пространстве может стать основой для следующего задания, не покидая диалога: сгенерируйте изображение, а затем попросите агента «превратить только что созданное изображение в четырехсекундное видео с плавным наездом камеры». Агент передает изображение по ссылке — ничего не нужно скачивать или загружать заново.
Для файлов на вашем компьютере агент создает временный слот и загружает файл за вас. Если ваш агент не умеет загружать файлы напрямую, он даст вам ссылку, по которой вы сможете перетащить файл из браузера.
Все это происходит внутри самого агента. Это важнее, чем кажется: сами по себе большинство ИИ-агентов не умеют создавать видео или говорящих аватаров, и даже те, что генерируют изображения, привязаны к одной встроенной модели. Подключение MCP-сервера — это то, что устраняет этот пробел.
Почему ИИ-агентам нужен MCP для генерации изображений и видео
Современные ИИ-агенты удивительно способны. Они могут спланировать кампанию, написать сценарий и создать страницу, на которой он будет размещен. Однако, когда дело доходит до визуальных эффектов, поддержка становится неравномерной. Некоторые помощники, такие как Claude, не генерируют фотографии или иллюстрации так, как это делают специализированные инструменты. Другие, такие как ChatGPT и Codex, включают генерацию изображений, но она привязана к модели одного провайдера. Видео, синхронизация губ и говорящие аватары обычно и вовсе недоступны.
Этот пробел создает привычную рутину. Вы пишете промпт в своем агенте, копируете его в отдельное приложение для изображений или видео, ждете, скачиваете файл и возвращаете его в свой проект. Каждая правка повторяет этот цикл. Альтернатива, к которой прибегают многие разработчики, — это отдельный MCP-сервер для каждой модели, что означает отдельный API-ключ провайдера и запись в конфиге для каждого из них.
Model Context Protocol (MCP) — это стандартный способ наделить агента новыми инструментами, и именно он позволяет Fish Audio убрать лишние шаги и открыть доступ к выбору моделей. Ваш агент напрямую вызывает инструменты генерации, результаты возвращаются в виде ссылок, а следующий шаг — будь то правка, анимация или озвучка — происходит в том же диалоге. Генерация изображений в Claude Code, Cursor или любом другом поддерживаемом агенте становится просто еще одним вызовом инструмента.
Для этого достаточно одной команды.
Как настроить MCP для генерации изображений
Сервер находится по адресу https://api.fish.audio/mcp и использует потоковый HTTP. Авторизация происходит в браузере через вашу учетную запись Fish Audio — никаких API-ключей и переменных окружения. Выберите своего агента ниже.
Ищете MCP для документации? В нашем предыдущем руководстве по llms.txt, MCP и навыкам агентов описывается
docs.fish.audio/mcp— сервер только для чтения, который позволяет агентам изучать документацию API Fish Audio. Сервер в этом посте другой: он входит в вашу учетную запись и создает контент. Вы можете использовать оба параллельно.
Claude Code
claude mcp add --transport http fish-audio https://api.fish.audio/mcp
Затем запустите /mcp внутри Claude Code, чтобы авторизоваться.
Claude.ai
Перейдите в Settings → Connectors → Add custom connector и введите https://api.fish.audio/mcp. Claude проведет вас через процесс авторизации.
Cursor
Откройте палитру команд (Cmd/Ctrl+Shift+P) → Open MCP settings → Add custom MCP и добавьте:
{
"mcpServers": {
"fish-audio": { "url": "https://api.fish.audio/mcp" }
}
}
Cursor предложит вам авторизоваться при первом использовании.
Codex CLI
codex mcp add fish-audio https://api.fish.audio/mcp
codex mcp login fish-audio
Команда логина откроет окно браузера. Проверьте подключение с помощью codex mcp get fish-audio.
Windsurf
Перейдите в Settings → Cascade → MCP Servers → View raw config (~/.codeium/windsurf/mcp_config.json) и добавьте:
{
"mcpServers": {
"fish-audio": { "url": "https://api.fish.audio/mcp" }
}
}
Devin CLI
devin mcp add fish-audio --transport http --scope user --url https://api.fish.audio/mcp --scopes mcp
devin mcp login fish-audio --scopes mcp
Подтвердите подключение с помощью devin mcp list. Поскольку Devin работает в терминале, он также может сохранять результаты локально — в нашем тесте он скачал готовое видео в папку Downloads по запросу.
Войдите и выберите свою команду
Каждый клиент открывает одну и ту же страницу входа Fish Audio. Вы один раз подтверждаете подключение и выбираете команду, в которой оно будет работать; после этого клиент автоматически обновляет доступ.
Подключение привязано к выбранной вами команде. Оно может видеть только рабочие пространства этой команды и использовать только её кредиты. Чтобы работать в другой команде, добавьте сервер снова и выберите нужную команду при входе.
Подключились? Попробуйте свой первый промпт: "Создай акварельное изображение маяка на рассвете в формате 16:9. Сначала покажи цену, потом генерируй". Начните бесплатно с Fish Audio →
Как работает генерация: Оценка, Подтверждение, Генерация
После подключения ваш агент может запускать платные модели от вашего имени. Возникает резонный вопрос: что мешает ему потратить больше, чем вы планировали? Ответ заложен в самом сервере, а не оставлен на усмотрение агента.
- Обнаружение. Агент выводит список доступных моделей и изучает нужную — поддерживаемые опции, значения по умолчанию и лимиты на входные данные.
- Оценка. Перед выполнением любого задания по созданию изображения, видео, синхронизации губ или аватара агент запрашивает предварительную стоимость. Оценка бесплатна. На этом этапе также проверяются лимиты вашего тарифа, поэтому, если для запроса нужен более высокий уровень подписки, вы узнаете об этом до того, как вас попросят что-либо подтвердить.
- Подтверждение. Агент показывает вам цену и ждет. Никакая оплата не взимается до вашего одобрения.
- Генерация. Агент отправляет именно тот запрос, который вы одобрили. Сервер повторно проверяет цену в момент отправки; если цена изменилась, задание отклоняется, и агент должен снова запросить оценку. Списанная сумма никогда не превышает ту, которую вы одобрили.
- Доставка. Агент проверяет прогресс каждые несколько секунд и возвращает ссылку на готовый файл вместе с информацией о фактической стоимости.
Голосовые инструменты тарифицируются иначе. Преобразование текста в речь и речи в текст не проходят через этап предварительной оценки. Оплата списывается сразу после выполнения, при этом текст-в-речь оплачивается по длине текста.
В фоновом режиме работают еще два защитных механизма:
- Кредиты за неудачные задания возвращаются автоматически. Если генерация не удалась, кредиты возвращаются на счет без вашего участия.
- Повтор одного и того же запроса не приведет к двойному списанию. У каждого платного запроса есть уникальный ключ. Если агент повторно отправит тот же запрос с тем же ключом после сбоя по тайм-ауту, сервер вернется к исходному заданию вместо запуска и оплаты нового.
Многие агенты добавляют свой уровень защиты: например, Codex запрашивает ваше разрешение перед каждым вызовом инструмента.
Что под капотом: медиа-инструменты MCP
Для разработчиков: вот медиа-инструменты, которые агент вызывает за кулисами:
| Инструмент | Списывает кредиты? | Что делает |
|---|---|---|
| list_my_workspaces | Нет | Список рабочих пространств в подключенной команде |
| list_media_models / get_media_model | Нет | Список моделей и получение параметров конкретной модели |
| create_media_upload | Нет | Создает слот для загрузки изображения, видео или аудио на 1 час |
| estimate_image_generation / estimate_image_edit / estimate_video_generation | Нет | Проверяет запрос и возвращает расчет стоимости |
| generate_image / generate_image_edit / generate_video | Да | Запускает одобренное задание |
| get_generation_status / get_generation_result | Нет | Отслеживает прогресс и возвращает готовые файлы и чек |
Синхронизация губ и говорящие аватары запускаются через generate_video. Инструмент распознает тип задания по входным данным: видео + аудио означает синхронизацию губ, а портрет + аудио — создание аватара. Аудио-инструменты, такие как text_to_speech, speech_to_text, search_voices, create_voice_clone и инструменты Story Studio, находятся на том же сервере.
Вам не нужно вызывать эти инструменты вручную. На практике вы просто описываете желаемый результат, а агент сам выстраивает цепочку нужных вызовов.
Примеры промптов по сценариям использования
Вот несколько идей для начала, сгруппированных по типу контента:
| Сценарий использования | Что вы говорите | Что делает агент |
|---|---|---|
| Контент для продуктов и приложений | "Сгенерируй изображение 1:1 керамической кофейной кружки на мраморной столешнице в мягком утреннем свете. Дай мне несколько вариантов и сначала покажи цену." | Выбирает модель, оценивает пакет, генерирует после подтверждения |
| Контент для продуктов и приложений | "Загрузи screenshot.png и замени фон на чистый градиент для нашего размещения в сторе. Сначала оцени стоимость." | Загружает файл, оценивает правку, применяет после подтверждения |
| Маркетинг и соцсети | "Сделай видео 9:16 на пять секунд, где кроссовки замедленно разбрызгивают воду в луже. Оцени в кредитах, затем генерируй." | Оценивает текст-в-видео и возвращает ссылку |
| Маркетинг и соцсети | "Преврати только что сгенерированное изображение в короткое видео с плавным наездом камеры." | Использует изображение напрямую как начальный кадр |
| Обновление и локализация видео | "Переведи этот сценарий на испанский, озвучь его моим клоном голоса, а затем синхронизируй губы в demo.mp4 с испанским аудио через Sync LipSync v2 Pro. Сначала оцени стоимость." | Переводит, генерирует речь, загружает видео и оценивает синхронизацию губ |
| Дикторы и аватары | "Создай портрет дружелюбной ведущей в светлой студии, а затем заставь её прочитать release-notes.md как видео с говорящим аватаром 9:16 через Creatify Aurora Avatar." | Создает портрет и речь, затем оценивает видео с аватаром |
| Аккаунт | "Сколько кредитов Fish Audio у меня осталось?" | Проверяет ваш баланс |
В агентах для кода, таких как Claude Code, Codex и Devin, эти инструменты работают в связке с терминалом. Агент может массово генерировать изображения для всех товаров в папке, загружать локальные записи или скачивать готовые файлы прямо в ваш проект.
Тарифы, кредиты и лимиты
Прежде чем начать, полезно узнать, как работают кредиты и какой тариф нужен для каждой возможности.
Какие кредиты используются
Генерация медиа через MCP использует ваши кредиты веб-тарифа Fish Audio — те же, что вы тратите в веб-приложении. Она НЕ использует кредиты Developer API, которые являются отдельным балансом для API Fish Audio. Они приобретаются в разных местах, поэтому важно знать, какой баланс пополнять.
Чтобы добавить веб-кредиты или сменить тариф, перейдите в раздел Team → Plans. Поскольку каждое MCP-подключение привязано к выбранной при входе команде, генерации расходуют кредиты именно этой команды.
Какой тариф вам нужен
То, что ваш агент может сгенерировать, зависит от вашего тарифного плана. Лимиты тарифа проверяются, когда агент запрашивает оценку стоимости, поэтому задание, которое не покрывается вашим планом, будет помечено еще до того, как вас попросят его подтвердить.
- Генерация, редактирование и апскейлинг изображений доступны на бесплатном тарифе (Free), который включает ежедневный лимит на изображения.
- При генерации изображений из текста каждый запрос может содержать до 2 изображений на Free, до 4 на Plus и до 8 на Pro и Max. Редактирование изображений возвращает одно изображение за запрос.
- Генерация видео, синхронизация губ и говорящие аватары требуют платного тарифа Plus, Pro или Max.
- Видео, синхронизация губ и аватары возвращают один результат за запрос.
Если вы начинаете с Free, генерация изображений — самый простой способ опробовать процесс. Когда вы будете готовы к видео, синхронизации губ или аватарам, переход на платный тариф Plus или выше откроет эти возможности.
Цены
У каждой модели своя цена, и стоимость задания также зависит от выбранных вами настроек, таких как разрешение, длительность или количество изображений. Вместо того чтобы полагаться на прайс-лист, просто попросите агента рассчитать стоимость: это бесплатно и отражает текущую цену. Однако помните, что преобразование текста в речь является исключением: оно оплачивается по длине текста и списывается сразу в момент запуска.
Поскольку оценка стоимости бесплатна, вы можете сравнить несколько моделей или настроек для одной и той же идеи и выбрать ту, которая вписывается в ваш бюджет, прежде чем платить.
Загрузки
Некоторые задания начинаются с ваших собственных файлов: фото для правки или анимации, видео для синхронизации губ или аудио для аватара. Агент берет загрузку на себя в пределах следующих лимитов:
- Изображения: JPEG, PNG или WebP, до 20 МБ
- Видео: MP4, MOV, WebM или MKV, до 1 ГБ
- Аудио: MP3, WAV, M4A, AAC, OGG или FLAC, до 50 МБ
У отдельных моделей могут быть более строгие ограничения. Например, Creatify Aurora Avatar принимает от 1 до 60 секунд аудио. Агент считывает лимиты каждой модели перед оценкой, и если провайдер отклонит входные данные после отправки, стоимость неудавшегося задания будет возвращена. Результаты, которые вы уже сгенерировали в том же рабочем пространстве, не нужно загружать снова; агент передает их напрямую.
Время выполнения
Изображения обычно готовы в течение минуты. Видео, синхронизация губ и аватары могут занять несколько минут. Вам не нужно постоянно проверять результат: агент сам отслеживает прогресс и пришлет ссылку, как только файл будет готов.
Заключение: ваш агент теперь — медиастудия
ИИ-агенты уже умеют планировать запуски, писать лендинги и деплоить код. До сих пор визуальный контент был пределом их возможностей: в лучшем случае одна встроенная модель для картинок, а видео, синхронизация губ и аватары ложились на плечи человека и требовали отдельных инструментов. Это обновление устраняет барьер. Один MCP-сервер дает вашему агенту голос, изображения, видео, синхронизацию губ и говорящих аватаров — без управления API-ключами и с предварительной оценкой стоимости каждого медиазадания.
Главное изменение — это то, как эти части соединяются. Сценарий превращается в голос, голос — в говорящего аватара, а изображение — в видео, при этом на каждом этапе результат передается дальше без необходимости перекидывать файлы между приложениями. Голос — это то, что заставляет видео чувствовать себя живым, и это ядро того, что создает Fish Audio. Объединение голоса, изображений и видео в одном диалоге означает, что ваш агент может довести идею от нескольких строк текста до готового ролика.
По мере добавления новых моделей они будут появляться в списке вашего агента автоматически. Самый простой способ увидеть это в действии — подключить сервер и попросить его сделать то, для чего вы обычно открываете три разных инструмента.
Впервые в Fish Audio? Зарегистрируйтесь бесплатно → Подключите MCP-сервер менее чем за минуту и начните с генерации изображений, которая включена в бесплатный тариф.
Готовы к видео, синхронизации губ и аватарам? Посмотреть тарифы → Тарифы Plus и выше открывают доступ к генерации видео, синхронизации губ и говорящим аватарам через MCP.
Часто задаваемые вопросы
Может ли Claude Code генерировать изображения?
Существует ли MCP для генерации видео для Claude Code и Cursor?
Нужен ли мне API-ключ для использования MCP-сервера Fish Audio?
Используются ли при этом мои кредиты Developer API?
Может ли агент тратить кредиты без моего ведома?
Что произойдет, если генерация не удастся?
Можно ли использовать аудио, сгенерированное через Fish Audio TTS, для синхронизации губ или аватаров?
Какие ИИ-агенты работают с MCP-сервером Fish Audio?
Sabrina is part of Fish Audio's support and marketing team, helping users get the most out of AI voice products while turning launches, updates, and customer insights into clear, practical content.
Читать больше от Sabrina Shu