API преобразования текста в речьВстройте голос в любое приложение
Выразительная, управляемая речь с задержкой ~100ms — та же модель S2.1 Pro, что работает в HeyGen, Retell и Plaud.

Модели для разных сценариев продакшена
Единый API. Переключайте модели одним заголовком запроса. Обе API-модели тарифицируются по единой ставке.
S2 Pro
Точность даже на самых коротких фразах
- Мгновенное клонирование голоса
- Полная поддержка многоязычности
- Надёжна на очень коротких промптах
- Та же ставка, что и у S2.1 Pro
S2.1 Pro
Самая выразительная модель от Fish.
- Время до первого аудио ~100ms (без единого H200)
- Коэффициент реального времени 0.195
- 80+ языков, мгновенное переключение между языками
- Эмоциональные теги открытого домена
- Нативная поддержка нескольких говорящих в одной генерации
On-premise
Разворачивайте в собственной инфраструктуре.
- VPC, on-prem, суверенное облако, изолированная среда
- Нулевой отток данных
- Полный контроль над моделью
- Доступна коммерческая лицензия
От регистрации до первого аудио за 5 минуты.
Звонок продавцу не нужен. Получите API-ключ, установите SDK и запускайте.
curl https://api.fish.audio/v1/tts \-H "Authorization: Bearer YOUR_FISH_AUDIO_API_KEY" \-H "Content-Type: application/json" \-H "model: s2.1-pro" \-d '{"text": "[chuckle] When you are building something new, there is this [emphasis] mix of wonder and fear.","reference_id": "YOUR_VOICE_ID","format": "mp3"}' --output speech.mp3
from fishaudio import FishAudiofrom fishaudio.utils import saveclient = FishAudio(api_key="YOUR_FISH_AUDIO_API_KEY")audio = client.tts.convert(text="Hello from Fish Audio!",reference_id="YOUR_VOICE_ID",model="s2.1-pro",)save(audio, "output.mp3")
Всё необходимое,чтобы выпустить голос в продакшен
Единый API для создания голоса, выразительной генерации и доставки в реальном времени.
Эмоции и подача прямо в тексте
Управление голосом задаётся синтаксисом [tag] в любом месте текста. Неограниченное количество произвольных тегов — отдельный параметр эмоций не нужен.
Миллионы голосов от сообщества
Выбирайте готовые голоса из крупнейшей открытой библиотеки или клонируйте свой и стройте поверх него.




Диалог с несколькими говорящими
Сгенерируйте полноценный диалог за один проход. Доступно в S2.1 Pro.
Мгновенное клонирование голоса
Захватывает тембр и манеру речи по короткому референсному клипу. Работает во всех 80+ языках без дополнительного обучения.
Естественно читает сложный текст
Числа, валюта, даты и единицы измерения произносятся верно
Стриминг и метки времени
Стримите аудио с метками времени на уровне слов.
Создайте голосовой опыт, который нужен вашему продукту
Создайте голос многоразового использования, управляйте его подачей и стримите в продукты реального времени.
Клонируйте любой голос мгновенно
с Fish Audio
AI-API клонирования голоса от Fish Audio превращает короткий референсный клип в голос многоразового использования. Клон сохраняет тембр и манеру речи и работает во всех 80+ языках без дополнительного обучения.
# Clone from reference audiovoice = session.create_model(title="My Voice",voices=[open("reference.wav", "rb").read()])# Synthesize with the cloned voicerequest = TTSRequest(text="This is my cloned voice.",reference_id=voice.id)with open("clone.mp3", "wb") as f:for chunk in session.tts(request, backend="s2-pro"):f.write(chunk)
Fish Audio TTS APIБенчмарки и спецификации
Единый API. Переключайте модели одним заголовком запроса. Обе API-модели тарифицируются по единой ставке.
POST https://api.fish.audio/v1/tts
КОЭФФИЦИЕНТ РЕАЛЬНОГО ВРЕМЕНИ
Короткий клип
КЛОНИРОВАНИЕ ГОЛОСА
Нативно
НЕСКОЛЬКО ГОВОРЯЩИХ
REST + WebSocket
СТРИМИНГ
На уровне слов
МЕТКИ ВРЕМЕНИ
ЧАСТОТА ДИСКРЕТИЗАЦИИ
ОДНОВРЕМЕННЫХ ЗАПРОСОВ
MP3 · WAV · Opus
ФОРМАТЫ АУДИО
Гибкие тарифы под ваши задачи
Лимиты одновременных запросов
Часто задаваемые вопросы
Выйти в продакшен за выходные
Получите API-ключ, установите SDK и запускайте. Карта не нужна.

