Голосовой ИИ продакшен-уровня.Цены как для стартапа.Открытость как у сообщества.
Добавьте живую речь, клонирование голоса и транскрипцию через единый API. Официальные Python и TypeScript SDK. Задержка менее секунды. Оплата по факту с первого вызова.

S2.1 Pro работает вживую. Выберите голос, наберите фразу — и сразу услышите результат. Та же модель, что работает в продакшене HeyGen, Retell и Sanas — без регистрации, звонка продавцу и демо-среды.
# The same call. The (direction) tags travel with the text.
curl https://api.fish.audio/v1/tts \
-H "Authorization: Bearer $FISH_API_KEY" \
-H "Content-Type: application/json" \
-d '{
"text": "[chuckle] When you’re creating something new, there’s this [emphasis] beautiful mix of wonder and fear.",
"reference_id": "933563129e564b19a115bedd57b7406a",
"format": "mp3"
}' --output speech.mp3От регистрации до первого аудио за 5 минуты.
Звонок продавцу не нужен. Получите API-ключ, установите SDK и запускайте.
# Text to speech in one callcurl -X POST \ https://api.fish.audio/v1/tts \-H "Authorization: Bearer $FISH_API_KEY" \-H "Content-Type: application/json" \-H "model: s2.1-pro-free" \-d '{"text": "Hello! Welcome to Fish Audio."}' \--output welcome.mp3
# Text to speech with the Python SDKfrom fish_audio_sdk import Session, TTSRequestsession = Session("YOUR_API_KEY")request = TTSRequest(text="Hello! Welcome to Fish Audio.")with open("welcome.mp3", "wb") as f:for chunk in session.tts(request):f.write(chunk)
Что команды создают на Fish.
Голос, который выдерживает съёмку
# Видео с аватарамиTTS с синхронизацией губ и передачей эмоций для продуктов с AI-аватарами. Встроенные теги управления голосом передают исполнение, а не только слова.
Realtime-диалоговый ИИ
# Голосовой агентСмена реплик менее чем за секунду через WebSocket. TTS и ASR в едином стриминг-стеке. Поддержка перебивания.
Динамический аудиоконтент.
# Аудиоконтент и компаньоныЗаметки в аудио, инструменты подготовки, AI-компаньоны. Посимвольная тарификация, масштабируемая по объёму, а не по числу мест.
Клонирование за 30 секунд. Или вовсе без клонирования.
# Приложения с персонажамиIVC — по аудио длительностью 30 секунд. PVC — реплики студийного качества. Или выберите голос из библиотеки и запускайте без клонирования.
Создан для realtime-стека.
Открытые веса. Платная коммерческая лицензия.
Наши модели с открытым кодом — fish-speech, S1 и S2 — поставляются как открытые веса с платной коммерческой лицензией. Разворачивайте в своём VPC, on-prem, суверенном облаке или изолированной среде, когда этого требует продакшен. Самостоятельное развёртывание — формат Enterprise-уровня, подробнее ниже.
15,000+ тегов управления голосом. Встроенные в любой запрос.
[warm], [near-whisper], [reassuring] — управление голосом идёт вместе с самим текстом. Никаких отдельных параметров, никаких списков для выбора, никаких миграций схемы при расширении набора тегов.
Audio Turing Test: 0.515.
В слепой оценке слушатели не могут надёжно отличить S2.1 Pro от человека. 581 парное сравнение. Методология и исходное аудио опубликованы.
$15 за миллион символов. С первого вызова.
Та же модель, что работает у HeyGen, Pictoria, Dubbing AI и Plaud. Оплата по факту с первого вызова. Без «свяжитесь с нами» для продакшен-тарифов.
Используйте наш API. Или разверните модель самостоятельно
Облачный API для любой команды, которая строит продукт уже сегодня. Самостоятельное развёртывание — премиальный Enterprise-формат, когда этого требует продакшен.
Hosted API · Для любой команды
Облачный API, оплата по факту использования, $15 за миллион символов. Самый быстрый путь до продакшена для команд, которым не нужно самостоятельно управлять моделью.
- WebSocket streaming, REST, Python + TypeScript SDKs
- $15 / 1M UTF-8 bytes — без обязательств
- Встроенный синтаксис управления голосом в каждом запросе
- Та же модель с открытыми весами
Самостоятельное развёртывание модели.
Наши модели с открытым кодом — fish-speech, S1, S2 — поставляются как открытые веса с платной коммерческой лицензией. Разворачивайте в своём VPC, дата-центре, суверенном облаке или изолированном окружении. Премиальный формат для высоконагруженных команд, которым нужна локализация данных, дообучение или регулируемый деплой.
- WebSocket streaming, REST, Python + TypeScript SDKs
- $10k/мес
- Эффективный минимум: $120–150K/год
- Прямой доступ к нашей исследовательской команде
Тарифы, которыене штрафуют за рост
Оплата по факту с первого дня. Без абонентских плат. Без годовых обязательств. Без «свяжитесь с нами» для продакшен-тарифов.
Полный прайс-листЧасто задаваемые вопросы
Переходите с ElevenLabs, Cartesia или Rime?
Детальные сравнения по возможностям, ценам и условиям контрактов. Схожая форма API — большинство продакшен-миграций завершается менее чем за неделю.
Бенчмарки, методология и исходное аудио
Результаты Audio Turing Test, методология слепой оценки и лицензия на открытые веса. Доказательства каждого утверждения на этой странице.
Выйти в продакшен за выходные
Стартовые кредиты бесплатно. Карта не нужна. Один тариф от прототипа до масштаба.
