Один год.

$52M сид-раунд.

8M+ создателей.

Наша история
S2.1 Pro теперь бесплатен для разработчиков

Голосовой ИИ продакшен-уровня.Цены как для стартапа.Открытость как у сообщества.

Добавьте живую речь, клонирование голоса и транскрипцию через единый API. Официальные Python и TypeScript SDK. Задержка менее секунды. Оплата по факту с первого вызова.

S2.1 Pro работает вживую. Выберите голос, наберите фразу — и сразу услышите результат. Та же модель, что работает в продакшене HeyGen, Retell и Sanas — без регистрации, звонка продавцу и демо-среды.

Нам доверяют команды, создающие голос в продакшене

Голосовые агенты и диалоговый ИИ
Озвучка видео, дубляж и музыка
Интерактивные и социальные
Образование и обучение

От регистрации до первого аудио за 5 минуты.

Звонок продавцу не нужен. Получите API-ключ, установите SDK и запускайте.

CURL · ТЕКСТ В РЕЧЬ
# Text to speech in one call
curl -X POST \ https://api.fish.audio/v1/tts \
-H "Authorization: Bearer $FISH_API_KEY" \
-H "Content-Type: application/json" \
-H "model: s2.1-pro-free" \
-d '{"text": "Hello! Welcome to Fish Audio."}' \
--output welcome.mp3
PYTHON SDK
# Text to speech with the Python SDK
from fish_audio_sdk import Session, TTSRequest
 
session = Session("YOUR_API_KEY")
request = TTSRequest(text="Hello! Welcome to Fish Audio.")
with open("welcome.mp3", "wb") as f:
for chunk in session.tts(request):
f.write(chunk)

Что команды создают на Fish.

Голос, который выдерживает съёмку

# Видео с аватарами

TTS с синхронизацией губ и передачей эмоций для продуктов с AI-аватарами. Встроенные теги управления голосом передают исполнение, а не только слова.

HeyGen
VIGGLE
Pictoria

Realtime-диалоговый ИИ

# Голосовой агент

Смена реплик менее чем за секунду через WebSocket. TTS и ASR в едином стриминг-стеке. Поддержка перебивания.

Retell
Sanas
Dubbing AI

Динамический аудиоконтент.

# Аудиоконтент и компаньоны

Заметки в аудио, инструменты подготовки, AI-компаньоны. Посимвольная тарификация, масштабируемая по объёму, а не по числу мест.

PLAUD
Final Round AI

Клонирование за 30 секунд. Или вовсе без клонирования.

# Приложения с персонажами

IVC — по аудио длительностью 30 секунд. PVC — реплики студийного качества. Или выберите голос из библиотеки и запускайте без клонирования.

OpenArt

Создан для realtime-стека.

Открытые веса. Платная коммерческая лицензия.

Наши модели с открытым кодом — fish-speech, S1 и S2 — поставляются как открытые веса с платной коммерческой лицензией. Разворачивайте в своём VPC, on-prem, суверенном облаке или изолированной среде, когда этого требует продакшен. Самостоятельное развёртывание — формат Enterprise-уровня, подробнее ниже.

Ознакомиться с условиями лицензии

15,000+ тегов управления голосом. Встроенные в любой запрос.

[warm], [near-whisper], [reassuring] — управление голосом идёт вместе с самим текстом. Никаких отдельных параметров, никаких списков для выбора, никаких миграций схемы при расширении набора тегов.

Открыть библиотеку тегов

Audio Turing Test: 0.515.

В слепой оценке слушатели не могут надёжно отличить S2.1 Pro от человека. 581 парное сравнение. Методология и исходное аудио опубликованы.

Читать исследование

$15 за миллион символов. С первого вызова.

Та же модель, что работает у HeyGen, Pictoria, Dubbing AI и Plaud. Оплата по факту с первого вызова. Без «свяжитесь с нами» для продакшен-тарифов.

Полный прайс-лист

Используйте наш API. Или разверните модель самостоятельно

Облачный API для любой команды, которая строит продукт уже сегодня. Самостоятельное развёртывание — премиальный Enterprise-формат, когда этого требует продакшен.

Hosted API · Для любой команды

Облачный API, оплата по факту использования, $15 за миллион символов. Самый быстрый путь до продакшена для команд, которым не нужно самостоятельно управлять моделью.

  • WebSocket streaming, REST, Python + TypeScript SDKs
  • $15 / 1M UTF-8 bytes — без обязательств
  • Встроенный синтаксис управления голосом в каждом запросе
  • Та же модель с открытыми весами

Самостоятельное развёртывание модели.

Наши модели с открытым кодом — fish-speech, S1, S2 — поставляются как открытые веса с платной коммерческой лицензией. Разворачивайте в своём VPC, дата-центре, суверенном облаке или изолированном окружении. Премиальный формат для высоконагруженных команд, которым нужна локализация данных, дообучение или регулируемый деплой.

  • WebSocket streaming, REST, Python + TypeScript SDKs
  • $10k/мес
  • Эффективный минимум: $120–150K/год
  • Прямой доступ к нашей исследовательской команде

Тарифы, которыене штрафуют за рост

Оплата по факту с первого дня. Без абонентских плат. Без годовых обязательств. Без «свяжитесь с нами» для продакшен-тарифов.

Полный прайс-лист
Модель
TTS
TTS
TTS
ASR
Название модели
S2.1 Pro Free
S2.1 Pro
S1
Transcribe-1
Тариф
Бесплатно для разработчиков
$15 / 1M UTF-8 bytes
$15 / 1M UTF-8 bytes
$0.36 / час

Часто задаваемые вопросы

Переходите с ElevenLabs, Cartesia или Rime?

Детальные сравнения по возможностям, ценам и условиям контрактов. Схожая форма API — большинство продакшен-миграций завершается менее чем за неделю.

Посмотреть сравнение

Бенчмарки, методология и исходное аудио

Результаты Audio Turing Test, методология слепой оценки и лицензия на открытые веса. Доказательства каждого утверждения на этой странице.

Читать исследование
Fish Audio

Выйти в продакшен за выходные

Стартовые кредиты бесплатно. Карта не нужна. Один тариф от прототипа до масштаба.