Один год.

$52M сид-раунд.

8M+ создателей.

Наша история

API преобразования текста в речьВстройте голос в любое приложение

Выразительная, управляемая речь с задержкой ~100ms — та же модель S2.1 Pro, что работает в HeyGen, Retell и Plaud.

curl https://api.fish.audio/v1/tts \
  -H "Authorization: Bearer YOUR_FISH_AUDIO_API_KEY" \
  -H "Content-Type: application/json" \
  -H "model: s2.1-pro" \
  -d '{
    "text": "[chuckle] Когда создаёшь что-то новое, возникает [audience laughing] смесь восторга и страха. [whisper] Но именно это делает создание стоящим усилий.",
    "reference_id": "933563129e564b19a115bedd57b7406a",
    "format": "mp3"
  }' --output speech.mp3
<100ms
ВРЕМЯ ДО ПЕРВОГО АУДИО
Неограниченно
тегов управления
80+
ЯЗЫКОВ
$15/1M UTF-8 байт
ОПЛАТА ПО ФАКТУ

Уже в продакшене у

Модели для разных сценариев продакшена

Единый API. Переключайте модели одним заголовком запроса. Обе API-модели тарифицируются по единой ставке.

ОРИГИНАЛ

S2 Pro

Точность даже на самых коротких фразах

  • Мгновенное клонирование голоса
  • Полная поддержка многоязычности
  • Надёжна на очень коротких промптах
  • Та же ставка, что и у S2.1 Pro
Документация
РЕКОМЕНДОВАНО

S2.1 Pro

Самая выразительная модель от Fish.

  • Время до первого аудио ~100ms (без единого H200)
  • Коэффициент реального времени 0.195
  • 80+ языков, мгновенное переключение между языками
  • Эмоциональные теги открытого домена
  • Нативная поддержка нескольких говорящих в одной генерации
Документация
ENTERPRISE-РАЗВЁРТЫВАНИЕ

On-premise

Разворачивайте в собственной инфраструктуре.

  • VPC, on-prem, суверенное облако, изолированная среда
  • Нулевой отток данных
  • Полный контроль над моделью
  • Доступна коммерческая лицензия
Связаться с отделом продаж

От регистрации до первого аудио за 5 минуты.

Звонок продавцу не нужен. Получите API-ключ, установите SDK и запускайте.

cURL · REST API
curl https://api.fish.audio/v1/tts \
-H "Authorization: Bearer YOUR_FISH_AUDIO_API_KEY" \
-H "Content-Type: application/json" \
-H "model: s2.1-pro" \
-d '{
"text": "[chuckle] When you are building something new, there is this [emphasis] mix of wonder and fear.",
"reference_id": "YOUR_VOICE_ID",
"format": "mp3"
}' --output speech.mp3
Python · Fish Audio SDK
from fishaudio import FishAudio
from fishaudio.utils import save
client = FishAudio(api_key="YOUR_FISH_AUDIO_API_KEY")
audio = client.tts.convert(
text="Hello from Fish Audio!",
reference_id="YOUR_VOICE_ID",
model="s2.1-pro",
)
save(audio, "output.mp3")

Всё необходимое,чтобы выпустить голос в продакшен

Единый API для создания голоса, выразительной генерации и доставки в реальном времени.

Эмоции и подача прямо в тексте

Управление голосом задаётся синтаксисом [tag] в любом месте текста. Неограниченное количество произвольных тегов — отдельный параметр эмоций не нужен.

Aber
Hey there.Add TagsI’m so excited to share this news!Can you hear me?
[Sad]
[Excited]
[satisfied]
[angry]

Миллионы голосов от сообщества

Выбирайте готовые голоса из крупнейшей открытой библиотеки или клонируйте свой и стройте поверх него.

Диалог с несколькими говорящими

Сгенерируйте полноценный диалог за один проход. Доступно в S2.1 Pro.

Aber
Sarah
Ethan

Мгновенное клонирование голоса

Захватывает тембр и манеру речи по короткому референсному клипу. Работает во всех 80+ языках без дополнительного обучения.

Recorded Voice
My Cloned Voice
EnglishFemaleYoung

Естественно читает сложный текст

Числа, валюта, даты и единицы измерения произносятся верно

$9.99
01/24
1,999

Стриминг и метки времени

Стримите аудио с метками времени на уровне слов.

Thefutureiscoming
0.02s0.05s0.01s0.04svoice0.01s0.03s

Создайте голосовой опыт, который нужен вашему продукту

Создайте голос многоразового использования, управляйте его подачей и стримите в продукты реального времени.

Клонируйте любой голос мгновенно
с Fish Audio

AI-API клонирования голоса от Fish Audio превращает короткий референсный клип в голос многоразового использования. Клон сохраняет тембр и манеру речи и работает во всех 80+ языках без дополнительного обучения.

PYTHON SDK
# Clone from reference audio
voice = session.create_model(
title="My Voice",
voices=[open("reference.wav", "rb").read()]
)
# Synthesize with the cloned voice
request = TTSRequest(
text="This is my cloned voice.",
reference_id=voice.id
)
with open("clone.mp3", "wb") as f:
for chunk in session.tts(request, backend="s2-pro"):
f.write(chunk)

Fish Audio TTS APIБенчмарки и спецификации

Единый API. Переключайте модели одним заголовком запроса. Обе API-модели тарифицируются по единой ставке.

POST https://api.fish.audio/v1/tts

Бенчмарки
0.195

КОЭФФИЦИЕНТ РЕАЛЬНОГО ВРЕМЕНИ

Короткий клип

КЛОНИРОВАНИЕ ГОЛОСА

Нативно

НЕСКОЛЬКО ГОВОРЯЩИХ

REST + WebSocket

СТРИМИНГ

На уровне слов

МЕТКИ ВРЕМЕНИ

48kHz

ЧАСТОТА ДИСКРЕТИЗАЦИИ

5на старте

ОДНОВРЕМЕННЫХ ЗАПРОСОВ

MP3 · WAV · Opus

ФОРМАТЫ АУДИО

Гибкие тарифы под ваши задачи

Оплата по факту с любой подпискойУзнать больше

S2.1 Pro

Текст в речь

$0.015/ K UTF-8 байт
Начать
Сверхнизкая задержка 70ms
Поддержка 80+ языков
Метки времени на уровне слов

S2 Pro

Текст в речь

$0.015/ K UTF-8 байт
Начать
Задержка в реальном времени
Полная поддержка многоязычности
Мгновенное клонирование голоса

Transcribe-1

Автоматическое распознавание речи

$0.006/ минута аудио
Начать
Лучшая в отрасли точность ASR
Многоязычность с опциональными языковыми подсказками
Транскрипция длинных аудио

Лимиты одновременных запросов

 
Порог расходовПараллельность
Стартовый
< $100 оплачено5 запросов
Повышенный
≥ $100 оплачено15 запросов
Высокий объём
≥ $1,000 оплачено50 запросов
Enterprise
ИндивидуальноИндивидуальные лимиты

Часто задаваемые вопросы

Fish Audio

Выйти в продакшен за выходные

Получите API-ключ, установите SDK и запускайте. Карта не нужна.