1 周年

$52M シード調達

8M+ クリエイター

私たちのストーリー

テキスト読み上げ APIどんなアプリにも音声を実装可能

HeyGen、Retell、Plaudにも採用されているS2.1 Proモデル。表現力豊かな音声を、約100msの超低レイテンシで自在にコントロール。

curl https://api.fish.audio/v1/tts \
  -H "Authorization: Bearer YOUR_FISH_AUDIO_API_KEY" \
  -H "Content-Type: application/json" \
  -H "model: s2.1-pro" \
  -d '{
    "text": "[chuckle] 新しいものを作るときって、[audience laughing] 期待と不安が入り混じるんですよね。[whisper] でも、だからこそ作る価値があるんです。",
    "reference_id": "933563129e564b19a115bedd57b7406a",
    "format": "mp3"
  }' --output speech.mp3
<100ms
音声出力開始時間
無制限
ディレクションタグ
80+
対応言語
$15/1M UTF-8 bytes
従量課金制

プロダクションで稼働中

開発・運用ニーズに合わせた各種モデル

ひとつのAPI。ヘッダーの指定ひとつでモデルを切り替え。どちらのモデルも一律料金でご利用いただけます。

オリジナル

S2 Pro

ごく短い発話でも正確に認識

  • インスタントボイスクローニング
  • 多言語に完全対応
  • ごく短いプロンプトでも意図通りに動作
  • S2.1 Pro と同一の定額料金
ドキュメントを見る
おすすめ

S2.1 Pro

Fish が提供する中で最も表現力豊かなモデル

  • 初回音声出力まで約100ms(H200 1台で)
  • リアルタイムファクター 0.195
  • 80以上の言語に対応、瞬時にコードスイッチング
  • オープンドメインの感情タグ
  • 1回の生成で複数話者の声を同時に出力
ドキュメントを見る
エンタープライズ導入

オンプレミス

自社インフラにデプロイ

  • VPC、オンプレミス、ソブリンクラウド、エアギャップ
  • データの外部送信ゼロ
  • モデルを完全に制御
  • 商用ライセンス提供
営業に相談する

サインアップから最初の音声まで 5 分で

商談不要。APIキーを取得してSDKをインストールし、すぐにリリースできます。

cURL · REST API
curl https://api.fish.audio/v1/tts \
-H "Authorization: Bearer YOUR_FISH_AUDIO_API_KEY" \
-H "Content-Type: application/json" \
-H "model: s2.1-pro" \
-d '{
"text": "[chuckle] When you are building something new, there is this [emphasis] mix of wonder and fear.",
"reference_id": "YOUR_VOICE_ID",
"format": "mp3"
}' --output speech.mp3
Python · Fish Audio SDK
from fishaudio import FishAudio
from fishaudio.utils import save
client = FishAudio(api_key="YOUR_FISH_AUDIO_API_KEY")
audio = client.tts.convert(
text="Hello from Fish Audio!",
reference_id="YOUR_VOICE_ID",
model="s2.1-pro",
)
save(audio, "output.mp3")

必要なすべてがここにプロダクション対応の音声機能を届けるために

音声作成、表現力豊かな生成、リアルタイム配信をひとつの API で

感情と抑揚をインラインで指定

[tag] 構文でテキスト内のどこにでも指示を記述できます。自由記述のタグは無制限、別途感情パラメータは不要です。

Aber
Hey there.Add TagsI’m so excited to share this news!Can you hear me?
[Sad]
[Excited]
[satisfied]
[angry]

数百万のコミュニティボイス

最大級のオープンボイスライブラリから選んでそのままリリース、または自分の声をクローンしてベースに構築できます

マルチスピーカー対話

1回の生成で会話全体を作成。S2.1 Pro で利用可能。

Aber
Sarah
Ethan

インスタントボイスクローニング

短い参照音声から声質と話し方を再現。追加学習なしで80以上のすべての言語に対応。

Recorded Voice
My Cloned Voice
EnglishFemaleYoung

複雑なテキストも自然に読み上げ

数字、通貨、日付、単位も正しく読み上げます

$9.99
01/24
1,999

ストリーミングとタイムスタンプ

単語レベルのタイムスタンプ付きで音声をストリーミング配信

Thefutureiscoming
0.02s0.05s0.01s0.04svoice0.01s0.03s

プロダクトに必要な音声体験を構築

再利用可能なボイスを作成し、表現や演出を自由にコントロール。そのままリアルタイムプロダクトへストリーミング。

Fish Audio で
あらゆる声を瞬時にクローン

Fish Audio の AI ボイスクローニング API は、短い参照音声を再利用可能な音声に変換します。クローンは声質と話し方を捉え、追加学習なしで80以上のすべての言語に対応します。

PYTHON SDK
# Clone from reference audio
voice = session.create_model(
title="My Voice",
voices=[open("reference.wav", "rb").read()]
)
# Synthesize with the cloned voice
request = TTSRequest(
text="This is my cloned voice.",
reference_id=voice.id
)
with open("clone.mp3", "wb") as f:
for chunk in session.tts(request, backend="s2-pro"):
f.write(chunk)

Fish Audio TTS APIベンチマークと仕様

ひとつの API。ヘッダー1つでモデルを切り替え可能。どちらの API モデルも同一の定額料金です。

POST https://api.fish.audio/v1/tts

ベンチマーク
0.195

リアルタイムファクター

短いクリップ

ボイスクローニング

ネイティブ

マルチスピーカー

REST + WebSocket

ストリーミング

単語レベル

タイムスタンプ

48kHz

サンプルレート

5から開始

同時リクエスト数

MP3 · WAV · Opus

音声フォーマット

ニーズに合わせた柔軟な料金プラン

どのプランでも従量課金に対応詳しく見る

S2.1 Pro

テキスト読み上げ

$0.015/ K UTF-8 bytes
今すぐ始める
70ms の超低遅延
80以上の言語に対応
単語レベルのタイムスタンプ

S2 Pro

テキスト読み上げ

$0.015/ K UTF-8 bytes
今すぐ始める
超低遅延
多言語に完全対応
インスタントボイスクローニング

Transcribe-1

自動音声認識

$0.006/ 音声1分
今すぐ始める
業界最高水準の ASR 精度
多言語対応、言語ヒントの指定も可能
長時間音声の文字起こし

同時リクエスト数の上限

 
利用金額の上限値同時実行数
スターター
支払い額 $100 未満5 リクエスト
アドバンス
支払い額 $100 以上15 リクエスト
ハイボリューム
支払い額 $1,000 以上50 リクエスト
エンタープライズ
カスタムカスタム上限

よくある質問

Fish Audio

今週末までに本番環境へ

APIキーを取得してSDKを導入すれば、すぐにデプロイできます。カード登録は一切不要です。