
<100ms
音声出力開始時間無制限
ディレクションタグ80+
対応言語$15/1M UTF-8 bytes
従量課金制開発・運用ニーズに合わせた各種モデル
ひとつのAPI。ヘッダーの指定ひとつでモデルを切り替え。どちらのモデルも一律料金でご利用いただけます。
オリジナル
おすすめ
S2.1 Pro
Fish が提供する中で最も表現力豊かなモデル
- 初回音声出力まで約100ms(H200 1台で)
- リアルタイムファクター 0.195
- 80以上の言語に対応、瞬時にコードスイッチング
- オープンドメインの感情タグ
- 1回の生成で複数話者の声を同時に出力
エンタープライズ導入
サインアップから最初の音声まで 5 分で
商談不要。APIキーを取得してSDKをインストールし、すぐにリリースできます。
cURL · REST API
curl https://api.fish.audio/v1/tts \-H "Authorization: Bearer YOUR_FISH_AUDIO_API_KEY" \-H "Content-Type: application/json" \-H "model: s2.1-pro" \-d '{"text": "[chuckle] When you are building something new, there is this [emphasis] mix of wonder and fear.","reference_id": "YOUR_VOICE_ID","format": "mp3"}' --output speech.mp3
Python · Fish Audio SDK
from fishaudio import FishAudiofrom fishaudio.utils import saveclient = FishAudio(api_key="YOUR_FISH_AUDIO_API_KEY")audio = client.tts.convert(text="Hello from Fish Audio!",reference_id="YOUR_VOICE_ID",model="s2.1-pro",)save(audio, "output.mp3")
感情と抑揚をインラインで指定
[tag] 構文でテキスト内のどこにでも指示を記述できます。自由記述のタグは無制限、別途感情パラメータは不要です。
Hey there.Add TagsI’m so excited to share this news!Can you hear me?
数百万のコミュニティボイス
最大級のオープンボイスライブラリから選んでそのままリリース、または自分の声をクローンしてベースに構築できます




マルチスピーカー対話
1回の生成で会話全体を作成。S2.1 Pro で利用可能。
インスタントボイスクローニング
短い参照音声から声質と話し方を再現。追加学習なしで80以上のすべての言語に対応。
Recorded Voice
EnglishFemaleYoung
複雑なテキストも自然に読み上げ
数字、通貨、日付、単位も正しく読み上げます
$9.99
01/24
1,999
ストリーミングとタイムスタンプ
単語レベルのタイムスタンプ付きで音声をストリーミング配信
Thefutureiscoming
0.02s0.05s0.01s0.04svoice0.01s0.03sプロダクトに必要な音声体験を構築
再利用可能なボイスを作成し、表現や演出を自由にコントロール。そのままリアルタイムプロダクトへストリーミング。
Fish Audio で
あらゆる声を瞬時にクローン
Fish Audio の AI ボイスクローニング API は、短い参照音声を再利用可能な音声に変換します。クローンは声質と話し方を捉え、追加学習なしで80以上のすべての言語に対応します。
PYTHON SDK
# Clone from reference audiovoice = session.create_model(title="My Voice",voices=[open("reference.wav", "rb").read()])# Synthesize with the cloned voicerequest = TTSRequest(text="This is my cloned voice.",reference_id=voice.id)with open("clone.mp3", "wb") as f:for chunk in session.tts(request, backend="s2-pro"):f.write(chunk)
Fish Audio TTS APIベンチマークと仕様
ひとつの API。ヘッダー1つでモデルを切り替え可能。どちらの API モデルも同一の定額料金です。
POST https://api.fish.audio/v1/tts
0.195
リアルタイムファクター
短いクリップ
ボイスクローニング
ネイティブ
マルチスピーカー
REST + WebSocket
ストリーミング
単語レベル
タイムスタンプ
48kHz
サンプルレート
5から開始
同時リクエスト数
MP3 · WAV · Opus
音声フォーマット
ニーズに合わせた柔軟な料金プラン
どのプランでも従量課金に対応詳しく見る
70ms の超低遅延
80以上の言語に対応
単語レベルのタイムスタンプ
超低遅延
多言語に完全対応
インスタントボイスクローニング
業界最高水準の ASR 精度
多言語対応、言語ヒントの指定も可能
長時間音声の文字起こし
同時リクエスト数の上限
利用金額の上限値同時実行数
スターター支払い額 $100 未満5 リクエスト
アドバンス支払い額 $100 以上15 リクエスト
ハイボリューム支払い額 $1,000 以上50 リクエスト
エンタープライズカスタムカスタム上限

