プロダクショングレードの音声 AIスタートアップ価格でコミュニティのように開かれた存在へ
リアルな音声合成、ボイスクローニング、文字起こしを、たったひとつのAPIで。公式 Python / TypeScript SDK に対応し、1秒未満(サブ秒)の低レイテンシを実現。初期費用なしで1回目のリクエストから完全従量課金でご利用いただけます。

HeyGen や Plaud 等の有力プロダクトを裏で支える最高峰モデル。初回利用から完全従量課金。本番価格(プロダクションレート)の確認に「お問い合わせ」は不要です。
# The same call. The (direction) tags travel with the text.
curl https://api.fish.audio/v1/tts \
-H "Authorization: Bearer $FISH_API_KEY" \
-H "Content-Type: application/json" \
-d '{
"text": "[息を吸う音] 目覚ましが鳴らない休日の朝は、少しだけ特別な気がします。窓から差し込む光や、遠くで聞こえる鳥のさえずりに耳を傾けながら、[強調] ゆっくりと一日を始めるのが好きです。そんな穏やかな時間が、私の一番の贅沢です。",
"reference_id": "297a6fd278df47c3b9da9bfdf55ac89a",
"format": "mp3"
}' --output speech.mp3サインアップから最初の音声まで 5 数分で
商談不要。APIキーを取得してSDKをインストールし、すぐにリリースできます。
# Text to speech in one callcurl -X POST \ https://api.fish.audio/v1/tts \-H "Authorization: Bearer $FISH_API_KEY" \-H "Content-Type: application/json" \-H "model: s2.1-pro-free" \-d '{"text": "Hello! Welcome to Fish Audio."}' \--output welcome.mp3
# Text to speech with the Python SDKfrom fish_audio_sdk import Session, TTSRequestsession = Session("YOUR_API_KEY")request = TTSRequest(text="Hello! Welcome to Fish Audio.")with open("welcome.mp3", "wb") as f:for chunk in session.tts(request):f.write(chunk)
Fish 上でチームが実装するもの
カメラ映えする音声
# アバター動画AIアバター製品に特化した、リップシンク対応・感情豊かなTTS。ただテキストを読み上げるだけでなく、インラインの演出タグによって、まるで感情の宿った「演技」を可能にします。
リアルタイム会話 AI
# 音声エージェントWebSocketによる1秒未満の超低遅延なターン制御。ストリーミング対応のTTSとASRを単一スタックに統合し、ユーザーによる発話の割り込み検知にも標準対応しています。
リアルタイムに生成される音声コンテンツ
# 音声コンテンツ & AIコンパニオンノートの音声化、学習・教材ツール、そしてAI対話パートナー。 アカウント(席)数による固定費ではなく、利用した文字数に応じて柔軟に変動する「従量課金システム」を採用しています。
30秒でスピード生成。クローン不要の即時導入も。
# キャラクターアプリわずか30秒の音声から手軽に作成できるIVC。スタジオクオリティの完全な再現(レプリカ)にはPVCを。また、豊富なボイスライブラリからお好みの声を選べば、クローニング不要で今すぐ導入(リリース)も可能です。
リアルタイムな技術スタックに対応
オープンウェイト(有償の商用ライセンスが必要)
当社のオープンソースモデル(fish-speech、S1、S2)は、有償の商用ライセンス付き「オープンウェイト」として提供しています。本番運用の要件に応じて、自社のVPC、オンプレミス、ソブリンクラウド、あるいは完全に隔離されたエアギャップ環境へのセルフホストが可能です。なお、セルフホストのご利用はEnterpriseプラン(法人向け契約)の対象となります。詳細は下記をご覧ください。
15,000超のディレクションタグ。 テキスト内に書き込むだけで、そのまま呼び出し可能。
[warm], [near-whisper], [reassuring] — 感情や声色の指示はテキストに添えるだけ。別個のパラメータ指定も、選択肢からの選択も不要です。タグを追加・拡張してもスキーマ変更の手間はありません。
Audio Turing Test: 0.515.
ブラインドテストにおいて、検証参加者は S2.1 Pro と人間の声をほとんど聞き分けられませんでした。計581件の比較検証を実施。評価手法および実際の音声サンプルを全公開しています。
100万文字あたり$15(1回目の利用から適用)
HeyGen や Plaud 等の有力プロダクトを裏で支える最高峰モデル。 初回利用から完全従量課金。本番価格(プロダクションレート)の確認に「お問い合わせ」は不要です。
提供APIを利用するか、モデルをセルフホストして運用する
今すぐ開発を始めるなら、クラウドAPI。 本番運用で高度な要件が求められたら、エンタープライズプランでのセルフホストへ。
クラウドAPI | あらゆるチーム向け
クラウドAPI(従量課金:$15 / 100万文字)。モデルを自社で運用・構築することなく、最短でプロダクション運用を開始できます。
- WebSocket ストリーミング、REST、Python + TypeScript SDK
- $15 / 1M UTF-8バイト(契約の縛りなし)
- API呼び出し時にインラインで指示構文を指定
- オープンウェイト版と同じモデルを採用
モデルをセルフホストする
当社のオープンソースモデル(fish-speech、S1、S2)は、有償の商用ライセンス付きオープンウェイトとして提供しています。自社のVPC、データセンター、ソブリンクラウド、さらにはエアギャップ(オフライン)環境へ自由にデプロイ可能です。データの保管場所(データレジデンシー)の制限、独自のファインチューニング、厳格な規制への対応が求められる、大規模運用チーム向けのプレミアムなエンタープライズプランです。
- WebSocket ストリーミング、REST、Python + TypeScript SDK
- $10k/月
- 最低導入費用の目安:$120–150K/年
- 弊社リサーチチームと直接相談が可能
よくある 質問
ElevenLabs、Cartesia、Rime からの乗り換えをお考えの方へ
機能、価格、契約条件を徹底比較。互換性の高いAPI(同じリクエスト構造)を採用しているため、本番環境の移行もほとんどが1週間以内に完了します。
ベンチマーク、評価手法、生音声データ
Audio Turing Test の検証結果、ブラインド評価の手法、そしてオープンウェイト・ライセンスについて。―― 本ページに掲載されたすべての実績には、確かなエビデンスがあります。
