Fish Audio S2.1 Pro: 開発者向けの無料テキスト読み上げ API
クイックサマリー:
Fish Audio の最先端音声モデルである S2.1 Pro が、無料のテキスト読み上げ(TTS)API として利用可能になりました。
83 言語に対応、フェアユースポリシーの下で利用回数制限なし。
モデル文字列: s2.1-pro-free — 既存の Fish API コールに組み込むだけで利用可能です。
S2.1 Pro を無料で試す — 5分以内に最初の音声を生成 →
2026年6月 | Fish Audio の S2.1 Pro モデルが、フェアユースの下で無制限にアクセス可能な無料テキスト読み上げ API として提供開始されました。
高品質な音声 AI が常に高価だった理由
テキスト読み上げ(TTS)API を検討したことがある方なら、既にあるパターンにお気づきでしょう。それは、「本当に音が良いモデルはお金がかかる」ということです。
ElevenLabs の無料枠では、月間 10,000 クレジット(約 6 〜 10 分分)が付与されますが、それを超えると有料プランが必要になります。OpenAI TTS は従量課金制で、無料枠は一切ありません。Google の最新の Gemini TTS モデル(彼らの最先端モデル)も無料枠はなく、最初のトークンから課金されます。業界全体を通じて、「最先端の音声品質は有料機能である」という傾向が一貫していました。
これは開発者にとって大きな課題です。AI 音声ジェネレーター市場は毎年 20% 近い成長を遂げていますが、音声対応製品を構築するためのツールは有料の壁の向こう側に留まったままです。10,000 クレジットではモデルを適切に評価できません。予算を事前に確定させたり、独自の GPU インフラを必要とするオープンソースの代替品と格闘したりすることなく、ボイスエージェントの試作やオーディオブックのパイプラインのテスト、ボイスクローニングの実験を行うことは困難でした。
Fish Audio は今日、その状況を変えます。
S2.1 Pro とは?
S2.1 Pro は Fish Audio の現在の最先端音声モデルです。私たちが持つ最高のモデルが、API を通じてすべての開発者に無料で提供されます。これはプロダクションレベルの AI 音声生成向けに設計されたニューラル音声合成モデルであり、特に低遅延ストリーミング、多言語 TTS、およびボイスクローニングにおいて強みを持っています。今年初めにオープンウェイトでリリースした S2 の基盤の上に構築されています。
パフォーマンス
- 前世代の S2 Pro との直接比較によるリスニング評価で 61% の勝率を記録。詳細はブラインド TTS プロバイダー比較をご覧ください。
- 単一リクエストで 約 70ms の初回音声生成時間 (TTFA) を実現(前世代の約 100ms から短縮)。
- 高並列負荷下での スループットが 2 倍以上に向上。
技術的な背景については、こちらの論文をご覧ください:リンク
対応言語
S2.1 Pro は、英語、日本語、中国語、韓国語、スペイン語、アラビア語、フランス語、ドイツ語、ポルトガル語、ロシア語を含む 83 言語をサポートしています。同一のモデルですべての言語を処理するため、言語ごとのエンドポイントや価格設定はありません。
遅延(レイテンシ)
S2.1-Pro は標準 API で約 90ms の TTFA(初回音声生成時間)を実現しており、ライブボイスエージェントや対話システムでの利用に適しています。韻律や話し方をより細かく制御する必要がある場合は、S2 の単語レベルの音声制御機能も参照してください。
なぜ Fish Audio はこれを無料で提供できるのか
端的に言えば、推論スタックを一から再構築し、1リクエストあたりのコストを大幅に削減できたため、そのコストを自社で吸収できるようになったからです。
カスタム GPU カーネル
私たちは、NVIDIA Hopper (H100/H200) および Blackwell (RTX 6000 PRO) アーキテクチャを対象としたプロダクションレベルの FP8 GEMM および FlashAttention ライブラリである fish-scales-ops を開発しました。音声 AI サービングにおいて重要なデコード形状において、私たちの MXFP8 パスは torch.compile-fused cuBLAS リファレンスを 2.1 〜 4.3 倍上回ります。API を利用するにあたってこれらを理解する必要はありませんが、これが無料枠を継続可能にしている理由です。
高いスループット
FP8 量子化を用いた単一の H200 において、64 の同時リクエストで 8,000 トークン/秒を超える出力スループットを維持します。GPU あたりのスループットが向上するということは、1ドルあたりにより多くのリクエストを処理できることを意味し、これが無制限の無料アクセスの経済的基盤となっています。
「無料」が実際に意味すること
制約については、隠すよりも事前にお伝えしたいと思います。
提供内容:
- モデル文字列:
s2.1-pro-free - 文字数制限なしの大量アクセス(フェアユースポリシーに従う)
- 有料プランと同じ API エンドポイント — 統合の手間は変わりません
現在の制限事項:
- 期間:
2026年7月24日まで無料アクセス可能2026年7月末まで無料アクセス可能2026年8月31日まで無料アクセス可能2026年11月30日まで無料アクセス可能 — 変更がある場合は事前にお知らせします。- 更新(2026年6月): 無料期間を7月いっぱいまで延長します。開発者が期限に追われることなく、構築、評価、リリースを行うための十分な時間を確保してほしいと考えています。
- 更新(2026年7月): 無料アクセスを 2026年8月31日まで再度延長します。開発者の皆様が S2.1 Pro を使って構築しているものを見るのは非常に心強く、その勢いをさらに後押ししたいと考えています。
- SLA なし: 稼働率や TTFA の保証はありません。実験やプロトタイピング向けです。
- 遅延保証なし: ベストエフォートであり、契約上の保証はありません。
- データ保持: リクエスト内容はモデル品質向上のために使用される場合があります。詳細はプライバシーポリシーをご覧ください。
- 商用利用: 一部の商用シナリオには制限がある場合があります。年間経常収益 (ARR) が 100 万ドルを超える製品の場合は、S2.1 Pro Free を使用する前にお問い合わせください。詳細は 価格とレート制限 を参照してください。
プロダクションレベルの SLA や遅延保証が必要な場合は、有料プランをご利用いただけます。この無料枠は、構築し、評価し、判断するための最適な場です。
無料テキスト読み上げ API の使い方:S2.1 Pro クイックスタート
fish.audio/app/api-keys で API キーを取得し、最初のコールを行ってください。Fish API は msgpack 形式のリクエストを受け付け、選択した形式で音声を返します。詳細は API ドキュメント を参照してください。
JavaScript
import { writeFile } from "fs/promises";
const body = {
text: "こんにちは、世界!",
reference_id: "your_model_id",
format: "mp3",
};
const res = await fetch("https://api.fish.audio/v1/tts", {
method: "POST",
headers: {
Authorization: "Bearer <YOUR_API_KEY>",
"Content-Type": "application/json",
model: "s2.1-pro-free",
},
body: JSON.stringify(body),
});
if (!res.ok) {
throw new Error(`TTS request failed: ${res.status} ${await res.text()}`);
}
const buffer = Buffer.from(await res.arrayBuffer());
await writeFile("output.mp3", buffer);
Python
import httpx
body = {
"text": "こんにちは、世界!",
"reference_id": "your_model_id",
"format": "mp3",
}
with httpx.Client() as client:
res = client.post(
"https://api.fish.audio/v1/tts",
headers={
"Authorization": "Bearer <YOUR_API_KEY>",
"Content-Type": "application/json",
"model": "s2.1-pro-free",
},
json=body,
)
res.raise_for_status()
with open("output.mp3", "wb") as f:
f.write(res.content)
他の Fish Audio API コールとの唯一の違いは、ヘッダーで model: "s2.1-pro-free" を設定することだけです。それだけで完了です。
S2.1 Pro vs ElevenLabs:2026年における最高の TTS API
以下の競合他社の情報は、2026年6月時点の公開ドキュメントおよび価格ページに基づいています。価格や機能は変更される可能性があるため、導入の際は各プロバイダーに直接確認してください。
より詳細な独立分析については、私たちの ブラインド TTS プロバイダー比較 をご覧ください。
結論: 私たちが評価した主要な TTS API プロバイダーの中で、Fish Audio は現在最も寛容な無料アクセスモデルを提供しています。無料枠で有料枠と同じ最先端モデルを実行でき、かつ厳格な使用制限がないのは Fish Audio だけです。ElevenLabs の無料枠は実質的に 10,000 クレジットのお試し版であり、Google の最も高度な TTS (Gemini TTS) には無料枠が全くありません。
モデルの品質に妥協しない無料の ElevenLabs 代替案をお探しですか? S2.1 Pro は使用制限なしで今すぐ利用可能です。
無料の OpenAI TTS 代替案をお探しですか? OpenAI の TTS サービスには無料枠がありません。S2.1 Pro は最初に検討すべき強力な選択肢です。
S2.1 Pro で構築できるもの
無料枠ではユースケースを意図的に制限していません。S2.1 Pro の「低遅延 AI 音声生成」「多言語対応」「ボイスクローニング」の組み合わせが特に効果を発揮するシナリオは以下の通りです。
音声エージェント
リアルタイムの会話型 AI の成否は遅延にかかっています。標準コールで約 90ms という TTFA を持つ S2.1 Pro は、自然な対話を行うのに十分な速さです。音声認識 (STT) レイヤーや LLM と組み合わせることで、文字数ごとの課金を気にせずに完全な音声パイプラインを構築できます。また、MCP およびエージェントスキルサポートを通じて S2.1 Pro をエージェントワークフローに統合することも可能です。
オーディオブックと長尺のナレーション
83 言語への対応と自然な韻律により、S2.1 Pro はオーディオブック制作や長尺の音声合成に適しています。無制限に利用できるため、文字数カウンターを気にしたりクレジットを事前購入したりすることなく、原稿全体を処理できます。
ボイスクローニング
S2.1 Pro は API 経由での 参照音声からのボイスクローニング をサポートしています。参照音声サンプルを渡すだけで、その声で音声を合成できます。パーソナライズされた音声アプリケーションの構築、話者のアイデンティティを維持したコンテンツのローカライズ、ゲームやアニメのキャラクターボイスの生成などに活用してください。ボイスクローニングは無料枠でも利用可能で、他の用途と同様にフェアユースポリシーが適用されます。
多言語アプリケーション
複数の言語のユーザーにサービスを提供する場合、単一の API で 83 言語をカバーできることは、言語ごとにエンドポイントを分けたり、英語以外の音声合成にプレミアム料金を支払ったりする必要がある代替案と比較して、大幅な簡素化につながります。
ゲーム NPC の対話
ゲーム音声のパイプラインは、高いスループットと予測可能なリクエストコストの恩恵を受けます。無料枠を無制限に利用できるため、制作予算を確定させる前に、開発段階で大量の対話ライブラリを生成し、自由に試行錯誤することが可能になります。
パートナーエコシステムを通じた提供
S2.1 Pro は、Runware、Retell、Sierra など、増え続けるパートナープラットフォームを通じても利用可能です。
これらのプラットフォームを既に使用している場合、追加の統合やセットアップなしで S2.1 Pro にアクセスできます。既存の環境をそのままお使いください。
私たちはパートナーネットワークを積極的に拡大しています。S2.1 Pro の統合に興味があるプラットフォームやインフラプロバイダーの方は、私たちのチームにお問い合わせください。
フェアユースと今後の展望
無料枠はフェアユースポリシーに基づいて運営されています。開発ではなく乱用と思われる利用パターンについては、アクセスを制限する権利を留保します。これは、正当なユースケースに対して恣意的な制限を設けるためではなく、開発者コミュニティ全体のアクセスを保護することを目的としています。詳細は 価格とレート制限 を参照してください。
今後の予定は以下の通りです:
- 無料アクセスは現在提供中です(初期設定期間あり)。変更がある場合は事前に通知します。
- プロダクション環境向けに、SLA 保証、遅延コミットメント、商用ライセンスを含む 有料プラン を用意しています。
- インフラへの投資は継続的に行われます。この無料枠を可能にしたエンジニアリングの取り組みは、一度限りのものではありません。
- オープンソースインフラ: S2.1 Pro を支えるインフラコンポーネント(無料枠を継続可能にしているスタックと同じもの)のオープンソース化を計画しています。
Fish Audio を商用導入のために評価されている場合、この無料枠は最適なスタート地点となります。実際に構築し、アプリケーションにとって重要な指標を測定した上で、プロダクション要件について相談が必要になった際にご連絡ください。
クレジットカード不要。ウェイティングリストなし。試せることに制限はありません。
