2026年6月23日リサーチ

Fish Audio S2.1 Pro: 開発者向けの無料テキスト読み上げ API

Fish Audio S2.1 Pro: 開発者向けの無料テキスト読み上げ API

クイックサマリー:

  • Fish Audio の最先端音声モデルである S2.1 Pro が、無料のテキスト読み上げ(TTS)API として利用可能になりました。

  • 83 言語に対応、フェアユースポリシーの下で利用回数制限なし。

  • モデル文字列: s2.1-pro-free — 既存の Fish API コールに組み込むだけで利用可能です。

S2.1 Pro を無料で試す — 5分以内に最初の音声を生成 →

2026年6月 | Fish Audio の S2.1 Pro モデルが、フェアユースの下で無制限にアクセス可能な無料テキスト読み上げ API として提供開始されました。


高品質な音声 AI が常に高価だった理由

テキスト読み上げ(TTS)API を検討したことがある方なら、既にあるパターンにお気づきでしょう。それは、「本当に音が良いモデルはお金がかかる」ということです。

ElevenLabs の無料枠では、月間 10,000 クレジット(約 6 〜 10 分分)が付与されますが、それを超えると有料プランが必要になります。OpenAI TTS は従量課金制で、無料枠は一切ありません。Google の最新の Gemini TTS モデル(彼らの最先端モデル)も無料枠はなく、最初のトークンから課金されます。業界全体を通じて、「最先端の音声品質は有料機能である」という傾向が一貫していました。

これは開発者にとって大きな課題です。AI 音声ジェネレーター市場は毎年 20% 近い成長を遂げていますが、音声対応製品を構築するためのツールは有料の壁の向こう側に留まったままです。10,000 クレジットではモデルを適切に評価できません。予算を事前に確定させたり、独自の GPU インフラを必要とするオープンソースの代替品と格闘したりすることなく、ボイスエージェントの試作やオーディオブックのパイプラインのテスト、ボイスクローニングの実験を行うことは困難でした。

Fish Audio は今日、その状況を変えます。


S2.1 Pro とは?

S2.1-Pro ベンチマーク:同時実行数 1 から 512 におけるスループット (tok/s) と TTFB p50 (ms)。同時実行数 64 で 8,006 tok/s、同時実行数 1 で 73.2ms の TTFB を示している

S2.1 Pro は Fish Audio の現在の最先端音声モデルです。私たちが持つ最高のモデルが、API を通じてすべての開発者に無料で提供されます。これはプロダクションレベルの AI 音声生成向けに設計されたニューラル音声合成モデルであり、特に低遅延ストリーミング、多言語 TTS、およびボイスクローニングにおいて強みを持っています。今年初めにオープンウェイトでリリースした S2 の基盤の上に構築されています。

パフォーマンス

  • 前世代の S2 Pro との直接比較によるリスニング評価で 61% の勝率を記録。詳細はブラインド TTS プロバイダー比較をご覧ください。
  • 単一リクエストで 約 70ms の初回音声生成時間 (TTFA) を実現(前世代の約 100ms から短縮)。
  • 高並列負荷下での スループットが 2 倍以上に向上

技術的な背景については、こちらの論文をご覧ください:リンク

対応言語

S2.1 Pro は、英語、日本語、中国語、韓国語、スペイン語、アラビア語、フランス語、ドイツ語、ポルトガル語、ロシア語を含む 83 言語をサポートしています。同一のモデルですべての言語を処理するため、言語ごとのエンドポイントや価格設定はありません。

遅延(レイテンシ)

S2.1-Pro は標準 API で約 90ms の TTFA(初回音声生成時間)を実現しており、ライブボイスエージェントや対話システムでの利用に適しています。韻律や話し方をより細かく制御する必要がある場合は、S2 の単語レベルの音声制御機能も参照してください。


なぜ Fish Audio はこれを無料で提供できるのか

Fish Audio S2.1-Pro 推論インフラ:NVIDIA H200 と FP8 GEMM、カスタムスケジューラにより、1リクエストあたり 125 audio tok/s (RTF 0.17) と約 70ms の TTFA を実現

端的に言えば、推論スタックを一から再構築し、1リクエストあたりのコストを大幅に削減できたため、そのコストを自社で吸収できるようになったからです。

カスタム GPU カーネル

私たちは、NVIDIA Hopper (H100/H200) および Blackwell (RTX 6000 PRO) アーキテクチャを対象としたプロダクションレベルの FP8 GEMM および FlashAttention ライブラリである fish-scales-ops を開発しました。音声 AI サービングにおいて重要なデコード形状において、私たちの MXFP8 パスは torch.compile-fused cuBLAS リファレンスを 2.1 〜 4.3 倍上回ります。API を利用するにあたってこれらを理解する必要はありませんが、これが無料枠を継続可能にしている理由です。

高いスループット

FP8 量子化を用いた単一の H200 において、64 の同時リクエストで 8,000 トークン/秒を超える出力スループットを維持します。GPU あたりのスループットが向上するということは、1ドルあたりにより多くのリクエストを処理できることを意味し、これが無制限の無料アクセスの経済的基盤となっています。


「無料」が実際に意味すること

制約については、隠すよりも事前にお伝えしたいと思います。

提供内容:

  • モデル文字列: s2.1-pro-free
  • 文字数制限なしの大量アクセス(フェアユースポリシーに従う)
  • 有料プランと同じ API エンドポイント — 統合の手間は変わりません

現在の制限事項:

  • 期間: 2026年7月24日まで無料アクセス可能 2026年7月末まで無料アクセス可能 2026年8月31日まで無料アクセス可能 2026年11月30日まで無料アクセス可能 — 変更がある場合は事前にお知らせします。
    • 更新(2026年6月): 無料期間を7月いっぱいまで延長します。開発者が期限に追われることなく、構築、評価、リリースを行うための十分な時間を確保してほしいと考えています。
    • 更新(2026年7月): 無料アクセスを 2026年8月31日まで再度延長します。開発者の皆様が S2.1 Pro を使って構築しているものを見るのは非常に心強く、その勢いをさらに後押ししたいと考えています。
  • SLA なし: 稼働率や TTFA の保証はありません。実験やプロトタイピング向けです。
  • 遅延保証なし: ベストエフォートであり、契約上の保証はありません。
  • データ保持: リクエスト内容はモデル品質向上のために使用される場合があります。詳細はプライバシーポリシーをご覧ください。
  • 商用利用: 一部の商用シナリオには制限がある場合があります。年間経常収益 (ARR) が 100 万ドルを超える製品の場合は、S2.1 Pro Free を使用する前にお問い合わせください。詳細は 価格とレート制限 を参照してください。

プロダクションレベルの SLA や遅延保証が必要な場合は、有料プランをご利用いただけます。この無料枠は、構築し、評価し、判断するための最適な場です。


無料テキスト読み上げ API の使い方:S2.1 Pro クイックスタート

fish.audio/app/api-keys で API キーを取得し、最初のコールを行ってください。Fish API は msgpack 形式のリクエストを受け付け、選択した形式で音声を返します。詳細は API ドキュメント を参照してください。

JavaScript

import { writeFile } from "fs/promises";

const body = {
  text: "こんにちは、世界!",
  reference_id: "your_model_id",
  format: "mp3",
};

const res = await fetch("https://api.fish.audio/v1/tts", {
  method: "POST",
  headers: {
    Authorization: "Bearer <YOUR_API_KEY>",
    "Content-Type": "application/json",
    model: "s2.1-pro-free",
  },
  body: JSON.stringify(body),
});

if (!res.ok) {
  throw new Error(`TTS request failed: ${res.status} ${await res.text()}`);
}

const buffer = Buffer.from(await res.arrayBuffer());
await writeFile("output.mp3", buffer);

Python

import httpx

body = {
    "text": "こんにちは、世界!",
    "reference_id": "your_model_id",
    "format": "mp3",
}

with httpx.Client() as client:
    res = client.post(
        "https://api.fish.audio/v1/tts",
        headers={
            "Authorization": "Bearer <YOUR_API_KEY>",
            "Content-Type": "application/json",
            "model": "s2.1-pro-free",
        },
        json=body,
    )

res.raise_for_status()

with open("output.mp3", "wb") as f:
    f.write(res.content)

他の Fish Audio API コールとの唯一の違いは、ヘッダーで model: "s2.1-pro-free" を設定することだけです。それだけで完了です。

無料の API キーを取得する →


S2.1 Pro vs ElevenLabs:2026年における最高の TTS API

以下の競合他社の情報は、2026年6月時点の公開ドキュメントおよび価格ページに基づいています。価格や機能は変更される可能性があるため、導入の際は各プロバイダーに直接確認してください。

2026年の無料 TTS API 比較:Fish Audio S2.1-Pro vs ElevenLabs vs OpenAI TTS vs Google Cloud TTS

より詳細な独立分析については、私たちの ブラインド TTS プロバイダー比較 をご覧ください。

結論: 私たちが評価した主要な TTS API プロバイダーの中で、Fish Audio は現在最も寛容な無料アクセスモデルを提供しています。無料枠で有料枠と同じ最先端モデルを実行でき、かつ厳格な使用制限がないのは Fish Audio だけです。ElevenLabs の無料枠は実質的に 10,000 クレジットのお試し版であり、Google の最も高度な TTS (Gemini TTS) には無料枠が全くありません。

モデルの品質に妥協しない無料の ElevenLabs 代替案をお探しですか? S2.1 Pro は使用制限なしで今すぐ利用可能です。

無料の OpenAI TTS 代替案をお探しですか? OpenAI の TTS サービスには無料枠がありません。S2.1 Pro は最初に検討すべき強力な選択肢です。

API ドキュメントを確認して構築を始める →


S2.1 Pro で構築できるもの

無料枠ではユースケースを意図的に制限していません。S2.1 Pro の「低遅延 AI 音声生成」「多言語対応」「ボイスクローニング」の組み合わせが特に効果を発揮するシナリオは以下の通りです。

音声エージェント

リアルタイムの会話型 AI の成否は遅延にかかっています。標準コールで約 90ms という TTFA を持つ S2.1 Pro は、自然な対話を行うのに十分な速さです。音声認識 (STT) レイヤーや LLM と組み合わせることで、文字数ごとの課金を気にせずに完全な音声パイプラインを構築できます。また、MCP およびエージェントスキルサポートを通じて S2.1 Pro をエージェントワークフローに統合することも可能です。

オーディオブックと長尺のナレーション

83 言語への対応と自然な韻律により、S2.1 Pro はオーディオブック制作や長尺の音声合成に適しています。無制限に利用できるため、文字数カウンターを気にしたりクレジットを事前購入したりすることなく、原稿全体を処理できます。

ボイスクローニング

S2.1 Pro は API 経由での 参照音声からのボイスクローニング をサポートしています。参照音声サンプルを渡すだけで、その声で音声を合成できます。パーソナライズされた音声アプリケーションの構築、話者のアイデンティティを維持したコンテンツのローカライズ、ゲームやアニメのキャラクターボイスの生成などに活用してください。ボイスクローニングは無料枠でも利用可能で、他の用途と同様にフェアユースポリシーが適用されます。

多言語アプリケーション

複数の言語のユーザーにサービスを提供する場合、単一の API で 83 言語をカバーできることは、言語ごとにエンドポイントを分けたり、英語以外の音声合成にプレミアム料金を支払ったりする必要がある代替案と比較して、大幅な簡素化につながります。

ゲーム NPC の対話

ゲーム音声のパイプラインは、高いスループットと予測可能なリクエストコストの恩恵を受けます。無料枠を無制限に利用できるため、制作予算を確定させる前に、開発段階で大量の対話ライブラリを生成し、自由に試行錯誤することが可能になります。


パートナーエコシステムを通じた提供

S2.1 Pro は、RunwareRetellSierra など、増え続けるパートナープラットフォームを通じても利用可能です。

これらのプラットフォームを既に使用している場合、追加の統合やセットアップなしで S2.1 Pro にアクセスできます。既存の環境をそのままお使いください。

私たちはパートナーネットワークを積極的に拡大しています。S2.1 Pro の統合に興味があるプラットフォームやインフラプロバイダーの方は、私たちのチームにお問い合わせください


フェアユースと今後の展望

無料枠はフェアユースポリシーに基づいて運営されています。開発ではなく乱用と思われる利用パターンについては、アクセスを制限する権利を留保します。これは、正当なユースケースに対して恣意的な制限を設けるためではなく、開発者コミュニティ全体のアクセスを保護することを目的としています。詳細は 価格とレート制限 を参照してください。

今後の予定は以下の通りです:

  • 無料アクセスは現在提供中です(初期設定期間あり)。変更がある場合は事前に通知します。
  • プロダクション環境向けに、SLA 保証、遅延コミットメント、商用ライセンスを含む 有料プラン を用意しています。
  • インフラへの投資は継続的に行われます。この無料枠を可能にしたエンジニアリングの取り組みは、一度限りのものではありません。
  • オープンソースインフラ: S2.1 Pro を支えるインフラコンポーネント(無料枠を継続可能にしているスタックと同じもの)のオープンソース化を計画しています。

Fish Audio を商用導入のために評価されている場合、この無料枠は最適なスタート地点となります。実際に構築し、アプリケーションにとって重要な指標を測定した上で、プロダクション要件について相談が必要になった際にご連絡ください。

クレジットカード不要。ウェイティングリストなし。試せることに制限はありません。

無料の API キーを取得する →

よくある質問

テキスト読み上げ(TTS)API とは何ですか?
テキスト読み上げ API(TTS API)は、書き言葉を音声に変換するウェブサービスです。開発者が API エンドポイントにテキストを送信すると、MP3、WAV、Opus などの音声ファイルが返されます。これらはアプリケーションで再生したり、保存したり、リアルタイムでストリーミングしたりできます。S2.1 Pro のような最新の AI 音声 API は、ニューラル音声合成モデルを使用して、人間の声と区別がつかないほど自然な音声を生成します。
Fish Audio S2.1 Pro は本当に無料ですか?
はい。S2.1 Pro は、モデル文字列 `s2.1-pro-free` を使用することで Fish API から無料で利用できます。厳格な文字数制限はありませんが、乱用を防ぐためにフェアユースポリシーが適用されます。無料枠には SLA や遅延保証はなく、リクエスト内容はモデル改善のために保持される場合があります。これは開発、プロトタイピング、評価を目的として設計されています。詳細は [価格とレート制限](https://docs.fish.audio/developer-guide/models-pricing/pricing-and-rate-limits) を参照してください。
2026年で最高の無料 TTS API はどれですか?
最適な無料 TTS API はユースケースによって異なります。主要なプロバイダーの中では、Fish Audio S2.1 Pro が最新世代のモデルへの寛容な無料アクセスを提供しており、文字数制限がなく 83 言語をサポートしています。ElevenLabs は月間 10,000 クレジットの無料枠を提供しています。Google の従来の WaveNet 音声は月間 400 万文字まで無料です。OpenAI TTS や Google の最新の Gemini TTS には無料枠はありません。予算の制約なく最先端の AI 音声 API を評価したい開発者にとって、S2.1 Pro は強力な選択肢です。
Fish Audio は ElevenLabs と比べてどうですか?
Fish Audio と ElevenLabs はどちらも高品質なニューラル音声生成とボイスクローニングを提供しています。無料枠における主な違いは、Fish Audio が有料枠と同じ S2.1 Pro モデルを文字数制限なしで提供しているのに対し、ElevenLabs は月間 10,000 クレジットに制限されている点です。対応言語数では、Fish Audio の 83 言語以上に対し、ElevenLabs は 70 言語以上です。ElevenLabs は構築済み音声のライブラリが豊富で、クリエイティブコンテンツのエコシステムが確立されています。Fish Audio は、低遅延、高並列、多言語対応を必要とする開発者向けのユースケースに強い傾向があります。詳細は [ブラインド TTS 比較](https://fish.audio/blog/blind-tts-provider-comparison-2026/) をご覧ください。
Fish Audio はボイスクローニングをサポートしていますか?
はい。S2.1 Pro は [参照音声からのボイスクローニング](https://docs.fish.audio/features/voice-cloning) をサポートしています。参照音声サンプルを渡すことで、モデルはその声で音声を合成します。これは対応している全 83 言語で機能するため、話者の同一性を維持する必要があるコンテンツのローカライズに特に有効です。私たちのボイスクローニングシステムはクラス最高レベルであり、高い話者の一致度、自然な韻律、言語やアクセントを問わない安定したパフォーマンスを提供します。ボイスクローニングは、他の用途と同様のフェアユースポリシーの下で無料枠でも利用可能です。
Fish Audio を商用利用できますか?
無料枠 (`s2.1-pro-free`) には、特定の商用シナリオにおいて制限がある場合があります。完全なライセンス、SLA、データ保持なしの商用利用については、Fish Audio の有料プランをご検討ください。最新のポリシーについては、[価格とレート制限](https://docs.fish.audio/developer-guide/models-pricing/pricing-and-rate-limits) および [利用規約](https://fish.audio/terms/) を参照してください。
Fish Audio はどの言語をサポートしていますか?
S2.1 Pro は、日本語、英語、韓国語、中国語、スペイン語、ポルトガル語、アラビア語、フランス語、ドイツ語、ロシア語、イタリア語、トルコ語、オランダ語、ポーランド語、ベトナム語、タイ語、インドネシア語などを含む 83 言語をサポートしています。すべての言語は単一のモデルで提供されるため、言語別のエンドポイントや料金体系はありません。
Shijia Liao

Shijia LiaoX

Founder & Chief-Scientist of Fish Audio.

Shijia Liaoの他の記事を読む

自然で感情豊かな声を生み出す

今日から、最高品質の音声作成を始めましょう

すでにアカウントをお持ちですか? ログイン