信じられないほどリアルな音声を生成
Fish Audio S2を試すS2の特徴
表現力、スピード、オープンネス。すべてをゼロから追求した音声AI。
超低遅延
150ms未満の高速レスポンスで、リアルタイムな対話型AIやライブ吹き替え、インタラクティブな音声アプリを実現。音質を落とすことなく、商用環境でも安心して使える圧倒的なパフォーマンスを提供します。

<150ms
150ms未満の応答速度により、リアルタイム会話AIやライブ吹替、インタラクティブな音声アプリを実現。品質を妥協することなく、本番運用に耐えうる圧巻のパフォーマンスを発揮します。
テキスト指示だけで、感情や声の表情を自由自在にコントロール。笑い声やささやき、ため息など、あらゆる表現を簡単に追加できます。さらに、一度の音声生成で複数の話者をスムーズに切り替え、自然な会話シーンを作成可能です。

<|speaker:1|> [giggles]
完全オープンソース
推論コードとモデル重みの両方を完全オープンソースで公開。自社インフラでの運用、独自データによるファインチューニング、ベンダーロックインのない自由なシステム統合が可能です。高い透明性と、コミュニティ主導のイノベーションを目指して開発されています。

Built with SGLang
Fish Audio S2 APIで構築
80以上の言語に対応し、感情、演出指示、複数話者コントロールを備えたリアルな音声を生成します。

from fishaudio import FishAudio
from fishaudio.utils import save
# Initialize with your API key
client = FishAudio(api_key="your_api_key_here")
# Generate speech
audio = client.tts.convert(text="Fish Audio S2 is the best voice AI model.", model="s2-pro")
save(audio, "welcome.mp3")よくある質問
Fish Audio S2 Proは、韻律と感情のきめ細やかなインライン制御を備えた最先端のテキスト読み上げモデルです。80以上の言語にわたる1,000万時間以上の音声データで学習され、強化学習アラインメントとデュアル自己回帰(Dual-AR)アーキテクチャを組み合わせています。40億パラメータのSlow ARが意味予測を、4億パラメータのFast ARが音響の詳細処理を担当。モデル重み、ファインチューニングコード、およびSGLangベースのストリーミング推論エンジンを公開しています。
S2 Proは、[tag] 構文を使用してテキスト内に自然言語の指示を直接埋め込むことで、音声生成のピンポイントな制御を実現します。あらかじめ定義されたタグセットに依存せず、[whisper in small voice]、[professional broadcast tone]、[pitch up] などの自由形式なテキスト表現を受け入れ、単語レベルでの自由度の高い表現制御を可能にします。[pause]、[emphasis]、[laughing]、[excited]、[whisper]、[singing] など、15,000種類以上のタグがサポートされています。
1枚のNVIDIA H200 GPU上で、S2 Proはリアルタイムファクター(RTF)0.195、最初の音声が出力されるまでの時間約100ms、毎秒3,000以上の音響トークンスループットを達成しつつ、RTFを0.5以下に維持します。SGLangベースの推論エンジンは、連続バッチ処理、Paged KV Cache、CUDAグラフリプレイ、RadixAttentionベースのプレフィックスキャッシングなど、あらゆるLLMネイティブなサービング最適化を継承しています。
S2 Proは80以上の言語をサポートしています。Tier 1言語(最高品質)には日本語、英語、中国語が含まれます。Tier 2言語には韓国語、スペイン語、ポルトガル語、アラビア語、ロシア語、フランス語、ドイツ語が含まれます。スウェーデン語、イタリア語、トルコ語、オランダ語、ヒンディー語、タイ語、ベトナム語なども対応しています。
S2 ProはFish Audio Research Licenseの下でライセンスされています。研究および非商用利用は無料で許可されています。商用利用にはFish Audioからの別途ライセンスが必要です。詳細はbusiness@fish.audioまでお問い合わせください。