1 周年

$52M シード調達

8M+ クリエイター

私たちのストーリー

導入事例

1,000 万ユーザー向けのリアルタイム音声エージェント TTS。

Dubbing AI が Fish Audio 上で Voice Agent を構築した方法。リアルタイムエージェントに必要な自然さ、感情表現、音声クローン品質、低遅延、多言語対応の 5 つをすべて満たした TTS です。

業界
コンシューマー · ゲーム · エンターテインメント
地域
グローバル
ユースケース
音声エージェント(リアルタイム TTS)
対象ユーザー
1,000 万人以上のユーザー
導入形態
Cloud API · デスクトップ & モバイル
ステータス
Voice Agent ベータ版
10M+

ゲーム、配信、エンターテインメント全体で、音声エージェントがユーザーの言語でリアルタイムに本物らしく感じられる必要がある規模です。

Dubbing AI

Tiange Ling

Dubbing AI CEO

"Fish Audio は卓越した音声の自然さ、豊かな感情表現、そして信頼性の高い低遅延 TTS を提供し、当社の中核プロダクトである Voice Agent の体験をしっかりと下支えしています。"

Fish Audio CEO

Rissa Cao

"音声エージェントは、音声 AI のあらゆるトレードオフが露呈するユースケースです。速くても平坦ではダメですし、表現力があっても遅くては成り立ちません。エージェントはユーザーの言語で、リアルタイムに、本物のように聞こえる必要があります。Dubbing AI が作っているのは、その中でも最も難しい形態です。ユーザーが話せない、または話したくないときに、その人の代わりに話す声です。求められる基準はアイデンティティレベルのリアリズムであり、まさにその基準を超えるために私たちは S2 Pro を作り上げました。"
Dubbing AI

Dubbing AI について — 音声生成・クローン・変声で 1,000 万ユーザーを誇る音声AI

Dubbing AI は、デスクトップおよびモバイルで音声作成、ボイスクローニング、リアルタイムボイスチェンジをワンストップで提供するローカルエンド型 AI 音声技術プロダクトです。世界で 1,000 万人以上のユーザーに利用されており、主に 3 つのコアユーザー層に対応しています:コンテンツクリエイターと配信者、個人のエンタメユーザー、広告代理店やメディア企業を含む商用ユーザー

Dubbing AI は、ゲーマー、配信者、ブランドクリエイターが活動するプラットフォーム上で、リアルタイムに声を形作り、変え、クローンするための音声レイヤーです

Voice Agent の紹介 — あなたの代わりに話すエージェント

Dubbing AI の最新機能『Voice Agent』は、プラットフォームの音声ツールキットを変声から発話へと拡張します。ユーザー自身の声を変えるのではなく、Voice Agent がユーザーの代わりに話します。

ユースケースは非常に身近で、人間味に満ちています。たとえばゲーム中に口論になり、事態をこれ以上こじらせたくないとき、Voice Agent が代わりに落ち着いて話してくれます。疲れていて電話予約をする気力すら湧かないときは、Voice Agent が代わりに電話をかけます。人見知りで緊張してしまうとき、仕事で手が塞がっているとき、あるいは一時的に声が出せない状況でも、Voice Agent がリアルタイムなコミュニケーションを可能にします。

これは、ボイスチェンジ、アクセント補正、リアルタイム翻訳、そして Voice Agent に至るまで、Dubbing AI のあらゆる機能に貫かれているプロダクトミッションの延長線上にあります人々がよりスムーズにコミュニケーションを図り、より効果的に自分を表現できるよう支援することVoice Agent は、自分で話すことが困難な状況や、自ら話すことが理想的ではない場面にまで、そのミッションを広げます

Voice Agent が成立するためには、AI の声が本物のように感じられる必要があります。ゲームの対戦相手やレストランの受付スタッフ、電話の向こう側の相手が、いかにも合成された音声ではなく、生身の人と話していると感じられること。そこに Fish Audio の技術が必要となったのです。

音声エージェント向けリアルタイム TTS の課題:レイテンシー vs 自然さ

音声エージェントは、音声 AI における最も難しいトレードオフを可視化します。ボイスエージェント向けのリアルタイム TTS は、レイテンシー(応答遅延)と自然さ、そして感情表現のバランスを取る必要がありますが、多くのプロバイダーはユーザーに二者択一を迫ります。低レイテンシーモデルは抑揚がなく機械的に聞こえがちであり、表現力豊かなモデルは会話の流れを壊す処理遅延を引き起こしがちです。

Dubbing AI の Voice Agent にとって、この両者はどちらも譲れない命題です。発話入力から応答までにあからさまなタイムラグが生じれば、『生身の人間と会話している』という臨場感は失われてしまいます。一方で、どれほどレスポンスが速くとも声が無機質であれば、まったく別の形でその臨場感は破綻してしまうのです。真の鍵となるのは一方の追求ではなく、その高次元な融合にあります。

Dubbing AI が音声エージェント基盤のために TTS 市場を評価した理由

Dubbing AI は、Fish Audio の採用に至るまでに複数の TTS 音声ワークフローを比較検証しました。その評価基準は、ボイスエージェント向け TTS に求められる構造的な要求と直結するものでした。自然さ、感情の深さ、音声クローン品質、低レイテンシー、多言語対応 — 多くのプロバイダーはこのうち 2 つか 3 つを満たすのが限界ですが、5 つすべてを実現できるケースは極めて稀です。

ゲーム、エンタメ、商用を網羅する 1,000 万人規模の Voice Agent では、自然さがあっても多言語化できないモデルや、低遅延でも感情を失うモデルは不採用となりました。Voice Agent に求められたのは、5 つの基準すべてを満たす『All-or-Nothing』の厳しい評価だったのです。

Fish Audio が Voice Agent 評価で選ばれた理由 — 5 つの基準すべて

Fish Audio は、リアルタイム Voice Agent が求める 5 つの能力をすべて兼ね備える点において他と一線を画しました。単一の指標でしか優れていない他社モデルが不採用となるなか、全評価軸で基準をクリアしたのは Fish Audio だけだったのです。

· 自然さ
合成音声の読み上げではなく、るで生身の人間が喋っているかのような音声出力
· 感情の深さ
発話全体にしっかりと乗る感情のニュアンス。従来の低遅延モデルが犠牲にしてきた領域です。
· 音声クローン品質
コンテンツが変わっても崩れない声のアイデンティティ。クリエイターやエンタメユーザーに不可欠な品質です
· 低レイテンシー
目立つ不自然な間を感じさせない即答性。会話型エージェントにおける絶対条件です。
· 多言語対応
80 以上の多言語対応と自然なコードスイッチング。グローバル展開に不可欠な強みです。

Dubbing AI における Fish Audio の活用事例

Dubbing AI は Voice Agent のリアルタイム TTS 生成に、クラウド API 経由で Fish Audio を採用。ユーザーがテキストを入力すると、Fish はそれを自然で感情豊かな音声へリアルタイム変換し、世界中の多言語・アクセントに対応します。

Voice Agent はデスクトップとモバイルの両方でクロスプラットフォームに動作し、Dubbing AI プラットフォームの他の機能と同じ対応範囲をカバーしていますVoice Agent は、まず本プラットフォームのゲーマー層に向けてベータ公開の準備を進めています—この層こそ、Voice Agent の想定ユースケースに最も強いニーズを持つユーザーです。ベータ公開に向けた社内テストも非常に良好な結果を得ています。

導入によって得られた成果

利用製品:Fish Audio S2 Pro · Text-to-Speech(クラウド API)

ゲーム、ライブ配信、商用クリエイターなど、Dubbing AI の広範なプラットフォーム全体で 1,000 万人以上のユーザーを獲得

Fish Audio は 5 つの評価基準をすべてクリア:自然さ、感情表現の豊かさ、音声クローン品質、低レイテンシー、多言語対応

Voice Agent のベータ版は、まずゲーマー層に向けて先行公開予定。社内テストも非常に好調です。

デスクトップ&モバイルに完全対応。Dubbing AI 全体の提供環境を全方位カバー。

Dubbing AIとFish Audioの次の展開。

Voice Agentがベータ版からDubbing AIの1,000万人のユーザーに向けた一般提供へ進む中、Fish Audioはその体験を支えるリアルタイムTTSレイヤーであり続けます。今後のVoice Agentの拡張(より多くの言語、より多くの利用シーン、より多くのクロスプラットフォーム文脈)は、Fishの継続的なモデル改善とともに提供されます。

Fish Audio

ボイスエージェントを構築していますか?

自然さ、感情表現、低遅延、多言語対応を同時に満たす、ボイスエージェント向けリアルタイムTTSについてご相談ください。