Dubbing AI が求めたのは、音声アシスタントではなく人と話しているような Voice Agent
Dubbing AI はすでに音声を中心としたプラットフォームを構築していました。ユーザーはリアルタイムの声の変更やクローン、アクセントの調整、言語間の翻訳を利用できます。Voice Agent はそこに、AI がユーザーに代わって話すという新しい方向性を加えました。
活用場面はすぐに見えてきました。ゲーム中の会話にエージェントが応答したり、忙しくて電話をかけられない人の代わりに電話をしたり、一時的に話せない人がリアルタイムでやり取りしたりできます。
ただし、その体験が成立するのは声が本物らしく聞こえる場合だけです。
目立つ間や単調で機械的な応答は、会話を不自然にします。Dubbing AI にとってリアルタイム TTS は、単に速く音声を生成することではありません。自然さ、感情、話者らしさを保ち、世界中のユーザーが必要とする言語に対応する必要がありました。
最速のモデルでも、声が単調では不十分
Dubbing AI は Voice Agent の体験要件に照らして複数の TTS プロバイダーを評価しました。基準は自然さ、感情の深み、音声クローンの品質、遅延、多言語対応の5つに絞られました。
評価では難しいトレードオフが明らかになりました。低遅延のモデルは感情表現に乏しく、表現豊かなモデルは会話を妨げる遅延を生むことがあります。ある言語では優れていても、言語を切り替えると品質が落ちるモデルもありました。
ゲーム、エンターテインメント、商用用途で1,000万人以上が使う製品には、体験の一部だけが優れていても足りません。
Dubbing AI には、すべての基準を同時に満たすモデルが必要でした。
Fish Audio は卓越した音声の自然さ、豊かな感情表現、そして信頼性の高い低遅延 TTS を提供し、当社の中核プロダクトである Voice Agent の体験をしっかりと下支えしています。

Tiange Ling
Dubbing AI CEO
5つの要件をすべて満たした唯一のモデルが Fish Audio
Fish Audio は、自然な音声、感情の深み、高品質な音声クローン、低遅延、多言語対応という、Dubbing AI が Voice Agent に求める能力を兼ね備えている点で際立ちました。
各基準は結び付いているため、この違いは重要でした。自然さは声に信頼感を、感情表現は人間味を与えます。音声クローンは話者らしさを保ち、低遅延は会話を円滑にし、多言語対応は世界中の Dubbing AI ユーザーに同じ体験を届けます。
Fish Audio はネイティブな言語切り替えを含む 80 以上の言語に対応し、リアルタイムのやり取りに必要な応答性も維持していました。
自然さ
合成音ではなく、人が話すような音声
感情の深さ
細かなニュアンスまで伝わる表現
音声クローン
話者らしさを保つクローン音声
低レイテンシー
目立つ遅延のないリアルタイム応答
多言語対応
80以上の言語とネイティブな言語切り替え
Fish Audio が Dubbing AI の Voice Agent 拡大を支える
Voice Agent は、技術的な可能性から、Dubbing AI が世界中のユーザーに届けられる製品へと進んでいます。Fish Audio がリアルタイム TTS を担うことで、Dubbing AI は必要な速度、表現力、音質を維持しながら、新しいコミュニケーション手段の開発に集中できます。
その結果生まれるのは、ただ応答するだけでなく、話し続けたくなる声のエージェントです。