5 个模型,22 个人,1 年
Fish Audio 筹集了 5200 万美元的种子轮融资。一个单块 4090 上的业余项目是如何演变至此的,以及我们下一步的计划。阅读我们的故事。
今天标志着 Fish Audio 的又一个里程碑。 在我们成立一周年之际,我们宣布获得 5200 万美元的种子轮融资。感谢领投方 Coreline Ventures 和 Capital Today,以及参投方 359 Capital, Play Time, HF0, 645 Ventures, Parable, Carya Venture Partners, Alphalist Partners,还有在项目初期就给予支持的天使投资人们。
文本转语音技术在过去十年里表现尚可,前提是如果你只需要合成一句话。但在合成到第十句时,瑕疵就开始显现。整个品类都在同一个地方、出于同一个原因遭遇瓶颈:准确读出词句和呈现完美表现力是两个不同的问题,而几乎所有人一直以来都只在解决第一个问题。
在 Amazon Alexa 和 Meta 从事语音 AI 的多年经验告诉我传统 TTS 的局限在哪里:为朗读而构建的声音永远学不会表演。所以我们从另一端开始。Fish Audio 不仅仅是一个更好的语音助手,它是其后所有事物的语音层。
4090 显卡
我们的首席科学家 Shijia Liao 从另一个方向得出了同样的结论。作为 NVIDIA 处理视频的研发工程师,他业余时间喜欢看 VTuber 直播,却总觉得那些声音毫无生气。他开始在卧室里用一块 4090 训练模型,早期便押注于双自回归架构(dual autoregressive architecture),而行业内其他公司直到两年后才追赶上来。这项工作成为了 S2 的基石。
这一年我们做了什么
- 发布了五个 SOTA 级音频模型。四个文本转语音模型,一个语音转文本模型。
- 团队规模从 3 人扩大到 22 人,且仍在招聘中。
- 年度经常性收入(ARR)从零增长至 2100 万美元。
- 平台拥有超过 800 万名创作者、开发者和企业用户。
- 社区库中拥有超过 200 万个语音模型。
- 在盲听测试中,66% 的听众认为 S2.1 Pro 优于领先的竞争对手。
- 支持 83 种以上的语言,具备地道的语调,并通过 15,000 多个自然语言控制指令实现词级情感控制。
社区共同构建了模型
我们根据真实用户的偏好进行后期训练,这意味着人们用得越多,模型就越出色。这就是为什么我们在带口音的英语、普通话、日语、韩语和西班牙语方面表现强劲,而那些主要基于标准美式英语训练的模型在这些领域往往表现不佳。这种能力源于用户在各种语言、口音和我们从未想过要测试的极端案例中对工具的使用。
由于游戏开发者、动漫粉丝和单纯为了好玩而为角色配音的人们,Fish Speech 从一个代码仓库变成了一家公司。从一开始,我们就相信透明和开放,并致力于让每个人都能获得极具表现力、高质量的语音 AI。
八百万用户信任我们能做到这一点。
企业现在信任的模型
正是这种信任,让企业也开始转向 Fish Audio。连同开发者在内,企业业务现在贡献了我们三分之二的收入。
我们为他们提供在线率、低延迟以及能够通过合规审查的安全架构:本地化部署、零数据保留政策和符合 HIPAA 标准的配置,这些从一开始就已内置。S2.1 Pro 在盲听测试中已经战胜了领先的模型,在单块 H200 上能达到每秒 8,000+ token 的运行速度,并且在那些专为单一方言优化的模型容易崩溃的语言中依然表现稳健。
企业客户选择我们是因为准确的情感表达(delivery),而不仅仅是词句(words),这正是我们致力于解决的问题。这也是我们现在能够进一步推进的使命。
下一步是什么?
文本转语音从来不是全部目标。这只是我们可以利用单块 GPU 首先构建并证明理论的部分:情感表达与文字本身同样重要,而此前没有人去解决它。
现在我们要攻克技术栈的其余部分。音频理解语言模型(Audio LM)和语音转语音(speech-to-speech)。我们还将加倍投入开发者工具和 API,扩大我们的企业团队,并与 LiveKit 和 Retell 等合作伙伴深入合作,让极具表现力的声音更快地应用到更多场景中。
八月全月免费
为庆祝这一重大里程碑,S2.1 Pro 将在八月底前通过 API 对所有开发者免费开放。这是我们企业级客户付费使用的同款模型。我们还将为创作者计划提供 5 折优惠,如果您是从其他供应商迁移过来的,还可享受 3 个月的免费试用。
我们之所以能做到这一点是出于技术原因,这归功于我们的研究团队。他们今年重构了我们的整个推理栈:自定义 FP8 算子,在单块 H200 上实现每秒 8,000+ token。这使得我们的单次请求成本降到了足够低的水平,让赠送模型成为一种成功的策略。
谢谢大家
一年前,Fish Audio 只是我们客厅里的一个业余项目。每一位训练过声音、为角色配音、基于 API 进行构建或在项目初现端倪时就押注我们的人 —— 这份成就既属于我们,也属于你们。
一路上我们犯过很多错误。现在我们即将拥有资源,去把更多的事情做对。
致敬第二年。
Rissa is the CEO and co-founder of Fish Audio, pushing breakthroughs in AI voice technology. Find her latest work at @rissa_cao.
阅读Rissa Cao的更多内容