企业级语音基础设施

为规模化交付语音应用的团队而生。为每一次都必须准确可靠的应用,提供核心语音模型支持。

8M+
开发者
4.6M
每日请求量
26%
字词错误率降低
<70ms
延迟

受到生产环境语音团队的信赖

为什么团队选择与我们共创。

设置

$10K 起平台费 · 一次性

部署

VPC · 本地部署 · 隔离环境 · 主权云

最低消费

$10K/月 · 12 个月承诺

面向受监管工作负载、主权部署,以及需要完全掌控生产模型运行方式的团队,Fish 提供高级企业自托管层。可运行在你的 VPC、隔离环境或数据中心。它提供采购架构时常被要求、却很少真正拿到的能力。

生产成果,不是演示胜利。

重点不是“质量很好”。而是团队切换之后取得了什么成果。每个故事都是客户写下的、可量化的结果。

在非美式英语口音的声音克隆中,以 3:1 胜出其他替代方案。

1000 万+ 用户提供实时语音 agent TTS,兼具自然度、情绪、低延迟和多语言能力。

为企业对话提供具备实时编排能力的生产级语音 agent。

25%+ AI 面试参与时长增长 · ~10x 使用 Fish Audio 后语音成本降低

高级支持。

因为您的客户始终在倾听。

全天候生产支持

直接联系语音 AI 专家,针对影响客户体验的问题获得响应承诺。

技术客户经理

获得专属团队支持,深入了解您的语音技术栈,协助解决复杂问题,并支持业务规模化发展。

99% 可用性 SLA

依托基础设施服务承诺,确保您的语音应用持续可用、响应及时,随时应对每一次交互。

定制服务

与我们的工程师合作,开展架构评审、系统集成和性能调优,让生产级语音体验落地。

六类语音产品,
今天已经在生产环境交付。

从头像视频到多语言客服,下面每个类别都是真正在 Fish 上运行的企业部署,而不是路线图承诺。

面向 AI agent 的语音

角色与陪伴应用。

头像与视频配音

多语言客户支持。

普通话 · 日语 · 韩语 · 粤语

规模化声音克隆。

200 万声音生态 · 30 秒克隆

音频翻译与配音。

覆盖 80+ 语言 · 代码切换

接入你已经使用的语音 agent 技术栈。

即插即用支持语音团队今天用于上线的编排、电话和基础设施工具。覆盖主流语言的 SDK。WebSocket 流式、REST 和入站 webhook 模式均有文档。

准备好时,我们随时在。

和我们的团队聊聊你的部署计划。我们会带着准备来。

常见问题

我的数据存储在哪里?你们支持美国、欧盟和 APAC 数据驻留吗?

默认情况下,你的数据会保留在美国,托管在 Google Cloud,并使用 Cloudflare R2 存储;推理会从美国和亚太地区(东京)的边缘区域运行,让你的用户无论在哪里都能获得低延迟。对于受合规约束的工作负载,企业合同可以开启 Zero Data Retention,这意味着请求文本和音频永远不会写入磁盘。如果你的数据必须留在特定国家或地区,self-hosted enterprise 档位会完全运行在你自己的基础设施内,因此数据不会离开你的环境。

你们能支持大规模部署和流量峰值吗?

可以,而且可以支持很大的规模。容量会以并发生成数的形式按合同配置并扩展,我们已经有生产客户运行超过 1,000 路并发生成。Rust 边缘网关会在多个 GPU 区域之间服务推理,因此当流量激增时,我们的团队可以在当天提升你的限制。你可以扩容,而不必排队等待支持工单。

你们有哪些安全认证?

安全贯穿平台的每一层。我们的 SOC 2 Type II 审计正在进行中,完成后报告可在 NDA 下提供给客户。企业合同可使用 Zero Data Retention,因此请求载荷不会被持久化;self-hosted 档位会把你的每一字节数据都留在自己的环境内。我们也支持符合 HIPAA 要求的配置,并可为符合条件的医疗健康工作负载签署 BAA;独立渗透测试也是我们持续合规计划的一部分。

你们是否为自定义部署提供工程支持?

当然。企业客户可以直接联系我们的工程团队,而不是进入工单队列,并可使用最适合你团队工作方式的沟通渠道。我们会定期为单个客户交付面向其集成的功能和协议扩展,也会与你们一起端到端落地 self-hosted 部署,从首次设置直到 go-live。

你们支持 SSO 和 RBAC 吗?

支持,并且从一开始就提供细粒度控制。基于角色的访问控制允许你在团队级别分配 owner、admin 和 member 角色,并在 workspace 级别分配 manager、contributor 和 viewer 角色,确保每个人只拥有应有的访问权限。单点登录目前支持 Google 和 GitHub OAuth。

我们可以用自己的数据微调模型,或使用自己的声音吗?

两者都可以,并且由你掌控。你可以通过 API 或 Web UI,使用短至 10 秒的参考音频立即创建私有声音克隆,30 秒或更长音频效果最佳;这些声音会完全私有地保留在你的团队内。对于更深入的合作,我们也会使用你自己的数据微调定制模型。

如果从其他语音供应商迁移怎么办?

迁移到 Fish Audio 很直接,而且大多数团队都会惊讶于速度有多快。你的现有声音可以通过参考音频重新创建,我们的 Python、TypeScript 和 Go SDK 以及 WebSocket 流式 API 覆盖你已经依赖的集成模式,我们的工程团队会与你一起执行切换,确保生产不中断。