1 周年。

$52M 种子轮。

8M+ 创作者。

阅读我们的故事
2026年6月23日研究

Fish Audio S2.1 Pro:面向开发者的免费文本转语音 API

Fish Audio S2.1 Pro:面向开发者的免费文本转语音 API

快速总结:

  • S2.1 Pro 是 Fish Audio 目前最先进的语音模型,现已作为免费文本转语音 API 开放

  • 支持 83 种语言,在公平使用政策 (Fair Use Policy) 下提供无限量使用

  • 模型字符串:s2.1-pro-free —— 直接将其放入您现有的 Fish API 调用中

免费试用 S2.1 Pro —— 5 分钟内获得首个音频 →

2026 年 6 月 | Fish Audio 的 S2.1 Pro 模型现已作为免费文本转语音 API 开放,在公平使用原则下提供无限访问。


为什么高质量语音 AI 总是很贵

如果您曾评估过文本转语音 API,就会发现一个规律:那些听起来真正好的模型通常都要收费。

ElevenLabs 的免费层级每月提供 10,000 个积分(约 6 - 10 分钟),之后就会进入付费墙。OpenAI TTS 是按需付费,完全没有免费层级。Google 最新的 Gemini TTS 模型 —— 他们最先进的模型 —— 没有任何免费额度:从第一个 Token 开始就要付费。整个行业的模式是一致的:最先进的语音质量一直是一项付费功能。

这给开发者带来了真正的难题。AI 语音生成市场正以每年近 20% 的速度增长 —— 但用于构建语音产品的工具却一直被关在付费墙后面。您无法仅用 10,000 个积分就妥善评估一个模型。您无法在不预先投入预算,或者不花数周时间折腾需要自建 GPU 基础设施的开源替代方案的情况下,去原型化一个语音智能体、测试有声读物工作流或尝试语音克隆

Fish Audio 今天正在改变这一现状。


什么是 S2.1 Pro?

S2.1-Pro 基准测试:吞吐量 (tok/s) 和 TTFB p50 (ms),涵盖从 1 到 512 的并发水平,显示在 c=64 时为 8,006 tok/s,在 c=1 时 TTFB 为 73.2ms

S2.1 Pro 是 Fish Audio 目前最先进的语音模型 —— 我们最好的模型,现在通过 API 免费提供给每位开发者。它是一款专为生产级 AI 语音生成设计的神经语音合成模型,在低延迟流式传输、多语言 TTS 和语音克隆方面具有显著优势。它建立在 S2 的基础之上,我们在今年早些时候已经开源了该模型的权重。

性能表现

  • 在面对面听感评估中,对比上一代 S2 Pro 的胜率为 61% —— 请参阅我们的盲测 TTS 供应商对比以了解更多背景
  • 单个请求的首字音频延迟 (TTFA) 约为 70ms —— 低于上一代的约 100ms
  • 高并发负载下的吞吐量提升了 2 倍以上

欲了解完整的技术背景,请参阅我们的论文:点击此处

语言覆盖

S2.1 Pro 支持 83 种语言,包括英语、日语、中文、韩语、西班牙语、阿拉伯语、法语、德语、葡萄牙语、俄语等数十种语言。同一个模型可以处理所有语言 —— 无需单独的端点,没有分语言的定价。

延迟

S2.1-Pro 在标准 API 上提供约 90ms 的 TTFA(首字音频时间),使其适用于实时语音智能体和轮流对话系统。如果您需要对韵律和表达进行细粒度控制,请参阅 S2 的词级语音控制功能


为什么 Fish Audio 现在可以免费提供

Fish Audio S2.1-Pro 推理基础设施:配备 FP8 GEMM 的 NVIDIA H200 和自定义调度程序,每条请求提供 125 音频 token/s (RTF 0.17) 以及约 70ms 的 TTFA

简而言之:我们从底层重构了推理栈,使得单个请求的成本显著下降,降到我们可以自行承担的程度。

自定义 GPU 核函数 (Kernels)

我们开发了 fish-scales-ops,这是一个针对 NVIDIA Hopper (H100/H200) 和 Blackwell (RTX 6000 PRO) 架构的生产级 FP8 GEMM 和 FlashAttention 库。在语音 AI 服务至关重要的解码形态上,我们的 MXFP8 路径性能比 torch.compile 融合的 cuBLAS 参考实现高出 2.1–4.3 倍。您无需理解这些也能使用 API —— 但这就是免费层级能够持续运行的原因。

更高的吞吐量

在具有 FP8 量化的单张 H200 上,系统在 64 个并发请求下保持超过 8,000 token/秒的输出吞吐量。每个 GPU 的吞吐量越高,意味着每美元服务的请求就越多,这使得无限免费访问在经济上变得可行。


“免费”究竟意味着什么

我们宁愿事先说明限制,而不是将其隐藏起来。

您将获得:

  • 模型字符串:s2.1-pro-free
  • 大容量访问,无硬性字符限制(受公平使用政策约束)
  • 与付费计划相同的 API 端点 —— 无需额外集成

当前的限制:

  • 有效期: 免费访问有效期至 2026 年 7 月 24 日 免费访问有效期至 2026 年 7 月底 免费访问有效期至 2026 年 8 月 31 日 —— 任何变动我们都会提前通知。
    • 更新(2026 年 6 月): 我们决定将免费窗口延长至整个 7 月。我们希望开发者有一个完整、不间断的时间段来构建、评估和发布 —— 而不是盯着截止日期倒计时。
    • 更新(2026 年 7 月): 我们再次延长免费访问至 2026 年 8 月 31 日。看到 Fish 开发者们用 S2.1 Pro 构建的作品令我们深受感动,我们希望给这种势头更大的发展空间。
  • 无 SLA: 无可用性/TTFA 保证;专为实验和原型设计而构建
  • 无延迟保证: 尽力而为,而非合同约定
  • 数据留存: 请求可能会被用于提高模型质量 —— 请参阅我们的隐私政策
  • 商业用途: 某些商业场景可能存在限制。年经常性收入 (ARR) 超过 100 万美元的产品在使用 S2.1 Pro Free 之前应联系我们。详情请参阅定价与速率限制

如果您需要生产级 SLA 和延迟保证,可以购买付费计划。而这个免费层级是构建、评估和决策的理想场所。


如何使用免费文本转语音 API:S2.1 Pro 快速上手

fish.audio/app/api-keys 获取您的 API 密钥,然后发起您的第一次调用。Fish API 接受 msgpack 编码的请求,并以您选择的格式返回音频。完整参考请见 API 文档

JavaScript

import { writeFile } from "fs/promises";

const body = {
  text: "Hello, world!",
  reference_id: "your_model_id",
  format: "mp3",
};

const res = await fetch("https://api.fish.audio/v1/tts", {
  method: "POST",
  headers: {
    Authorization: "Bearer <YOUR_API_KEY>",
    "Content-Type": "application/json",
    model: "s2.1-pro-free",
  },
  body: JSON.stringify(body),
});

if (!res.ok) {
  throw new Error(`TTS request failed: ${res.status} ${await res.text()}`);
}

const buffer = Buffer.from(await res.arrayBuffer());
await writeFile("output.mp3", buffer);

Python

import httpx

body = {
    "text": "Hello, world!",
    "reference_id": "your_model_id",
    "format": "mp3",
}

with httpx.Client() as client:
    res = client.post(
        "https://api.fish.audio/v1/tts",
        headers={
            "Authorization": "Bearer <YOUR_API_KEY>",
            "Content-Type": "application/json",
            "model": "s2.1-pro-free",
        },
        json=body,
    )

res.raise_for_status()

with open("output.mp3", "wb") as f:
    f.write(res.content)

相比其他 Fish Audio API 调用,唯一的改变是在 header 中设置 model: "s2.1-pro-free"。就是这么简单。

获取免费 API 密钥 →


S2.1 Pro vs ElevenLabs 以及 2026 年最佳 TTS API

以下竞品信息基于截至 2026 年 6 月的公开文档和定价页面。定价和功能可能会发生变化 —— 在做出生产决策前请直接向各供应商核实。

2026 年免费 TTS API 对比:Fish Audio S2.1-Pro vs ElevenLabs vs OpenAI TTS vs Google Cloud TTS

如需更深入的独立分析,请参阅我们的盲测 TTS 供应商对比 (2026)

核心结论:在我们评估的主要 TTS API 供应商中,Fish Audio 目前提供了最慷慨的免费访问模式之一 —— 这是唯一一个让免费层级运行与付费层级相同的高端模型,且没有硬性使用上限的方案。ElevenLabs 的免费层级实际上是 10,000 积分的试用版。Google 最先进的 TTS (Gemini TTS) 完全没有免费层级。

正在寻找不牺牲模型质量的 ElevenLabs 免费替代方案? S2.1 Pro 现已开放且无使用上限。

正在寻找免费的 OpenAI TTS 替代方案? OpenAI 的 TTS 产品没有免费层级 —— S2.1 Pro 是首选的评估方案。

查看完整 API 文档并开始构建 →


您可以用它构建什么

免费层级在用例上没有刻意限制。以下是 S2.1 Pro 的低延迟 AI 语音生成、多语言支持和声音克隆结合得最出色的场景。

语音智能体 (Voice Agents)

实时对话 AI 成败的关键在于延迟。S2.1 Pro 的标准调用 TTFA 约为 90ms,速度足以实现自然的轮流对话。将其与语音转文本层和 LLM 结合,即可获得完整的语音流水线,且无需按字符买单。您还可以通过我们的 MCP 和智能体技能支持将 S2.1 Pro 集成到智能体工作流中。

有声读物和长篇旁白

83 种语言支持和自然的韵律使 S2.1 Pro 非常适合有声读物制作和长篇语音合成。无限量使用意味着您可以处理完整的原稿,而无需盯着字符计数器或预购积分。

声音克隆 (Voice Cloning)

S2.1 Pro 支持通过 API 从参考音频克隆声音 —— 传入一段参考音频样本,模型即可使用该声音合成语音。您可以构建个性化的语音应用、在保持说话人身份一致的情况下实现内容本地化,或者为游戏和动画生成角色配音。声音克隆在免费层级同样可用,并遵循相同的公平使用政策。

多语言应用

如果您的应用服务于多种语言的用户,使用同一个一致的 AI 语音 API 覆盖 83 种语言,相比那些需要为每种语言使用单独端点或对非英语合成收取更高费用的替代方案,是一种极大的简化。

游戏 NPC 对话

游戏音频流水线受益于高吞吐量和可预测的请求成本。无限量免费使用使得在开发期间大量生成对话库并自由迭代变得切实可行,无需预先承担生产预算。


通过我们的合作伙伴生态系统提供

S2.1 Pro 还通过越来越多的合作伙伴平台提供,包括 RunwareRetellSierra 等。

如果您已经在使用这些平台进行开发,无需额外的集成或设置即可使用 S2.1 Pro —— 直接沿用现有流程即可。

我们正在积极扩展合作伙伴网络。如果您是平台或基础设施供应商,并有兴趣集成 S2.1 Pro,请联系我们的团队探索合作可能。


公平使用与未来展望

免费层级在公平使用政策 (Fair Use Policy) 下运行。对于看起来像滥用而非开发的异常使用模式,我们保留限制或限流的权利 —— 目标是保护整个开发者社区的访问权限,而不是为合法的用例设置人为限制。详情请参阅定价与速率限制

您可以期待以下几点:

  • 免费访问现已开放,初始阶段会持续一段时间。如有任何变动,我们会提前通知。
  • 付费计划提供 SLA 保证、延迟承诺和商业授权,适用于生产环境工作负载。
  • 基础设施投入将持续进行 —— 使这个免费层级成为可能的工程工作并非一劳永逸。
  • 开源基础设施:我们计划将 S2.1 Pro 背后的基础设施组件开源 —— 正是这套技术栈让免费层级可持续运行。

如果您正在评估 Fish Audio 以进行生产部署,免费层级是最佳起点。构建一些真实的东西,衡量对您的应用至关重要的指标,并在准备好讨论生产需求时联系我们。

无需信用卡。无需排队。不限尝试。

获取免费 API 密钥 →

常见问题解答

什么是文本转语音 API?
文本转语音 API (TTS API) 是一种将书面文本转换为语音音频的 Web 服务。开发者将文本字符串发送到 API 端点,并接收回音频文件(通常为 MP3、WAV 或 Opus 格式),这些文件可以在应用程序中播放、存储或实时流式传输。像 S2.1 Pro 这样现代的 AI 语音 API 使用神经语音合成模型来生成自然听感、且难以与真人语音区分的音频。
Fish Audio S2.1 Pro 真的免费吗?
是的。S2.1 Pro 通过使用模型字符串 `s2.1-pro-free` 调用 Fish API 即可免费使用。没有硬性的字符上限 —— 使用情况需遵循公平使用政策 (Fair Use Policy) 以防止滥用。免费层级不提供 SLA 保证和延迟保证,且请求可能会被保留用于模型优化。它专为开发、原型设计和评估而设计。详见[定价与速率限制](https://docs.fish.audio/developer-guide/models-pricing/pricing-and-rate-limits)。
2026 年最好的免费 TTS API 是哪个?
最好的免费 TTS API 取决于您的用例。在主要供应商中:Fish Audio S2.1 Pro 对当前一代模型提供了慷慨的免费访问权限,无硬性使用上限并支持 83 种语言。ElevenLabs 每月提供 10,000 个免费积分,可访问其声音库。Google 的旧版 WaveNet 语音每月免费额度高达 400 万字符。OpenAI TTS 和 Google 最新的 Gemini TTS 没有免费层级。对于希望在无预算约束下评估最先进 AI 语音 API 的开发者来说,S2.1 Pro 是一个强有力的起点。
Fish Audio 与 ElevenLabs 相比如何?
Fish Audio 和 ElevenLabs 都提供高质量的神经语音生成和声音克隆。免费层级的主要实际区别在于:Fish Audio 的免费层级运行与付费层级相同的 S2.1 Pro 模型,且无硬性使用上限;而 ElevenLabs 的免费层级每月限制在 10,000 积分。在语言覆盖上,Fish Audio 支持 83 种语言,而 ElevenLabs 支持 70 多种。ElevenLabs 拥有更丰富的预建声音库和更成熟的创意内容生态系统。Fish Audio 则在需要低延迟、高并发或多语言支持的开发者导向用例中表现更强。请参阅我们的[盲测 TTS 对比](https://fish.audio/blog/blind-tts-provider-comparison-2026/)了解独立基准测试。
Fish Audio 支持声音克隆吗?
是的。S2.1 Pro 支持[从参考音频进行声音克隆](https://docs.fish.audio/features/voice-cloning)。您可以上传一段参考音频样本,模型将以该声音合成语音。这适用于所有 83 种支持的语言,对于需要保持说话人身份一致性的内容本地化特别有用。我们的声音克隆系统是同类产品中最强的系统之一,能够跨语言和口音提供高度的说话人一致性、自然的韵律和稳定的性能。声音克隆在免费层级可用,同样遵循 s2.1-pro-free 的公平使用政策。
我可以将 Fish Audio 用于商业用途吗?
免费层级 (`s2.1-pro-free`) 在某些商业场景中可能存在限制。如需具有完整许可、SLA 保证且无数据留存的生产级商业用途,请参考 Fish Audio 的付费计划。当前政策请参阅[定价与速率限制](https://docs.fish.audio/developer-guide/models-pricing/pricing-and-rate-limits)和[服务条款](https://fish.audio/terms/)。
Fish Audio 支持哪些语言?
S2.1 Pro 支持 83 种语言,包括英语、日语、韩语、中文、西班牙语、葡萄牙语、阿拉伯语、法语、德语、俄语、意大利语、土耳其语、荷兰语、波兰语、越南语、泰语、印尼语等。所有语言均由同一个模型提供服务 —— 没有单独的端点或针对特定语言的定价分层。
Shijia Liao

Shijia LiaoX

Founder & Chief-Scientist of Fish Audio.

阅读Shijia Liao的更多内容

创造真实感的声音

立即开始生成最高质量的音频。

已有账号? 登录