1 周年。

$52M 种子轮。

8M+ 创作者。

阅读我们的故事

文本转语音 API为任何应用构建语音能力

富有表现力、可精细调控的语音,延迟低至约 100ms —— 同款 S2.1 Pro 模型正驱动着 HeyGen、Retell 和 Plaud。

curl https://api.fish.audio/v1/tts \
  -H "Authorization: Bearer YOUR_FISH_AUDIO_API_KEY" \
  -H "Content-Type: application/json" \
  -H "model: s2.1-pro" \
  -d '{
    "text": "[chuckle] 当你着手打造全新的事物时,心里总有种[audience laughing]又惊又怕的复杂滋味。[whisper] 但正是这份感觉,让创造变得值得。",
    "reference_id": "933563129e564b19a115bedd57b7406a",
    "format": "mp3"
  }' --output speech.mp3
<100ms
首包延迟
无限
方向标签
80+
语言
$15/1M UTF-8 bytes
按量付费

已在这些产品的生产环境中运行

为不同生产需求打造的模型

同一套 API。只需切换一个请求头即可更换模型。两款 API 模型统一按同一费率计费。

初代

S2 Pro

即使是最短的语句也能准确处理

  • 即时声音克隆
  • 全面支持多语言
  • 极短文本也能稳定生成
  • 与 S2.1 Pro 同价
查看文档
推荐

S2.1 Pro

Fish 目前推出的表现力最强的模型。

  • 首包音频延迟约 100ms(仅需单张 H200)
  • 实时因子 0.195
  • 80+ 种语言,即时语码转换
  • 开放域情感标签
  • 原生支持单次生成多说话人
查看文档
Enterprise 部署

本地部署

部署在你自己的基础设施中。

  • VPC、本地、主权云、气隙环境
  • 零数据外流
  • 完全掌控模型
  • 提供商业许可
联系销售

从注册到首段音频,只需 5 分钟。

无需销售沟通。拿到 API 密钥,装好 SDK,就能上线。

cURL · REST API
curl https://api.fish.audio/v1/tts \
-H "Authorization: Bearer YOUR_FISH_AUDIO_API_KEY" \
-H "Content-Type: application/json" \
-H "model: s2.1-pro" \
-d '{
"text": "[chuckle] When you are building something new, there is this [emphasis] mix of wonder and fear.",
"reference_id": "YOUR_VOICE_ID",
"format": "mp3"
}' --output speech.mp3
Python · Fish Audio SDK
from fishaudio import FishAudio
from fishaudio.utils import save
client = FishAudio(api_key="YOUR_FISH_AUDIO_API_KEY")
audio = client.tts.convert(
text="Hello from Fish Audio!",
reference_id="YOUR_VOICE_ID",
model="s2.1-pro",
)
save(audio, "output.mp3")

你需要的一切助你打造生产级语音

一套 API,覆盖声音创建、富有表现力的生成与实时交付。

内联情感与语气控制

以 [tag] 语法在文本任意位置写入方向指令。标签自由不受限,无需单独的情感参数。

Aber
Hey there.Add TagsI’m so excited to share this news!Can you hear me?
[Sad]
[Excited]
[satisfied]
[angry]

数百万社区声音

浏览业内最大的开放声音库直接使用,或克隆你自己的声音并在此基础上构建。

多说话人对话

一次生成完整对话。S2.1 Pro 已支持。

Aber
Sarah
Ethan

即时声音克隆

从一段简短的参考音频中捕捉音色与说话风格,覆盖全部 80+ 种语言,无需额外训练。

Recorded Voice
My Cloned Voice
EnglishFemaleYoung

自然读出复杂文本

数字、货币、日期与单位都能正确读出

$9.99
01/24
1,999

流式传输与时间戳

流式传输音频,并提供词级时间戳。

Thefutureiscoming
0.02s0.05s0.01s0.04svoice0.01s0.03s

打造你的产品所需的语音体验

创建可复用的声音,精细调控其表现,并将其流式接入实时产品。

即时克隆任意声音
就用 Fish Audio

Fish Audio 的 AI 声音克隆 API 能将一段简短的参考音频转化为可复用的声音。克隆结果会保留音色与说话风格,并覆盖全部 80+ 种语言,无需额外训练。

PYTHON SDK
# Clone from reference audio
voice = session.create_model(
title="My Voice",
voices=[open("reference.wav", "rb").read()]
)
# Synthesize with the cloned voice
request = TTSRequest(
text="This is my cloned voice.",
reference_id=voice.id
)
with open("clone.mp3", "wb") as f:
for chunk in session.tts(request, backend="s2-pro"):
f.write(chunk)

Fish Audio 文本转语音 API基准与规格

同一套 API。只需切换一个请求头即可更换模型。两款 API 模型统一按同一费率计费。

POST https://api.fish.audio/v1/tts

基准测试
0.195

实时因子

简短音频

声音克隆

原生支持

多说话人

REST + WebSocket

流式传输

词级

时间戳

48kHz

采样率

5

并发请求

MP3 · WAV · Opus

音频格式

灵活定价,满足你的需求

任意订阅方案均可按量付费了解更多

S2.1 Pro

文本转语音

$0.015/ K UTF-8 bytes
立即开始
70ms 超低延迟
支持 80+ 种语言
词级时间戳

S2 Pro

文本转语音

$0.015/ K UTF-8 bytes
立即开始
实时延迟
全面支持多语言
即时声音克隆

Transcribe-1

自动语音识别

$0.006/ 音频分钟
立即开始
业界领先的 ASR 准确率
支持多语言,可选语言提示
支持长音频转录

并发请求限制

 
消费门槛并发
入门版
已付 < $1005 个请求
进阶版
已付 ≥ $10015 个请求
高用量版
已付 ≥ $1,00050 个请求
Enterprise
自定义自定义额度

常见问题

Fish Audio

这个周末就上线生产

获取 API 密钥,装好 SDK,就能上线。无需绑卡。