
<100ms
首包延迟无限
方向标签80+
语言$15/1M UTF-8 bytes
按量付费从注册到首段音频,只需 5 分钟。
无需销售沟通。拿到 API 密钥,装好 SDK,就能上线。
cURL · REST API
curl https://api.fish.audio/v1/tts \-H "Authorization: Bearer YOUR_FISH_AUDIO_API_KEY" \-H "Content-Type: application/json" \-H "model: s2.1-pro" \-d '{"text": "[chuckle] When you are building something new, there is this [emphasis] mix of wonder and fear.","reference_id": "YOUR_VOICE_ID","format": "mp3"}' --output speech.mp3
Python · Fish Audio SDK
from fishaudio import FishAudiofrom fishaudio.utils import saveclient = FishAudio(api_key="YOUR_FISH_AUDIO_API_KEY")audio = client.tts.convert(text="Hello from Fish Audio!",reference_id="YOUR_VOICE_ID",model="s2.1-pro",)save(audio, "output.mp3")
内联情感与语气控制
以 [tag] 语法在文本任意位置写入方向指令。标签自由不受限,无需单独的情感参数。
Hey there.Add TagsI’m so excited to share this news!Can you hear me?
数百万社区声音
浏览业内最大的开放声音库直接使用,或克隆你自己的声音并在此基础上构建。




多说话人对话
一次生成完整对话。S2.1 Pro 已支持。
即时声音克隆
从一段简短的参考音频中捕捉音色与说话风格,覆盖全部 80+ 种语言,无需额外训练。
Recorded Voice
EnglishFemaleYoung
自然读出复杂文本
数字、货币、日期与单位都能正确读出
$9.99
01/24
1,999
流式传输与时间戳
流式传输音频,并提供词级时间戳。
Thefutureiscoming
0.02s0.05s0.01s0.04svoice0.01s0.03s打造你的产品所需的语音体验
创建可复用的声音,精细调控其表现,并将其流式接入实时产品。
即时克隆任意声音
就用 Fish Audio
Fish Audio 的 AI 声音克隆 API 能将一段简短的参考音频转化为可复用的声音。克隆结果会保留音色与说话风格,并覆盖全部 80+ 种语言,无需额外训练。
PYTHON SDK
# Clone from reference audiovoice = session.create_model(title="My Voice",voices=[open("reference.wav", "rb").read()])# Synthesize with the cloned voicerequest = TTSRequest(text="This is my cloned voice.",reference_id=voice.id)with open("clone.mp3", "wb") as f:for chunk in session.tts(request, backend="s2-pro"):f.write(chunk)
Fish Audio 文本转语音 API基准与规格
同一套 API。只需切换一个请求头即可更换模型。两款 API 模型统一按同一费率计费。
POST https://api.fish.audio/v1/tts
0.195
实时因子
简短音频
声音克隆
原生支持
多说话人
REST + WebSocket
流式传输
词级
时间戳
48kHz
采样率
5起
并发请求
MP3 · WAV · Opus
音频格式

