1 주년.

$52M 시드 투자.

8M+ 크리에이터.

우리의 이야기
2026년 6월 23일연구

Fish Audio S2.1 Pro: 개발자를 위한 무료 텍스트 음성 변환(TTS) API

Fish Audio S2.1 Pro: 개발자를 위한 무료 텍스트 음성 변환(TTS) API

요약:

  • Fish Audio의 가장 진보된 음성 모델인 S2.1 Pro를 이제 무료 텍스트 음성 변환(TTS) API로 사용할 수 있습니다.

  • 83개 언어 지원, 공정 이용 정책(Fair Use Policy) 하에 무제한 사용 가능

  • 모델 이름: s2.1-pro-free — 기존 Fish API 호출에 바로 적용 가능

S2.1 Pro 무료로 체험하기 — 5분 만에 첫 오디오 생성 →

2026년 6월 | Fish Audio의 S2.1 Pro 모델이 이제 공정 이용 정책에 따라 무제한 액세스가 가능한 무료 텍스트 음성 변환 API로 제공됩니다.


고품질 음성 AI가 항상 비쌌던 이유

텍스트 음성 변환 API를 평가해 본 적이 있다면 이미 익숙한 패턴이 있을 것입니다. 바로 '소리가 좋은 모델은 돈이 든다'는 점입니다.

ElevenLabs의 무료 티어는 월 10,000 크레딧(약 6~10분 분량)을 제공한 후 유료 결제를 유도합니다. OpenAI TTS는 무료 티어 없이 사용한 만큼 비용을 지불해야 합니다. Google의 최신 Gemini TTS 모델(가장 진보된 모델)은 무료 사용량이 전혀 없으며, 첫 토큰부터 비용이 발생합니다. 업계 전반에 걸쳐 최첨단 음성 품질은 유료 기능이었습니다.

이는 개발자들에게 큰 걸림돌이 됩니다. AI 음성 생성기 시장은 매년 약 20%씩 성장하고 있지만, 음성 기반 제품을 만들기 위한 도구는 여전히 유료 결제 장벽 뒤에 숨어 있습니다. 10,000 크레딧으로는 모델을 제대로 평가할 수 없습니다. 초기 비용을 지불하거나 자체 GPU 인프라가 필요한 오픈 소스 대안과 씨름하며 몇 주를 보내지 않고서는 음성 에이전트를 프로토타이핑하거나, 오디오북 파이프라인을 테스트하거나, 보이스 클로닝(voice cloning)을 실험해 볼 수 없습니다.

Fish Audio가 오늘 그 판도를 바꿉니다.


S2.1 Pro란 무엇인가요?

S2.1-Pro 벤치마크: 동시 접속 수준 1~512에 따른 처리량(tok/s) 및 TTFB p50(ms), c=64에서 8,006 tok/s 및 c=1에서 73.2ms TTFB를 보여줌

S2.1 Pro는 Fish Audio의 현재 최첨단 음성 모델로, 우리가 보유한 최고의 모델이며 이제 모든 개발자가 API를 통해 무료로 사용할 수 있습니다. 이 모델은 프로덕션 수준의 AI 음성 생성을 위해 설계된 신경망 음성 합성 모델로, 저지연 스트리밍, 다국어 TTS 및 보이스 클로닝에 강점이 있습니다. 올해 초 오픈 웨이트로 출시한 S2를 기반으로 구축되었습니다.

성능

  • 이전 세대인 S2 Pro와의 비교 청취 평가에서 61%의 승률 기록 — 자세한 내용은 블라인드 TTS 제공업체 비교를 참조하세요.
  • 단일 요청 시 첫 오디오 출력 시간(TTFA) 약 70ms — 이전 세대의 약 100ms에서 단축되었습니다.
  • 고동시성 부하 환경에서 2배 이상의 처리량 향상

전체 기술 배경은 논문을 참조하세요: 여기

지원 언어

S2.1 Pro는 영어, 일본어, 중국어, 한국어, 스페인어, 아랍어, 프랑스어, 독일어, 포르투갈어, 러시아어를 포함한 83개 언어를 지원합니다. 하나의 모델이 모든 언어를 처리하므로 별도의 엔드포인트나 언어별 요금이 필요하지 않습니다.

지연 시간(Latency)

S2.1-Pro는 표준 API에서 약 90ms의 TTFA를 제공하여 실시간 음성 에이전트 및 대화형 시스템에 적합합니다. 운율과 전달 방식에 대한 세밀한 제어가 필요한 경우, S2의 단어 수준 음성 제어 기능도 확인해 보세요.


Fish Audio가 지금 이 서비스를 무료로 제공할 수 있는 이유

Fish Audio S2.1-Pro 추론 인프라: 요청당 125 오디오 tok/s(RTF 0.17) 및 ~70ms TTFA를 제공하는 FP8 GEMM 및 커스텀 스케줄러가 포함된 NVIDIA H200

요약하자면: 우리는 추론 스택을 처음부터 다시 구축했으며, 요청당 비용을 우리가 감당할 수 있을 만큼 대폭 절감했습니다.

커스텀 GPU 커널

우리는 NVIDIA Hopper (H100/H200) 및 Blackwell (RTX 6000 PRO) 아키텍처를 대상으로 하는 프로덕션 등급 FP8 GEMM 및 FlashAttention 라이브러리인 fish-scales-ops를 개발했습니다. 음성 AI 서빙에 중요한 디코드 셰이프에서 우리의 MXFP8 경로는 torch.compile-fused cuBLAS 레퍼런스보다 2.1~4.3배 더 뛰어난 성능을 보입니다. API를 사용하는 데 이러한 내용을 다 이해할 필요는 없지만, 이것이 무료 티어를 지속 가능하게 만드는 핵심입니다.

더 높은 처리량

FP8 양자화가 적용된 단일 H200에서 시스템은 64개의 동시 요청 시 초당 8,000개 이상의 토큰 출력 처리량을 유지합니다. GPU당 처리량이 많을수록 비용 대비 더 많은 요청을 처리할 수 있으며, 이것이 무제한 무료 액세스를 경제적으로 가능하게 합니다.


"무료"의 실제 의미

우리는 제약 사항을 숨기기보다 솔직하게 공개하고자 합니다.

제공 사항:

  • 모델 문자열: s2.1-pro-free
  • 엄격한 글자 수 제한 없는 대량 액세스 (공정 이용 정책 적용)
  • 유료 플랜과 동일한 API 엔드포인트 — 별도의 통합 과정 불필요

현재 제한 사항:

  • 기간: 2026년 7월 24일까지 무료 이용 가능 2026년 7월 말까지 무료 이용 가능 2026년 8월 31일까지 무료 이용 가능 — 변경 사항이 있을 경우 사전에 공지하겠습니다.
    • 업데이트 (2026년 6월): 무료 기간을 7월 전체로 연장합니다. 개발자들이 마감 기한에 쫓기지 않고 한 달 내내 충분히 빌드, 평가 및 출시할 수 있기를 바랍니다.
    • 업데이트 (2026년 7월): 무료 이용 기간을 2026년 8월 31일까지 다시 한번 연장합니다. Fish Audio 개발자들이 S2.1 Pro로 만들어내는 결과물들을 보는 것은 정말 고무적인 일이었으며, 그 추진력을 더 이어갈 수 있도록 돕고 싶습니다.
  • SLA 없음: 가동 시간/TTFA 보장 없음. 실험 및 프로토타이핑용으로 설계됨
  • 지연 시간 보장 없음: 최선을 다하지만 계약상의 보장은 없음
  • 데이터 보유: 요청 데이터는 모델 품질 개선에 사용될 수 있음 — 개인정보 처리방침 참조
  • 상업적 이용: 일부 상업적 시나리오에는 제한이 있을 수 있습니다. 연간 반복 매출(ARR)이 100만 달러를 초과하는 제품은 S2.1 Pro Free를 사용하기 전에 당사에 문의해 주시기 바랍니다. 자세한 내용은 가격 및 요율 제한을 참조하세요.

프로덕션 수준의 SLA 및 지연 시간 보장이 필요한 경우 유료 플랜을 이용할 수 있습니다. 이 무료 티어는 빌드하고, 평가하고, 결정을 내리기에 가장 적합한 단계입니다.


무료 텍스트 음성 변환 API 사용 방법: S2.1 Pro 퀵스타트

fish.audio/app/api-keys에서 API 키를 받은 후 첫 번째 호출을 시작하세요. Fish API는 msgpack으로 인코딩된 요청을 수락하고 선택한 형식으로 오디오를 반환합니다. 자세한 내용은 API 문서를 참조하세요.

JavaScript

import { writeFile } from "fs/promises";

const body = {
  text: "안녕하세요, 세상 여러분!",
  reference_id: "your_model_id",
  format: "mp3",
};

const res = await fetch("https://api.fish.audio/v1/tts", {
  method: "POST",
  headers: {
    Authorization: "Bearer <YOUR_API_KEY>",
    "Content-Type": "application/json",
    model: "s2.1-pro-free",
  },
  body: JSON.stringify(body),
});

if (!res.ok) {
  throw new Error(`TTS 요청 실패: ${res.status} ${await res.text()}`);
}

const buffer = Buffer.from(await res.arrayBuffer());
await writeFile("output.mp3", buffer);

Python

import httpx

body = {
    "text": "안녕하세요, 세상 여러분!",
    "reference_id": "your_model_id",
    "format": "mp3",
}

with httpx.Client() as client:
    res = client.post(
        "https://api.fish.audio/v1/tts",
        headers={
            "Authorization": "Bearer <YOUR_API_KEY>",
            "Content-Type": "application/json",
            "model": "s2.1-pro-free",
        },
        json=body,
    )

res.raise_for_status()

with open("output.mp3", "wb") as f:
    f.write(res.content)

다른 Fish Audio API 호출과 유일한 차이점은 헤더에 model: "s2.1-pro-free"를 설정하는 것입니다. 그게 전부입니다.

무료 API 키 받기 →


S2.1 Pro vs ElevenLabs 및 2026년 최고의 TTS API

아래 경쟁사 정보는 2026년 6월 현재 공개된 문서 및 가격 페이지를 기준으로 합니다. 가격 및 기능은 변경될 수 있으므로 프로덕션 결정 전에 각 제공업체에 직접 확인하시기 바랍니다.

2026년 무료 TTS API 비교: Fish Audio S2.1-Pro vs ElevenLabs vs OpenAI TTS vs Google Cloud TTS

더 심도 있는 독립 분석은 블라인드 TTS 제공업체 비교를 참조하세요.

핵심 요약: 우리가 평가한 주요 TTS API 제공업체 중에서 Fish Audio는 현재 가장 관대한 무료 액세스 모델 중 하나를 제공합니다. 무료 티어에서 유료 티어와 동일한 최첨단 모델을 사용 제한 없이 제공하는 유일한 곳입니다. ElevenLabs의 무료 티어는 사실상 10,000 크레딧의 체험판에 가깝습니다. Google의 가장 진보된 TTS(Gemini TTS)는 무료 티어가 아예 없습니다.

모델 품질을 타협하지 않는 무료 ElevenLabs 대안을 찾고 계신가요? S2.1 Pro는 현재 사용 제한 없이 이용 가능합니다.

무료 OpenAI TTS 대안을 찾고 계신가요? OpenAI의 TTS 서비스는 무료 티어가 없으므로, S2.1 Pro가 훌륭한 첫 번째 평가 옵션이 될 것입니다.

전체 API 문서 확인 및 개발 시작하기 →


무엇을 만들 수 있나요?

무료 티어는 사용 사례에 제한을 두지 않습니다. S2.1 Pro의 저지연 AI 음성 생성, 다국어 지원, 보이스 클로닝의 조합이 가장 빛을 발하는 시나리오는 다음과 같습니다.

음성 에이전트

실시간 대화형 AI의 핵심은 지연 시간입니다. 표준 호출 시 약 90ms의 TTFA를 제공하는 S2.1 Pro는 자연스러운 대화를 나누기에 충분히 빠릅니다. 이를 음성 인식(STT) 레이어 및 LLM과 결합하면 글자당 비용 부담 없이 전체 음성 파이프라인을 구축할 수 있습니다. 또한 MCP 및 에이전트 스킬 지원을 통해 S2.1 Pro를 에이전트 워크플로우에 통합할 수 있습니다.

오디오북 및 장문 낭독

83개 언어 지원과 자연스러운 운율 덕분에 S2.1 Pro는 오디오북 제작 및 장문 음성 합성에 적합합니다. 무제한 사용이 가능하므로 글자 수 카운터를 확인하거나 크레딧을 미리 구매할 필요 없이 전체 원고를 처리할 수 있습니다.

보이스 클로닝(Voice Cloning)

S2.1 Pro는 API를 통한 참조 오디오 기반 보이스 클로닝을 지원합니다. 참조 오디오 샘플을 전달하면 모델이 해당 목소리로 음성을 합성합니다. 개인화된 음성 애플리케이션을 구축하거나, 화자의 정체성을 유지하면서 콘텐츠를 현지화하거나, 게임 및 애니메이션용 캐릭터 음성을 생성할 수 있습니다. 보이스 클로닝은 공정 이용 정책에 따라 무료 티어에서도 사용할 수 있습니다.

다국어 애플리케이션

여러 언어의 사용자에게 서비스를 제공하는 경우, 83개 언어를 지원하는 하나의 일관된 AI 음성 API를 사용하는 것은 언어별로 별도의 엔드포인트가 필요하거나 영어가 아닌 음성 합성에 추가 비용을 청구하는 대안들에 비해 상당한 이점을 제공합니다.

게임 NPC 대화

게임 오디오 파이프라인은 높은 처리량과 예측 가능한 요청당 비용의 혜택을 누릴 수 있습니다. 무제한 무료 사용을 통해 개발 단계에서 프로덕션 예산을 확정하기 전에 대규모 대화 라이브러리를 생성하고 자유롭게 반복 테스트할 수 있습니다.


파트너 에코시스템을 통해 이용 가능

S2.1 Pro는 Runware, Retell, Sierra 등 점점 늘어나는 파트너 플랫폼을 통해서도 이용할 수 있습니다.

이미 이러한 플랫폼 중 하나를 사용하고 있다면 별도의 통합이나 설정 없이 S2.1 Pro를 바로 사용할 수 있습니다.

우리는 파트너 네트워크를 적극적으로 확장하고 있습니다. S2.1 Pro 통합에 관심이 있는 플랫폼 또는 인프라 제공업체라면 당사 팀에 문의하여 가능성을 확인해 보세요.


공정 이용 정책 및 향후 계획

무료 티어는 공정 이용 정책(Fair Use Policy) 하에 운영됩니다. 우리는 개발보다는 남용으로 보이는 사용 패턴에 대해 액세스를 제한하거나 조절할 권리를 보유합니다. 이는 정당한 사용 사례에 대한 접근을 보호하기 위함이지, 임의의 제한을 만들기 위함이 아닙니다. 자세한 내용은 가격 및 요율 제한을 참조하세요.

몇 가지 기대할 점:

  • 무료 액세스는 현재 초기 기간 동안 제공됩니다. 변경 사항이 발생하기 전에 미리 공지해 드리겠습니다.
  • 프로덕션 워크로드를 위해 SLA 보장, 지연 시간 약정 및 상업적 라이선스가 포함된 유료 플랜을 이용할 수 있습니다.
  • 인프라 투자는 계속됩니다. 이 무료 티어를 가능하게 한 엔지니어링 작업은 일회성 이벤트가 아닙니다.
  • 오픈 소스 인프라: 우리는 무료 티어를 지속 가능하게 만든 S2.1 Pro의 기반 인프라 구성 요소를 오픈 소스화할 계획입니다.

Fish Audio를 프로덕션 배포용으로 검토 중이라면 무료 티어가 시작하기에 가장 좋은 곳입니다. 실제 제품을 만들고, 애플리케이션에 중요한 지표를 측정해 본 후 프로덕션 요구 사항을 논의할 준비가 되면 언제든지 문의해 주세요.

신용카드 불필요. 대기 명단 없음. 시도해 볼 수 있는 한계 없음.

무료 API 키 받기 →

자주 묻는 질문

텍스트 음성 변환(TTS) API란 무엇인가요?
텍스트 음성 변환 API(TTS API)는 작성된 텍스트를 음성 오디오로 변환하는 웹 서비스입니다. 개발자가 텍스트 문자열을 API 엔드포인트로 보내면 MP3, WAV, Opus 등 오디오 파일을 다시 받게 되며, 이를 애플리케이션에서 재생하거나 저장, 또는 실시간으로 스트리밍할 수 있습니다. S2.1 Pro와 같은 현대적인 AI 음성 API는 신경망 음성 합성 모델을 사용하여 사람의 목소리와 구별하기 어려울 정도로 자연스러운 오디오를 생성합니다.
Fish Audio S2.1 Pro는 정말 무료인가요?
네. S2.1 Pro는 모델 문자열 `s2.1-pro-free`를 사용하여 Fish API를 통해 비용 없이 사용할 수 있습니다. 엄격한 글자 수 제한은 없지만, 남용을 방지하기 위해 공정 이용 정책이 적용됩니다. 무료 티어는 SLA와 지연 시간 보장이 없으며, 요청 데이터는 모델 개선을 위해 보유될 수 있습니다. 이는 개발, 프로토타이핑 및 평가를 위해 설계되었습니다. 자세한 내용은 [가격 및 요율 제한](https://docs.fish.audio/developer-guide/models-pricing/pricing-and-rate-limits)을 참조하세요.
2026년 최고의 무료 TTS API는 무엇인가요?
최고의 무료 TTS API는 사용 사례에 따라 다릅니다. 주요 제공업체 중에서 Fish Audio S2.1 Pro는 현재 세대 모델에 대해 글자 수 제한 없는 관대한 무료 액세스와 83개 언어 지원을 제공합니다. ElevenLabs는 음성 라이브러리에 액세스할 수 있는 월 10,000 무료 크레딧을 제공합니다. Google의 기존 WaveNet 음성은 월 400만 자까지 무료입니다. OpenAI TTS와 Google의 최신 Gemini TTS는 무료 티어가 없습니다. 예산 제약 없이 최첨단 AI 음성 API를 평가하려는 개발자에게 S2.1 Pro는 강력한 출발점이 됩니다.
Fish Audio와 ElevenLabs는 어떻게 비교되나요?
Fish Audio와 ElevenLabs 모두 고품질 신경망 음성 생성 및 보이스 클로닝을 제공합니다. 무료 티어에서의 주요 차이점은 다음과 같습니다. Fish Audio의 무료 티어는 유료 티어와 동일한 S2.1 Pro 모델을 글자 수 제한 없이 실행하는 반면, ElevenLabs의 무료 티어는 월 10,000 크레딧으로 제한됩니다. 언어 지원 면에서 Fish Audio는 83개 이상의 언어를 지원하며 ElevenLabs는 70개 이상의 언어를 지원합니다. ElevenLabs는 더 큰 사전 구축 음성 라이브러리와 구축된 크리에이티브 콘텐츠 생태계를 보유하고 있습니다. Fish Audio는 저지연, 고동시성 또는 다국어 지원이 필요한 개발자 중심의 사용 사례에 더 강점이 있는 경향이 있습니다. 독립적인 벤치마크는 [블라인드 TTS 비교](https://fish.audio/blog/blind-tts-provider-comparison-2026/)를 참조하세요.
Fish Audio는 보이스 클로닝을 지원하나요?
네. S2.1 Pro는 [참조 오디오 기반의 보이스 클로닝](https://docs.fish.audio/features/voice-cloning)을 지원합니다. 참조 오디오 샘플을 전달하면 모델이 해당 목소리로 음성을 합성합니다. 이는 지원되는 83개 언어 전체에서 작동하므로, 일관된 화자의 정체성이 중요한 콘텐츠 현지화에 특히 유용합니다. 당사의 보이스 클로닝 시스템은 높은 화자 일관성, 자연스러운 운율, 그리고 여러 언어와 액센트에서의 안정적인 성능을 제공하는 동급 최강의 시스템 중 하나입니다. 보이스 클로닝은 다른 s2.1-pro-free 사용과 마찬가지로 공정 이용 정책에 따라 무료 티어에서 사용할 수 있습니다.
Fish Audio를 상업적으로 사용할 수 있나요?
무료 티어(`s2.1-pro-free`)는 특정 상업적 시나리오에서 제한이 있을 수 있습니다. 전체 라이선스, SLA 및 데이터 미보유가 포함된 프로덕션 상업용 사용은 Fish Audio의 유료 플랜을 참조하세요. 현재 정책에 대한 자세한 내용은 [가격 및 요율 제한](https://docs.fish.audio/developer-guide/models-pricing/pricing-and-rate-limits) 및 [서비스 약관](https://fish.audio/terms/)을 확인하시기 바랍니다.
Fish Audio는 어떤 언어를 지원하나요?
S2.1 Pro는 한국어, 영어, 일본어, 중국어, 스페인어, 포르투갈어, 아랍어, 프랑스어, 독일어, 러시아어, 이탈리아어, 터키어, 네덜란드어, 폴란드어, 베트남어, 태국어, 인도네시아어 등 83개 언어를 지원합니다. 모든 언어는 동일한 모델에서 서빙되므로 별도의 엔드포인트나 언어별 가격 티어가 존재하지 않습니다.
Shijia Liao

Shijia LiaoX

Founder & Chief-Scientist of Fish Audio.

Shijia Liao의 더 많은 글 보기

실감 나는 목소리를 만들어보세요

오늘부터 최고 품질의 오디오를 생성하세요.

이미 계정이 있으신가요? 로그인