1 주년.

$52M 시드 투자.

8M+ 크리에이터.

우리의 이야기
2026년 7월 27일기업

5개의 모델, 22명의 팀원, 1년의 시간

5개의 모델, 22명의 팀원, 1년의 시간

Fish Audio가 5,200만 달러의 시드 투자를 유치했습니다. 단일 4090으로 시작한 취미 프로젝트가 어떻게 지금의 모습이 되었는지, 그리고 우리가 다음에 무엇을 만들고 있는지 확인해 보세요. 우리의 이야기를 읽어보세요.

오늘 Fish Audio는 창립 1주년을 맞아 또 하나의 놀라운 이정표를 세웠습니다. 우리는 5,200만 달러 규모의 시드 투자 유치 소식을 발표합니다. 이번 라운드를 주도한 Coreline VenturesCapital Today, 그리고 359 Capital, Play Time, HF0, 645 Ventures, Parable, Carya Venture Partners, Alphalist Partners, 그리고 가능성이 보이지 않던 초기 단계에 투자해 주신 엔젤 투자자분들께 깊은 감사를 드립니다.

텍스트 음성 변환(TTS) 기술은 한 문장만 필요할 때라면 지난 10년 동안 꽤 훌륭했습니다. 하지만 열 번째 문장에 이르면 한계가 드러납니다. 이 분야의 모든 기술은 동일한 지점에서, 동일한 이유로 실패합니다. 단어를 올바르게 읽는 것과 표현력을 살려 전달하는 것은 서로 다른 문제인데, 거의 모든 사람이 전자만 고민해 왔기 때문입니다.

Amazon Alexa와 Meta에서 음성 AI 분야에 몸담으며 기존 TTS의 한계를 깨달았습니다. 낭독을 위해 구축된 목소리는 결코 '연기'를 배울 수 없습니다. 그래서 우리는 반대로 시작했습니다. Fish Audio는 단순히 더 나은 음성 비서가 아닙니다. 그 이후에 오는 모든 것을 위한 음성 레이어입니다.

Two company founders sitting side by side in wooden armchairs, facing the camera, with a floor-to-ceiling window and outdoor trees in the background.

4090 한 대에서 시작된 여정

Shijia Liao 최고 과학자(CSO) 역시 다른 경로를 통해 같은 결론에 도달했습니다. NVIDIA에서 비디오 관련 연구 엔지니어로 일하던 그는 여가 시간에 VTuber 방송을 보며 목소리가 너무 생기 없다는 점에 주목했습니다. 그는 자신의 방에서 단 한 대의 4090으로 모델을 학습시키기 시작했고, 업계가 2년 동안 따라잡지 못했던 이중 자기회귀(dual autoregressive) 아키텍처에 과감히 베팅했습니다. 그 작업이 S2의 기초가 되었습니다.

지난 1년간의 성과

  • 5개의 최첨단 오디오 모델 출시 (텍스트 음성 변환 4개, 음성 텍스트 변환 1개).
  • 팀 규모 3명에서 22명으로 확대, 현재도 채용 중.
  • 매출 0달러에서 연간 반복 매출(ARR) 2,100만 달러 달성.
  • 800만 명 이상의 크리에이터, 개발자 및 기업이 플랫폼 이용.
  • 커뮤니티 라이브러리에 200만 개 이상의 음성 모델 보유.
  • S2.1 Pro, 블라인드 테스트에서 66%의 청취자가 주요 경쟁사보다 선호.
  • 15,000개 이상의 자연어 제어를 통해 83개 이상의 언어에서 원어민 수준의 억양과 단어 단위 감정 제어 가능.

커뮤니티가 함께 만든 모델

우리는 실제 사용자의 선호도에 따라 사후 학습(post-training)을 진행합니다. 즉, 사람들이 더 많이 사용할수록 모델이 더 좋아집니다. 이것이 우리가 강조하는 영어 억양, 중국어, 일본어, 한국어, 스페인어에서 뛰어난 성능을 발휘하는 이유입니다. 표준 미국식 영어로만 학습된 모델들이 무너지는 지점에서 우리 모델은 빛을 발합니다. 이러한 능력은 우리가 미처 테스트할 생각조차 못 했던 다양한 언어, 억양, 특이 케이스에서 도구를 사용해 준 사용자들 덕분에 가능했습니다.

Fish Speech가 단순한 저장소에서 기업으로 성장할 수 있었던 것은 게임 개발자, 애니메이션 팬, 그리고 재미로 캐릭터 더빙을 즐기는 사람들 덕분이었습니다. 처음부터 우리는 투명성과 개방성을 믿어왔으며, 표현력이 풍부한 고품질 음성 AI를 누구나 쉽게 사용할 수 있도록 노력해 왔습니다.

그리고 800만 명의 여러분이 그 여정을 믿고 함께해 주셨습니다.

이제 기업이 신뢰하는 모델

이러한 신뢰 덕분에 기업들도 Fish Audio를 찾고 있습니다. 개발자와 더불어 이제 기업 고객은 우리 매출의 3분의 2를 차지합니다.

우리는 기업에 안정적인 가동 시간, 낮은 지연 시간, 그리고 까다로운 조달 절차를 통과할 수 있는 보안 체계를 제공합니다. 온프레미스 배포, 데이터 무보존 정책, HIPAA 준수 구성 등을 초기부터 구축했습니다. S2.1 Pro는 이미 주요 모델과의 블라인드 테스트에서 승리하고 있으며, 단일 H200에서 초당 8,000개 이상의 토큰을 처리하고, 특정 방언에만 최적화된 모델들이 제대로 작동하지 않는 언어 환경에서도 견고함을 유지합니다.

기업 고객이 우리를 찾는 이유는 단순히 단어를 나열하는 것이 아니라 '전달 방식'을 올바르게 구현하는 것이 우리가 해결하고자 하는 핵심 문제이기 때문입니다. 이는 우리가 이제 더 멀리 나아갈 수 있게 된 미션이기도 합니다.

다음 행보는?

텍스트 음성 변환은 결코 최종 목표가 아니었습니다. 단일 GPU로 먼저 구축하여 "단어만큼이나 전달 방식이 중요하다"는 가설을 증명할 수 있는 첫 번째 단계였습니다. 당시에는 아무도 이 문제를 해결하려 하지 않았습니다.

이제 우리는 스택의 나머지 영역을 공략합니다. 오디오 이해 언어 모델(Audio LM)과 Speech-to-Speech 기술입니다. 또한 개발자 도구와 API에 더욱 집중하고, 엔터프라이즈 팀을 확장하며, LiveKit 및 Retell과 같은 파트너와 협력하여 표현력이 풍부한 음성을 더 빠르고 광범위하게 보급할 것입니다.

8월 한 달간 무료 제공

이번 성과를 기념하여, 8월 말까지 API를 통해 모든 개발자에게 S2.1 Pro를 무료로 제공합니다. 이는 우리 기업 고객들이 유료로 사용하는 것과 동일한 모델입니다. 또한 크리에이터 플랜 50% 할인 및 타 서비스에서 이전 시 3개월 무료 혜택을 제공합니다.

이러한 혜택을 제공할 수 있는 이유는 기술적인 혁신 덕분이며, 우리 연구 팀의 공로가 큽니다. 연구 팀은 올해 인퍼런스 스택 전체를 재구축했습니다. 커스텀 FP8 커널을 통해 단일 H200에서 초당 8,000개 이상의 토큰을 처리할 수 있게 되었습니다. 이를 통해 요청당 비용을 획기적으로 낮췄고, 모델을 무료로 제공하는 것이 성공적인 전략이 될 수 있었습니다.

감사 인사

1년 전, Fish Audio는 거실에서 시작된 취미 프로젝트였습니다. 목소리를 학습시키고, 캐릭터에 더빙을 입히고, API를 기반으로 무언가를 만들고, 아직 가능성만 있던 시절에 저희를 믿어주신 모든 분이 이 성과의 주인공입니다.

그동안 많은 시행착오가 있었습니다. 이제 더 많은 리소스를 바탕으로 더 많은 것들을 바로잡아 나갈 준비가 되었습니다.

두 번째 해를 향해 나아가겠습니다.

Rissa Cao

Rissa CaoX

Rissa is the CEO and co-founder of Fish Audio, pushing breakthroughs in AI voice technology. Find her latest work at @rissa_cao.

Rissa Cao의 더 많은 글 보기

실감 나는 목소리를 만들어보세요

오늘부터 최고 품질의 오디오를 생성하세요.

이미 계정이 있으신가요? 로그인