이미지 생성 MCP: Fish Audio와 함께하는 이미지, 비디오 및 립싱크
Fish Audio의 MCP 서버는 이제 Claude Code, Claude.ai, Cursor, Codex, Windsurf 및 Devin에서 이미지를 생성 및 편집하고, 비디오를 제작하며, 새로운 오디오에 입 모양을 맞추고, 초상화를 말하는 아바타로 변환합니다. 한 번의 로그인으로 수십 개의 모델을 사용하고, 모든 이미지, 비디오, 립싱크 또는 아바타 작업 전에 가격 견적을 확인하세요.
2026년 10월 | Fish Audio MCP가 이제 이미지 생성, 비디오 생성 및 립싱크를 지원합니다
코딩 에이전트에게 제품 사진, 5초 분량의 티저 또는 토킹 헤드(talking-head) 업데이트를 요청하면 대개 한계에 부딪히게 됩니다. 일부 에이전트는 이미지를 전혀 생성할 수 없고, 다른 에이전트는 단일 내장 이미지 모델만 제공하며, 비디오는 옵션에 없는 경우가 많습니다. 일반적인 해결책은 이미지 생성 MCP 서버를 사용하는 것이지만, 대부분은 단일 모델만 연결하며 각 제공업체마다 별도의 API 키를 생성하고 붙여넣어야 합니다.
Fish Audio는 다른 접근 방식을 취합니다. 에이전트가 텍스트 음성 변환, 전사(transcription) 및 음성 검색에 이미 사용하고 있는 동일한 MCP 연결로 이제 이미지를 생성 및 편집하고, 비디오를 제작하며, 새로운 오디오에 입 모양을 맞추고, 초상화를 말하는 아바타로 변환할 수 있습니다. 한 번만 로그인하면 수십 개의 이미지, 비디오 및 립싱크 모델 중에서 선택할 수 있으며, 이미지, 비디오, 립싱크 또는 아바타 작업 비용이 청구되기 전에 견적을 승인할 수 있습니다.
음성 도구가 동일한 서버에 상주하기 때문에, 에이전트는 단일 목적의 MCP가 할 수 없는 일도 수행할 수 있습니다. 즉, 대본을 작성하고, Fish Audio로 음성을 입힌 다음, 해당 오디오를 말하는 아바타 모델에 직접 전달하는 과정을 한 번의 대화로 처리할 수 있습니다.
이미 Fish Audio MCP 서버에 연결되어 있나요? 업데이트가 필요하지 않습니다. 에이전트에게 "Fish Audio 미디어 모델 목록을 보여줘"라고 요청하면 새로운 도구를 바로 사용할 수 있습니다.
Fish Audio가 처음이신가요? 무료 가입 →하고 1분 안에 에이전트와 연결하세요.
Fish Audio MCP 서버의 새로운 기능
이번 업데이트로 추가된 기능부터 살펴보겠습니다. 이제 Fish Audio MCP 서버는 이미지 생성 MCP, 비디오 생성 MCP 및 립싱크 도구의 역할을 하나로 통합하여 수행합니다. 새로운 미디어 도구는 기존 음성 도구와 함께 제공되며 Fish Audio 웹 앱과 동일한 크레딧을 공유합니다.
모델마다 별도의 MCP를 사용하는 대신 하나의 연결을 사용하는 이유는 무엇일까요?
- 수집할 API 키가 없습니다. Fish Audio 계정으로 로그인하기만 하면 됩니다. 제공업체 키를 요청하거나 구성 파일에 붙여넣거나 교체할 필요가 없습니다.
- 통합 잔액. 모든 모델은 Fish Audio 요금제 크레딧에서 차감되므로, 이미지 모델에서 비디오 모델로 전환하기 위해 다른 계정을 충전할 필요가 없습니다.
- 설정이 아닌 문장 하나로 모델 교체. 평이한 언어로 다른 모델을 요청하면 에이전트가 옵션을 찾아보고 새 작업에 대한 견적을 제시합니다.
에이전트가 현재 수행할 수 있는 작업은 다음과 같습니다.
| 기능 | 입력값 | 사용 가능한 모델 포함 |
|---|---|---|
| 텍스트-투-이미지 (Text-to-image) | 프롬프트 | GPT Image 2, GPT Image 2.5 (Flare 및 Sunburst), Seedream 4.5 및 5.0, Nano Banana 모델 |
| 이미지 편집 및 업스케일링 | 이미지 + 지침 | 위의 모델들과 업스케일링을 위한 Topaz HD |
| 텍스트-투-비디오 및 이미지-투-비디오 | 프롬프트, 선택적으로 시작 이미지 | Seedance, Kling, Veo 3.1, MiniMax H3, WAN 3.0, Gemini Omni Flash |
| 립싱크 (비디오 기반) | 비디오 + 새로운 오디오 | Sync LipSync v3, Sync LipSync v2 Pro, PixVerse Lip Sync, Veed Lip Sync |
| 말하는 아바타 (이미지 기반) | 초상화 + 오디오 | Creatify Aurora Avatar, HeyGen Avatar 4, Veed Fabric 1.0 Avatar, Infinitalk Avatar |
모델 라인업은 시간이 지나면서 변경될 수 있습니다. 에이전트는 항상 실시간 목록을 바탕으로 작동하므로 새로운 모델이 추가되는 즉시 확인할 수 있습니다.
이미지 생성, 편집 및 업스케일링은 무료(Free) 요금제에서 사용할 수 있습니다. 비디오 생성, 립싱크 및 말하는 아바타는 유료 Plus 요금제 이상이 필요합니다.
이미지 생성, 편집 및 업스케일링
이미지를 설명하면 에이전트가 모델을 선택하고 화면비, 해상도, 품질 등의 옵션을 확인한 후 견적을 제시합니다. 편집하려면 이미지와 함께 "피사체는 유지하고 배경을 따뜻한 일몰로 바꿔줘"와 같은 지침을 제공하세요. 이미지는 일반적으로 1분 이내에 완료되며 요금제에 따라 한 번에 여러 개를 요청할 수 있습니다.
텍스트, 이미지 또는 참조 비디오에서 비디오 생성
비디오 도구는 원격 MCP 서버를 지원하는 모든 에이전트를 위해 MCP 서버를 비디오 생성 MCP로 변환합니다. 텍스트 프롬프트에서 시작하거나, 정지 이미지를 애니메이션화하거나, 지원 모델의 경우 참조 미디어를 사용하여 결과를 가이드할 수 있습니다. 화면비, 해상도 및 지속 시간 옵션은 모델마다 다르며 에이전트가 견적을 내기 전에 이를 확인합니다. 비디오는 몇 분 정도 걸릴 수 있으며, 에이전트가 스스로 진행 상황을 확인하고 파일이 준비되면 링크를 반환합니다.
립싱크 및 말하는 아바타
두 기능 모두 화면 속 인물이 새로운 오디오 트랙에 맞춰 말하게 만듭니다. 차이점은 기존 비디오에서 시작하느냐, 아니면 단일 이미지에서 시작하느냐 하는 것입니다.
비디오 기반: 기존 푸티지 재동기화. 모델에 누군가 말하는 비디오와 새로운 오디오 트랙을 제공하면 입 모양의 움직임을 오디오에 맞게 재조정합니다. 이는 이미 보유한 푸티지를 업데이트하기 위해 제작되었습니다. 즉, 제품 비디오의 대사를 변경하거나, 재촬영 없이 수정한 내용을 기록하거나, 토킹 헤드 클립을 다른 언어로 현지화하는 데 적합합니다. 이 모델들은 비디오와 오디오만으로 작동하며 텍스트 프롬프트는 받지 않습니다.
이미지 기반: 초상화 애니메이션화. 모델에 단일 초상화와 오디오 파일을 제공하면 연설에 맞춰 얼굴, 머리 및 표정을 애니메이션화합니다. Creatify Aurora Avatar는 구도, 배경 및 조명을 제어하기 위한 선택적 프롬프트도 허용하며, Infinitalk Avatar는 프롬프트가 필수이며 더 표현력이 풍부한 모습을 연출합니다.
권한을 보유한 자료만 사용하세요. 모든 립싱크 또는 아바타 작업 전에 확인 메시지를 통해 사용 권한이 있는 푸티지, 초상화 및 음성만 사용하도록 안내합니다.
이러한 각 도구는 그 자체로도 유용하지만, 더 큰 변화는 이들이 함께 작동할 때 발생합니다.
대본에서 말하는 아바타까지 한 번의 대화로
음성과 비디오가 동일한 MCP 서버에 있는 장점이 여기서 발휘됩니다. 대부분의 아바타 도구는 완성된 오디오를 가지고 있다고 가정합니다. Fish Audio를 사용하면 에이전트가 직접 오디오를 제작하고 이를 아바타 모델로 바로 전달할 수 있습니다.
흐름은 다음과 같습니다:
- 대본 작성. 대본을 붙여넣거나 에이전트에게 초안 작성을 요청합니다.
- 음성 입히기. 에이전트가 Fish Audio 음성 라이브러리, 본인의 음성 복제(voice clone) 또는 Voice Design으로 생성한 음성을 사용하여
text_to_speech를 호출합니다. 전달 방식을 조절하려면[excited](신난) 또는[whispering](속삭이는)과 같은 오디오 태그를 추가하세요. TTS는 텍스트 길이에 따라 과금되며 별도의 견적 없이 음성이 생성되는 즉시 청구됩니다. - 얼굴 선택. 초상화를 업로드하거나 동일한 세션 내에서 이미지 모델로 생성합니다.
- 애니메이션화. 에이전트가 초상화와 방금 생성한 음성을 아바타 모델로 보냅니다. 오디오를 다운로드했다가 다시 업로드할 필요 없이 완성된 음성이 직접 전달됩니다.
- 승인 및 수령. 아바타 비디오에 대한 견적을 확인하고 승인하면 완성된 파일의 링크를 받게 됩니다.
저희는 이 정확한 경로를 테스트했습니다. text_to_speech로 생성된 6초 분량의 클립이 아바타의 오디오 입력으로 직접 수락되었으며, 견적에는 다운로드 및 재업로드 없이 정확한 지속 시간이 반영되었습니다.
다음을 에이전트에 복사하여 시도해 보세요:
Fish Audio를 사용하여 9:16 비율의 말하는 아바타 비디오를 만들어줘:
1. 이 대본을 따뜻한 여성 영어 음성으로 변환해줘:
"Hi, welcome to Fish Audio. Today I'll show you lip sync and talking avatars."
2. 내가 업로드한 초상화를 HeyGen Avatar 4에서 720p로 사용하고 그녀가 그 오디오를 말하게 해줘.
3. 가격 견적을 먼저 알려줘. 내가 확인하면 생성한 다음 링크를 보내줘.
립싱크에도 동일한 아이디어가 적용됩니다. 에이전트에게 기존 토킹 헤드 비디오를 가리키며 새로운 대사를 제공하세요:
Fish Audio를 사용하여 내가 업로드한 토킹 헤드 비디오에 새로운 대사를 입혀줘:
1. 내 복제된 음성으로 음성을 생성해줘: "오늘의 신상품은 20% 할인됩니다. 링크는 댓글을 확인하세요."
2. Sync LipSync v3를 사용하여 비디오의 입 모양을 새 오디오에 맞춰줘.
견적을 먼저 내주고, 내가 확인하면 생성해줘.
말하는 아바타와 립싱크는 유료 Plus 요금제 이상이 필요합니다. 요금제 보기 →
모든 결과를 다음 입력으로 재사용
체이닝(Chaining)은 오디오에만 국한되지 않습니다. 워크스페이스 내의 모든 완료된 결과는 대화를 떠나지 않고 다음 작업으로 전달될 수 있습니다. 이미지를 생성한 다음 에이전트에게 "방금 만든 이미지를 4초 분량의 천천히 줌인되는 비디오로 만들어줘"라고 요청하세요. 에이전트는 이미지를 참조로 전달하므로 다운로드나 재업로드가 필요 없습니다.
컴퓨터에 있는 파일의 경우, 에이전트가 임시 업로드 슬롯을 만들고 파일을 대신 업로드해 줍니다. 에이전트가 직접 파일을 업로드할 수 없는 경우 브라우저에서 파일을 끌어다 놓을 수 있는 링크를 제공합니다.
이 모든 과정은 에이전트 내부에서 이루어집니다. 이는 생각보다 중요합니다. 대부분의 AI 에이전트는 단독으로는 비디오나 말하는 아바타를 생성할 수 없으며, 이미지를 생성하는 에이전트조차 단일 내장 모델에 묶여 있습니다. MCP 서버를 연결하는 것이 바로 그 격차를 해소하는 방법입니다.
AI 에이전트에게 이미지 및 비디오 생성 MCP가 필요한 이유
오늘날의 AI 에이전트는 매우 유능합니다. 캠페인을 기획하고, 대본을 쓰고, 캠페인 페이지를 구축할 수 있습니다. 하지만 시각적 요소에 있어서는 지원이 고르지 않습니다. Claude와 같은 일부 어시스턴트는 이미지 생성 도구처럼 사진이나 삽화를 생성하지 않습니다. ChatGPT 및 Codex와 같은 다른 에이전트는 이미지 생성을 포함하지만 한 제공업체의 모델에 고정되어 있습니다. 비디오, 립싱크 및 말하는 아바타는 대개 불가능합니다.
이러한 격차로 인해 익숙한 일상이 만들어집니다. 에이전트에서 프롬프트를 작성하고, 이를 별도의 이미지 또는 비디오 앱에 붙여넣고, 기다렸다가, 파일을 다운로드하여 다시 프로젝트로 가져옵니다. 수정할 때마다 이 루프가 반복됩니다. 많은 개발자가 선택하는 대안은 모델당 하나의 MCP 서버를 사용하는 것이지만, 이는 각 모델에 대해 별도의 제공업체 API 키와 구성 항목이 필요함을 의미합니다.
Model Context Protocol (MCP)은 에이전트에게 새로운 도구를 제공하는 표준 방식이며, Fish Audio가 이러한 추가 단계를 제거하고 다양한 모델 선택권을 열어줄 수 있게 해주는 핵심입니다. 에이전트가 생성 도구를 직접 호출하고, 결과는 링크로 돌아오며, 수정, 애니메이션 또는 내레이션 등 다음 단계가 동일한 대화 내에서 이루어집니다. Claude Code, Cursor 또는 기타 지원되는 에이전트에서의 이미지 생성은 하나의 도구 호출로 통합됩니다.
이 모든 것은 단 하나의 명령어로 가능합니다.
이미지 생성 MCP 설정 방법
서버는 https://api.fish.audio/mcp에 상주하며 스트리밍 가능한 HTTP를 사용합니다. 로그인은 Fish Audio 계정으로 브라우저에서 진행되므로 API 키나 환경 변수가 필요 없습니다. 아래에서 사용 중인 에이전트를 선택하세요.
Docs MCP를 찾고 계신가요? llms.txt, MCP 및 에이전트 스킬에 대한 이전 가이드에서는 코딩 에이전트가 Fish Audio API 문서를 찾아볼 수 있는 읽기 전용 서버인
docs.fish.audio/mcp를 다루었습니다. 이 포스트의 서버는 다릅니다. 이 서버는 사용자 계정에 로그인하여 콘텐츠를 생성합니다. 두 서버를 동시에 실행할 수도 있습니다.
Claude Code
claude mcp add --transport http fish-audio https://api.fish.audio/mcp
그 다음 Claude Code 내부에서 /mcp를 실행하여 로그인합니다.
Claude.ai
Settings → Connectors → Add custom connector로 이동하여 https://api.fish.audio/mcp를 입력합니다. Claude가 로그인 과정을 안내합니다.
Cursor
커맨드 팔레트(Cmd/Ctrl+Shift+P)를 열고 → Open MCP settings → Add custom MCP에서 다음을 추가합니다:
{
"mcpServers": {
"fish-audio": { "url": "https://api.fish.audio/mcp" }
}
}
Cursor가 첫 사용 시 로그인을 요청합니다.
Codex CLI
codex mcp add fish-audio https://api.fish.audio/mcp
codex mcp login fish-audio
로그인 명령은 브라우저 창을 엽니다. codex mcp get fish-audio로 연결을 확인하세요.
Windsurf
Settings → Cascade → MCP Servers → View raw config (~/.codeium/windsurf/mcp_config.json)로 이동하여 다음을 추가합니다:
{
"mcpServers": {
"fish-audio": { "url": "https://api.fish.audio/mcp" }
}
}
Devin CLI
devin mcp add fish-audio --transport http --scope user --url https://api.fish.audio/mcp --scopes mcp
devin mcp login fish-audio --scopes mcp
devin mcp list로 연결 여부를 확인하세요. Devin은 셸에서 작동하므로 결과를 로컬에 저장할 수도 있습니다. 저희 테스트에서는 요청 시 완성된 비디오를 다운로드 폴더로 다운로드했습니다.
로그인 및 팀 선택
모든 클라이언트는 동일한 Fish Audio 로그인 페이지를 엽니다. 연결을 한 번 승인하고 작업할 팀을 선택하면, 그 이후에는 클라이언트가 자동으로 액세스 권한을 갱신합니다.
연결은 선택한 팀에 귀속됩니다. 해당 팀의 워크스페이스만 볼 수 있고 해당 팀의 크레딧만 사용할 수 있습니다. 다른 팀에서 작업하려면 서버를 다시 추가하고 로그인 시 해당 팀을 선택하세요.
연결되었나요? 첫 프롬프트를 시도해 보세요: "새벽녘 등대의 16:9 수채화 이미지를 만들어줘. 가격을 먼저 보여주고 생성해줘." Fish Audio 무료 시작하기 →
각 생성 단계: 견적, 확인, 생성
연결이 완료되면 에이전트가 사용자를 대신해 유료 모델을 실행할 수 있습니다. 여기서 타당한 질문이 생깁니다. 에이전트가 의도보다 더 많은 비용을 지출하는 것을 어떻게 막을까요? 그 답은 에이전트의 판단에 맡기는 것이 아니라 서버에 내장되어 있습니다.
- 검색. 에이전트가 사용 가능한 모델 목록을 나열하고 필요한 모델의 지원 옵션, 기본값 및 입력 제한을 읽습니다.
- 견적. 이미지, 비디오, 립싱크 또는 아바타 작업 전에 에이전트가 예상 비용을 요청합니다. 견적 확인은 무료입니다. 요금제 제한도 여기서 확인되므로, 요청에 더 높은 요금제가 필요한 경우 승인 요청을 받기 전에 미리 알 수 있습니다.
- 확인. 에이전트가 가격을 보여주고 기다립니다. 승인하기 전까지는 아무것도 청구되지 않습니다.
- 생성. 에이전트가 승인된 정확한 요청을 제출합니다. 서버는 제출 시 가격을 다시 확인합니다. 가격이 변경된 경우 작업은 거부되고 에이전트는 다시 견적을 내야 합니다. 청구 금액은 승인된 금액을 절대 초과하지 않습니다.
- 전달. 에이전트가 몇 초마다 진행 상황을 확인하고 완성된 파일의 링크와 청구된 금액을 반환합니다.
음성 도구는 다르게 청구됩니다. TTS 및 STT는 견적 단계를 거치지 않습니다. 실행되는 즉시 청구되며, TTS는 텍스트 길이에 따라 과금됩니다.
백그라운드에서 두 가지 안전 장치가 더 실행됩니다:
- 실패한 작업은 자동으로 환불됩니다. 생성이 실패하면 별도의 요청 없이 크레딧이 반환됩니다.
- 동일한 요청을 재시도해도 두 번 청구되지 않습니다. 모든 유료 요청에는 고유 키가 포함됩니다. 에이전트가 타임아웃 후 동일한 키로 동일한 요청을 다시 보내면 서버는 새로 시작하고 청구하는 대신 원래 작업으로 돌아갑니다.
많은 에이전트가 자체 레이어를 추가하기도 합니다. 예를 들어 Codex는 각 도구 호출 전에 사용자의 허가를 요청합니다.
기술적 상세 정보: MCP 미디어 도구
개발자를 위해, 에이전트가 이면에서 호출하는 미디어 도구는 다음과 같습니다.
| 도구 | 크레딧 청구? | 기능 |
|---|---|---|
| list_my_workspaces | 아니요 | 연결된 팀의 워크스페이스 목록 표시 |
| list_media_models / get_media_model | 아니요 | 모델 목록 표시 및 특정 모델의 옵션과 입력 제한 읽기 |
| create_media_upload | 아니요 | 이미지, 비디오 또는 오디오 파일을 위한 1시간 업로드 슬롯 생성 |
| estimate_image_generation / estimate_image_edit / estimate_video_generation | 아니요 | 요청 유효성 검사 및 견적 반환 |
| generate_image / generate_image_edit / generate_video | 예 | 승인된 작업 제출 |
| get_generation_status / get_generation_result | 아니요 | 진행 상황 추적 및 완료된 파일과 과금 내역 반환 |
립싱크 및 말하는 아바타는 generate_video를 통해 실행됩니다. 입력값에 따라 작업을 인식합니다. 비디오와 오디오가 있으면 립싱크를, 초상화와 오디오가 있으면 아바타를 의미합니다. text_to_speech, speech_to_text, search_voices, create_voice_clone 및 Story Studio 도구와 같은 음성 도구도 동일한 서버에 있습니다.
이러한 도구를 직접 호출할 필요는 없습니다. 실제로 원하는 결과를 설명하면 에이전트가 적절한 호출을 연결합니다.
사용 사례별 프롬프트 예시
제작하려는 항목별 몇 가지 시작점은 다음과 같습니다.
| 사용 사례 | 요청 내용 | 에이전트의 동작 |
|---|---|---|
| 제품 및 앱 에셋 | "부드러운 아침 햇살을 받는 대리석 카운터 위의 세라믹 커피 머그잔의 1:1 이미지를 생성해줘. 몇 가지 변형을 보여주고 가격을 먼저 알려줘." | 이미지 모델을 선택하고 묶음 견적을 낸 뒤 승인 후 생성 |
| 제품 및 앱 에셋 | "screenshot.png를 업로드하고 우리 앱 스토어 등록을 위해 배경을 깨끗한 그라데이션으로 교체해줘. 먼저 견적을 내줘." | 파일을 업로드하고 편집 견적을 낸 뒤 승인 후 적용 |
| 마케팅 및 소셜 비디오 | "신발이 물웅덩이를 가르며 슬로우 모션으로 튀어 오르는 9:16 비율의 5초 비디오를 만들어줘. 크레딧 견적을 내주고 생성해줘." | 텍스트-투-비디오 작업 견적을 내고 비디오 링크 반환 |
| 마케팅 및 소셜 비디오 | "방금 생성한 이미지를 천천히 줌인되는 짧은 비디오로 만들어줘." | 이미지를 시작 프레임으로 직접 재사용 |
| 비디오 업데이트 및 현지화 | "이 대본을 스페인어로 번역하고 내 복제 음성으로 녹음한 다음, Sync LipSync v2 Pro를 사용하여 demo.mp4를 스페인어 오디오에 맞춰 립싱크해줘. 생성 전 견적을 내줘." | 대본 번역, 음성 생성, 비디오 업로드 후 립싱크 작업 견적 제시 |
| 발표자 및 아바타 | "밝은 스튜디오에 있는 친절한 발표자의 초상화를 생성하고, 그녀가 release-notes.md를 9:16 비율의 말하는 아바타 비디오로 읽게 해줘(Creatify Aurora Avatar 사용)." | 초상화와 음성을 생성한 후 아바타 비디오 견적 제시 |
| 계정 | "Fish Audio 크레딧이 얼마나 남았어?" | 잔액 확인 |
Claude Code, Codex 및 Devin과 같은 코딩 에이전트에서 이러한 도구는 셸과 함께 작동합니다. 에이전트는 폴더 내의 모든 제품에 대해 이미지를 일괄 생성하거나, 로컬 녹음 파일을 업로드하거나, 완성된 파일을 프로젝트로 다운로드할 수 있습니다.
요금제, 크레딧 및 제한 사항
시작하기 전에 크레딧 작동 방식과 각 기능에 필요한 요금제를 이해하는 것이 좋습니다.
어떤 크레딧을 사용하나요?
MCP를 통한 미디어 생성은 Fish Audio 웹 요금제 크레딧을 사용하며, 이는 웹 앱에서 사용하는 것과 동일한 크레딧입니다. Fish Audio API를 위한 별도의 잔액인 개발자 API 크레딧(Developer API credits)은 사용하지 않습니다. 이 두 가지는 구매처가 다르므로 어떤 것을 충전해야 할지 확인하는 것이 중요합니다.
웹 크레딧을 추가하거나 요금제를 변경하려면 Team → Plans로 이동하세요. 각 MCP 연결은 로그인 시 선택한 팀에 귀속되므로 생성 시 해당 팀의 크레딧이 차감됩니다.
어떤 요금제가 필요한가요?
에이전트가 생성할 수 있는 항목은 요금제에 따라 다릅니다. 에이전트가 견적을 요청할 때 요금제 제한이 확인되므로 요금제에서 보장하지 않는 작업은 승인 요청 전에 미리 표시됩니다.
- 이미지 생성, 편집 및 업스케일링은 일일 이미지 허용량이 포함된 무료(Free) 요금제에서 사용할 수 있습니다.
- 텍스트에서 이미지를 생성할 때, 각 요청당 무료 요금제는 최대 2장, Plus는 4장, Pro 및 Max는 8장까지 요청할 수 있습니다. 이미지 편집은 요청당 하나의 이미지를 반환합니다.
- 비디오 생성, 립싱크 및 말하는 아바타는 유료 Plus, Pro 또는 Max 요금제가 필요합니다.
- 비디오, 립싱크 및 아바타 작업은 요청당 하나의 결과물을 반환합니다.
무료 요금제로 시작하신다면 이미지 생성이 워크플로우를 테스트하는 가장 쉬운 방법입니다. 비디오, 립싱크 또는 말하는 아바타를 사용할 준비가 되면 유료 Plus 요금제 이상으로 업그레이드하여 해당 기능을 잠금 해제할 수 있습니다.
가격
모델마다 가격이 다르며, 작업 비용은 해상도, 지속 시간 또는 이미지 수와 같은 선택 설정에 따라 달라집니다. 가격표에 의존하기보다 에이전트에게 견적을 요청하세요. 견적은 무료이며 현재 가격이 반영됩니다. 단, **텍스트 음성 변환(TTS)**은 예외입니다. 텍스트 길이에 따라 과금되며 실행 즉시 청구됩니다.
견적 비용이 들지 않으므로 동일한 아이디어에 대해 몇 가지 모델이나 설정을 비교해 보고 비용이 청구되기 전에 예산에 맞는 것을 선택할 수 있습니다.
업로드
일부 작업은 사용자 본인의 파일(편집하거나 애니메이션화할 이미지, 립싱크할 비디오 또는 아바타용 오디오)로 시작합니다. 에이전트는 다음 제한 내에서 업로드를 대신 처리합니다.
- 이미지: JPEG, PNG 또는 WebP, 최대 20MB
- 비디오: MP4, MOV, WebM 또는 MKV, 최대 1GB
- 오디오: MP3, WAV, M4A, AAC, OGG 또는 FLAC, 최대 50MB
개별 모델은 더 엄격한 제한을 가질 수 있습니다. 예를 들어, Creatify Aurora Avatar는 1~60초의 오디오를 허용합니다. 에이전트는 견적을 내기 전에 각 모델의 제한 사항을 읽으며, 제출 후 제공업체가 입력을 거부하면 실패한 작업은 환불됩니다. 동일한 워크스페이스에서 이미 생성한 결과물은 다시 업로드할 필요가 없으며 에이전트가 직접 전달합니다.
소요 시간
이미지는 대개 1분 이내에 완료됩니다. 비디오, 립싱크 및 아바타는 몇 분 정도 걸릴 수 있습니다. 계속 확인할 필요는 없습니다. 에이전트가 스스로 진행 상황을 추적하고 파일이 준비되는 즉시 링크를 반환합니다.
마무리: 이제 당신의 에이전트는 미디어 스튜디오입니다
AI 에이전트는 이미 출시 계획을 세우고, 랜딩 페이지 초안을 작성하고, 코드를 배포할 수 있습니다. 지금까지 시각적 요소는 대부분의 에이전트가 멈추는 지점이었습니다. 기껏해야 하나의 내장 이미지 모델만 제공했고, 비디오, 립싱크 및 말하는 아바타는 사람이 별도의 도구를 사용해 처리해야 했습니다. 이번 업데이트로 그 격차가 해소되었습니다. 단 하나의 이미지 생성 MCP로 에이전트에게 음성, 이미지, 비디오, 립싱크 및 말하는 아바타 기능을 제공하며, 관리할 API 키도 없고 모든 미디어 작업 전에 견적을 확인할 수 있습니다.
더 큰 변화는 이러한 요소들이 연결되는 방식입니다. 대본이 음성이 되고, 음성이 말하는 아바타가 되며, 이미지가 비디오가 됩니다. 앱 간에 파일을 주고받는 대신 각 단계의 결과물이 다음 단계로 전달됩니다. 음성은 비디오에서 실제로 누군가 나에게 말하는 것처럼 느끼게 하는 핵심이며, 이는 Fish Audio가 만드는 서비스의 본질입니다. 이를 이미지 및 비디오와 동일한 대화에 포함함으로써 에이전트는 몇 줄의 텍스트에서 시작해 완성된 클립까지 아이디어를 발전시킬 수 있습니다.
새로운 모델이 추가되면 구성 변경 없이 에이전트의 실시간 모델 목록에 나타납니다. 이를 통해 무엇을 할 수 있는지 확인하는 가장 쉬운 방법은 서버를 연결하고 평소라면 세 가지 도구를 열어서 만들었을 무언가를 요청해 보는 것입니다.
Fish Audio가 처음이신가요? 무료 가입 → 1분 안에 MCP 서버를 연결하고 무료 요금제에 포함된 이미지 생성부터 시작해 보세요.
비디오, 립싱크 및 아바타를 사용할 준비가 되셨나요? 요금제 보기 → Plus 이상의 요금제는 MCP를 통한 비디오 생성, 립싱크 및 말하는 아바타 기능을 제공합니다.
자주 묻는 질문
Claude Code로 이미지를 생성할 수 있나요?
Claude Code와 Cursor를 위한 비디오 생성 MCP가 있나요?
Fish Audio MCP 서버를 사용하려면 API 키가 필요한가요?
개발자 API 크레딧을 사용하나요?
에이전트가 저에게 묻지 않고 크레딧을 사용할 수 있나요?
생성이 실패하면 어떻게 되나요?
Fish Audio TTS로 생성된 오디오를 립싱크나 아바타에 사용할 수 있나요?
어떤 AI 에이전트가 Fish Audio MCP 서버와 작동하나요?
Sabrina is part of Fish Audio's support and marketing team, helping users get the most out of AI voice products while turning launches, updates, and customer insights into clear, practical content.
Sabrina Shu의 더 많은 글 보기