7 de out. de 2026Guia

MCP de Geração de Imagem: Imagens, Vídeo e Sincronização Labial com Fish Audio

MCP de Geração de Imagem: Imagens, Vídeo e Sincronização Labial com Fish Audio

O servidor MCP do Fish Audio agora gera e edita imagens, cria vídeos, sincroniza lábios com novos áudios e transforma retratos em avatares falantes — a partir do Claude Code, Claude.ai, Cursor, Codex, Windsurf e Devin. Um único login, dezenas de modelos e um orçamento de preço antes de cada tarefa de imagem, vídeo, sincronização labial ou avatar.

Outubro de 2026 | O MCP do Fish Audio agora suporta geração de imagem, geração de vídeo e sincronização labial


Peça ao seu agente de codificação uma foto de produto, um teaser de cinco segundos ou uma atualização com um apresentador falante e, geralmente, você encontrará uma barreira. Alguns agentes não conseguem criar imagens de forma alguma, outros oferecem um único modelo de imagem integrado e vídeo raramente é uma opção. A solução comum é um servidor MCP de geração de imagem, mas a maioria deles conecta um único modelo e exige que você crie e cole uma chave de API separada para cada provedor.

O Fish Audio adota uma abordagem diferente. A mesma conexão MCP que seu agente já usa para conversão de texto em fala, transcrição e pesquisa de voz agora pode gerar e editar imagens, criar vídeos, sincronizar lábios com novos áudios e transformar um retrato em um avatar falante. Você faz login uma única vez, escolhe entre dezenas de modelos de imagem, vídeo e sincronização labial e aprova um orçamento antes que qualquer tarefa de imagem, vídeo, sincronização labial ou avatar seja cobrada.

Como as ferramentas de voz residem no mesmo servidor, seu agente também pode fazer algo que nenhum MCP de finalidade única consegue: escrever um roteiro, dar voz a ele com o Fish Audio e entregar esse áudio diretamente a um modelo de avatar falante — em uma única conversa.

Já está conectado ao servidor MCP do Fish Audio? Nenhuma atualização é necessária. Peça ao seu agente para "listar os modelos de mídia do Fish Audio" e as novas ferramentas estarão prontas para uso.

Novo no Fish Audio? Inscreva-se gratuitamente → e conecte-se com seu agente em menos de um minuto.


O Que Há de Novo no Servidor MCP do Fish Audio

Comece com o que a atualização adiciona. Com ela, o servidor MCP do Fish Audio funciona como um MCP de geração de imagem, um MCP de geração de vídeo e uma ferramenta de sincronização labial, tudo em um só. As novas ferramentas de mídia estão ao lado das ferramentas de áudio existentes e utilizam os mesmos créditos do aplicativo web Fish Audio.

Por que uma única conexão em vez de um MCP por modelo?

  • Sem chaves de API para coletar. Você faz login com sua conta Fish Audio. Não há chave de provedor para solicitar, colar em um arquivo de configuração ou rotacionar.
  • Um único saldo. Cada modelo consome créditos do seu plano Fish Audio, portanto, mudar de um modelo de imagem para um de vídeo não significa recarregar outra conta.
  • Trocar de modelo é uma frase, não uma configuração. Peça um modelo diferente em linguagem simples, e o agente buscará as opções e fornecerá o orçamento para o novo trabalho.

Aqui está o que seu agente pode fazer agora:

CapacidadeO que você forneceOs modelos disponíveis incluem
Texto para imagemUm promptGPT Image 2, GPT Image 2.5 (Flare e Sunburst), Seedream 4.5 e 5.0, modelos Nano Banana
Edição e upscaling de imagemUma imagem + instruçõesOs modelos acima, além do Topaz HD para upscaling
Texto para vídeo e imagem para vídeoUm prompt, opcionalmente uma imagem inicialSeedance, Kling, Veo 3.1, MiniMax H3, WAN 3.0, Gemini Omni Flash
Sincronização labial (baseada em vídeo)Um vídeo + novo áudioSync LipSync v3, Sync LipSync v2 Pro, PixVerse Lip Sync, Veed Lip Sync
Avatares falantes (baseados em imagem)Um retrato + áudioCreatify Aurora Avatar, HeyGen Avatar 4, Veed Fabric 1.0 Avatar, Infinitalk Avatar

A lista de modelos muda com o tempo. Seu agente sempre trabalha a partir da lista atualizada, então ele vê novos modelos assim que são adicionados.

A geração, edição e upscaling de imagens estão disponíveis no plano Gratuito. Geração de vídeo, sincronização labial e avatares falantes exigem o plano Plus pago ou superior.


Gere, Edite e Aumente a Escala de Imagens

Descreva a imagem e o agente escolherá um modelo, lerá suas opções, como proporção, resolução e qualidade, e então fornecerá o orçamento. Para editar, forneça uma imagem e uma instrução como "mantenha o elemento principal, mude o fundo para um pôr do sol quente". As imagens geralmente ficam prontas em menos de um minuto e você pode solicitar várias de uma vez, dependendo do seu plano.

Um gatinho em um cobertor macio, gerado a partir de um prompt de uma linha através do servidor MCP do Fish Audio no Codex

Gere Vídeo a partir de Texto, Imagens ou Vídeo de Referência

As ferramentas de vídeo transformam o servidor MCP em um MCP de geração de vídeo para qualquer agente que suporte servidores MCP remotos. Comece com um prompt de texto, anime uma imagem estática ou — em modelos que suportam — guie o resultado com mídia de referência. As opções de proporção, resolução e duração variam conforme o modelo, e o agente as lê antes de fornecer o orçamento. Os vídeos podem levar alguns minutos; o agente verifica o progresso por conta própria e retorna um link quando o arquivo estiver pronto.

Imagem de um pequeno vídeo gerado por IA de um gatinho bebendo água, criado com o Seedance 2.0 através do servidor MCP do Fish Audio

Sincronização Labial e Avatares Falantes

Ambas as capacidades fazem alguém na tela falar uma nova trilha de áudio. A diferença é a partir do que você começa: um vídeo existente ou uma única imagem.

Baseado em vídeo: sincronize novamente filmagens existentes. Forneça ao modelo um vídeo de alguém falando e uma nova trilha de áudio, e ele ajustará os movimentos da boca para corresponder. Foi criado para atualizar filmagens que você já possui: mudar uma fala em um vídeo de produto, gravar uma correção sem refilmar ou localizar um clipe com apresentador para outro idioma. Esses modelos funcionam apenas com vídeo e áudio e não aceitam um prompt de texto.

Baseado em imagem: anime um retrato. Forneça ao modelo um único retrato e um arquivo de áudio, e ele animará o rosto, a cabeça e a expressão para corresponder à fala. O Creatify Aurora Avatar também aceita um prompt opcional para controlar o enquadramento, o fundo e a iluminação, enquanto o Infinitalk Avatar exige um prompt e produz um visual mais expressivo.

Use material sobre o qual você possua os direitos. Antes de cada tarefa de sincronização labial ou avatar, a mensagem de confirmação lembra você de usar apenas filmagens, retratos e vozes que você tem permissão para usar.

Cada uma dessas ferramentas é útil por si só. A mudança maior é o que acontece quando elas trabalham juntas.


Do Roteiro ao Avatar Falante em uma Única Conversa

É aqui que ter voz e vídeo no mesmo servidor MCP se torna vantajoso. A maioria das ferramentas de avatar assume que você já possui o áudio finalizado. Com o Fish Audio, seu agente pode produzir o próprio áudio e passá-lo diretamente para o modelo de avatar.

Aqui está o fluxo:

  1. Escreva o roteiro. Cole-o ou deixe o agente criar o rascunho.
  2. Dê voz a ele. O agente chama text_to_speech com uma voz da biblioteca de vozes do Fish Audio, seu próprio clone de voz ou uma voz que você criou com o Voice Design. Adicione tags de áudio como [excited] ou [whispering] para moldar a entrega. O text-to-speech é cobrado pela extensão do texto e debitado assim que a fala é gerada, sem um orçamento separado.
  3. Escolha um rosto. Carregue um retrato ou gere um com um modelo de imagem na mesma sessão.
  4. Anime-o. O agente envia o retrato e a fala que acabou de gerar para um modelo de avatar. Não há necessidade de baixar o áudio e carregá-lo novamente — a fala finalizada é passada diretamente.
  5. Aprove e receba. Você verá um orçamento para o vídeo do avatar, confirmará e receberá um link para o arquivo finalizado.

Testamos exatamente este caminho: um clipe de seis segundos gerado com text_to_speech foi aceito diretamente como a entrada de áudio do avatar, e o orçamento refletiu sua duração exata — sem necessidade de download e novo upload.

Diagrama de um roteiro tornando-se um vídeo de avatar falante através do servidor MCP do Fish Audio: roteiro, text-to-speech, retrato, modelo de avatar, vídeo finalizado

Copie isto em seu agente para testar:

Use o Fish Audio para criar um vídeo de avatar falante 9:16:
1. Transforme este roteiro em fala com uma voz feminina calorosa em inglês:
   "Hi, welcome to Fish Audio. Today I'll show you lip sync and talking avatars."
2. Use meu retrato carregado com o HeyGen Avatar 4 em 720p e faça com que ela fale esse áudio.
3. Forneça o orçamento primeiro. Gere depois que eu confirmar e envie-me o link.

A mesma ideia funciona para sincronização labial. Aponte o agente para um vídeo de apresentador existente e dê a ele uma nova fala:

Use o Fish Audio para dar uma nova fala ao meu vídeo de apresentador carregado:
1. Gere fala com minha voz clonada: "As novidades de hoje estão com 20% de desconto. Link nos comentários."
2. Use o Sync LipSync v3 para combinar os lábios no vídeo com o novo áudio.
Forneça o orçamento primeiro e gere após minha confirmação.

Avatares falantes e sincronização labial exigem um plano Plus pago ou superior. Ver planos →

Reutilize Qualquer Resultado como a Próxima Entrada

O encadeamento não se limita ao áudio. Qualquer resultado finalizado em seu espaço de trabalho pode alimentar a próxima tarefa sem sair da conversa: gere uma imagem e, em seguida, peça ao agente para "transformar a imagem que você acabou de criar em um vídeo de quatro segundos com um zoom lento (push-in)". O agente passa a imagem por referência — nada para baixar, nada para carregar novamente.

Para arquivos em seu computador, o agente cria um espaço de upload temporário e carrega o arquivo para você. Se o seu agente não conseguir carregar arquivos diretamente, ele fornecerá um link onde você poderá arrastar o arquivo do seu navegador.

Tudo isso acontece dentro do próprio agente. Isso importa mais do que parece: por conta própria, a maioria dos agentes de IA não consegue criar vídeos ou avatares falantes, e mesmo aqueles que geram imagens estão vinculados a um único modelo integrado. Conectar um servidor MCP é o que preenche essa lacuna.


Por Que Agentes de IA Precisam de MCP para Geração de Imagem e Vídeo

Comparação de um fluxo de trabalho manual em vários aplicativos versus um agente de IA gerando imagens e vídeos diretamente através de uma conexão MCP

Os agentes de IA de hoje são notavelmente capazes. Eles podem planejar uma campanha, escrever o roteiro e construir a página onde ele residirá. Quando se trata de visuais, no entanto, o suporte é desigual. Alguns assistentes, como o Claude, não geram fotos ou ilustrações da mesma forma que as ferramentas de geração de imagem. Outros, como ChatGPT e Codex, incluem geração de imagem, mas ela está atrelada ao modelo de um único provedor. Vídeo, sincronização labial e avatares falantes costumam estar fora de alcance.

Essa lacuna cria uma rotina familiar. Você escreve um prompt em seu agente, cola-o em um aplicativo de imagem ou vídeo separado, espera, baixa o arquivo e o traz de volta para o seu projeto. Cada revisão repete o ciclo. A alternativa que muitos desenvolvedores buscam é um servidor MCP por modelo, o que significa uma chave de API do provedor e uma entrada de configuração separada para cada um.

O Model Context Protocol (MCP) é a forma padrão de dar novas ferramentas a um agente, e é o que permite ao Fish Audio remover essas etapas extras e oferecer uma escolha de modelos. Seu agente chama as ferramentas de geração diretamente, os resultados retornam como links, e a próxima etapa, seja uma revisão, uma animação ou uma narração, acontece na mesma conversa. A geração de imagem no Claude Code, Cursor ou qualquer outro agente compatível torna-se mais uma chamada de ferramenta.

Chegar lá requer um único comando.


Como Configurar o MCP de Geração de Imagem

O servidor reside em https://api.fish.audio/mcp e usa HTTP streamable. O login acontece no seu navegador com sua conta Fish Audio — sem chave de API, sem variáveis de ambiente. Escolha seu agente abaixo.

Procurando pelo MCP de Documentação? Nosso guia anterior sobre llms.txt, MCP e Habilidades de Agentes aborda docs.fish.audio/mcp, um servidor somente leitura que permite que agentes de codificação consultem a documentação da API do Fish Audio. O servidor neste post é diferente: ele faz login em sua conta e cria conteúdo. Você pode executar ambos lado a lado.

Claude Code

claude mcp add --transport http fish-audio https://api.fish.audio/mcp

Em seguida, execute /mcp dentro do Claude Code para fazer login.

Claude.ai

Vá em Configurações → Conectores → Adicionar conector personalizado e insira https://api.fish.audio/mcp. O Claude guiará você pelo login.

Cursor

Abra a paleta de comandos (Cmd/Ctrl+Shift+P) → Open MCP settings → Add custom MCP, e adicione:

{
  "mcpServers": {
    "fish-audio": { "url": "https://api.fish.audio/mcp" }
  }
}

O Cursor solicitará que você faça login no primeiro uso.

Codex CLI

codex mcp add fish-audio https://api.fish.audio/mcp
codex mcp login fish-audio

O comando de login abre uma janela do navegador. Verifique a conexão com codex mcp get fish-audio.

Windsurf

Vá em Configurações → Cascade → MCP Servers → View raw config (~/.codeium/windsurf/mcp_config.json) e adicione:

{
  "mcpServers": {
    "fish-audio": { "url": "https://api.fish.audio/mcp" }
  }
}

Devin CLI

devin mcp add fish-audio --transport http --scope user --url https://api.fish.audio/mcp --scopes mcp
devin mcp login fish-audio --scopes mcp

Confirme se está conectado com devin mcp list. Como o Devin trabalha no seu terminal, ele também pode salvar os resultados localmente — em nosso teste, ele baixou um vídeo finalizado para a pasta Downloads sob demanda.

Faça Login e Escolha sua Equipe

Cada cliente abre a mesma página de login do Fish Audio. Você aprova a conexão uma vez e escolhe em qual equipe ela trabalhará; o cliente renova o acesso automaticamente depois disso.

Uma conexão está vinculada à equipe que você escolher. Ela só pode ver os espaços de trabalho dessa equipe e usar os créditos dessa equipe. Para trabalhar em uma equipe diferente, adicione o servidor novamente e escolha essa equipe no login.

Conectado? Tente seu primeiro prompt: "Crie uma imagem em aquarela de um farol ao amanhecer na proporção 16:9. Mostre-me o preço primeiro e depois gere." Comece gratuitamente com o Fish Audio →


Como Cada Geração Funciona: Orçar, Confirmar, Gerar

Uma vez conectado, seu agente pode executar modelos pagos em seu nome. Isso levanta uma questão justa: o que o impede de gastar mais do que você pretendia? A resposta está integrada no servidor, não fica a critério do agente.

  1. Descoberta. O agente lista os modelos disponíveis e lê o que precisa — opções suportadas, padrões e limites de entrada.
  2. Orçamento. Antes de qualquer tarefa de imagem, vídeo, sincronização labial ou avatar, o agente solicita uma estimativa. As estimativas são gratuitas. Os limites do plano também são verificados aqui, portanto, se uma solicitação exigir um plano superior, você saberá antes de ser solicitado a aprovar qualquer coisa.
  3. Confirmação. O agente mostra o preço e aguarda. Nada é cobrado até que você aprove.
  4. Geração. O agente envia a solicitação exata que você aprovou. O servidor precifica novamente no momento do envio; se o preço tiver mudado, a tarefa é rejeitada e o agente deve orçar novamente. A cobrança nunca excede o valor que você aprovou.
  5. Entrega. O agente verifica o progresso a cada poucos segundos e retorna um link para o arquivo finalizado, junto com o valor cobrado.

As ferramentas de voz são cobradas de forma diferente. Texto para fala e fala para texto não passam pela etapa de orçamento. Eles são cobrados assim que são executados, com o texto para fala sendo cobrado pela extensão do texto.

Duas salvaguardas adicionais funcionam em segundo plano:

  • Tarefas que falham são reembolsadas automaticamente. Se uma geração falhar, os créditos retornam sem você precisar pedir.
  • Repetir a mesma solicitação não cobrará duas vezes. Cada solicitação paga carrega uma chave única. Se o agente reenviar a mesma solicitação com a mesma chave após um tempo limite, o servidor retornará à tarefa original em vez de iniciar e cobrar por uma nova.

Muitos agentes adicionam sua própria camada por cima: o Codex, por exemplo, solicita sua permissão antes de cada chamada de ferramenta.


Sob o Capô: As Ferramentas de Mídia MCP

Para desenvolvedores, estas são as ferramentas de mídia que o agente chama nos bastidores:

FerramentaCobra créditos?O que faz
list_my_workspacesNãoLista os espaços de trabalho na equipe conectada
list_media_models / get_media_modelNãoLista os modelos e lê as opções e limites de entrada de um modelo
create_media_uploadNãoCria um espaço de upload de uma hora para um arquivo de imagem, vídeo ou áudio
estimate_image_generation / estimate_image_edit / estimate_video_generationNãoValida uma solicitação e retorna um orçamento
generate_image / generate_image_edit / generate_videoSimEnvia a tarefa aprovada
get_generation_status / get_generation_resultNãoAcompanha o progresso e retorna os arquivos finalizados e o faturamento

A sincronização labial e os avatares falantes funcionam através de generate_video. Ele reconhece a tarefa a partir de suas entradas: um vídeo mais áudio significa sincronização labial, e um retrato mais áudio significa um avatar. Ferramentas de áudio como text_to_speech, speech_to_text, search_voices, create_voice_clone e as ferramentas do Story Studio residem no mesmo servidor.

Você nunca precisa chamar nenhuma dessas ferramentas sozinho, no entanto. Na prática, você descreve o resultado desejado e o agente encadeia as chamadas corretas.


Exemplos de Prompts por Caso de Uso

Aqui estão alguns pontos de partida, agrupados pelo que você está criando:

Caso de usoO que você dizO que o agente faz
Ativos de produto e aplicativo"Gere uma imagem 1:1 de uma caneca de café de cerâmica em um balcão de mármore sob uma luz suave da manhã. Dê-me algumas variações e mostre o preço primeiro."Escolhe um modelo de imagem, orça o lote e gera após sua confirmação
Ativos de produto e aplicativo"Carregue screenshot.png e substitua o fundo por um gradiente limpo para nossa listagem na loja de aplicativos. Estime primeiro."Carrega seu arquivo, orça a edição e a aplica após sua confirmação
Vídeo de marketing e social"Faça um vídeo 9:16 de cinco segundos de tênis respingando em uma poça em câmera lenta. Faça o orçamento dos créditos e depois gere."Orça uma tarefa de texto para vídeo e retorna um link de vídeo
Vídeo de marketing e social"Transforme a imagem que você acabou de gerar em um vídeo curto com um zoom lento."Reutiliza a imagem diretamente como o quadro inicial
Atualização e localização de vídeo"Traduza este roteiro para o espanhol, dê voz a ele com meu próprio clone de voz e, em seguida, sincronize labialmente demo.mp4 com o áudio em espanhol usando o Sync LipSync v2 Pro. Orce antes de gerar."Traduz o roteiro, gera a fala, carrega o vídeo e orça a tarefa de sincronização labial
Apresentadores e avatares"Gere um retrato de uma apresentadora simpática em um estúdio iluminado e, em seguida, faça-a ler release-notes.md como um vídeo de avatar falante 9:16 com o Creatify Aurora Avatar."Cria o retrato e a fala, e então orça o vídeo do avatar
Conta"Quantos créditos do Fish Audio eu ainda tenho?"Verifica seu saldo

Em agentes de codificação como Claude Code, Codex e Devin, essas ferramentas funcionam em conjunto com o terminal. O agente pode gerar lotes de imagens para cada produto em uma pasta, carregar gravações locais ou baixar arquivos finalizados para o seu projeto.


Planos, Créditos e Limites

Antes de testar, é útil saber como os créditos funcionam e qual plano cada capacidade exige.

Quais Créditos Ele Usa

A geração de mídia através do MCP usa os seus créditos do plano web do Fish Audio, os mesmos créditos que você gasta no aplicativo web. Ele não utiliza créditos da API de Desenvolvedor, que são um saldo separado para a API do Fish Audio. Os dois são adquiridos em locais diferentes, então vale a pena saber qual deles recarregar.

Para adicionar créditos web ou mudar de plano, vá em Equipe → Planos. Como cada conexão MCP está vinculada à equipe que você escolheu no login, as gerações consomem créditos dessa equipe.

Qual Plano Você Precisa

O que seu agente pode gerar depende do seu plano. Os limites do plano são verificados quando o agente solicita um orçamento, portanto, um trabalho que seu plano não cobre é sinalizado antes mesmo de você ser solicitado a aprovar.

  • A geração, edição e upscaling de imagens estão disponíveis no plano Gratuito, que inclui uma cota diária de imagens.
  • Ao gerar imagens a partir de texto, cada solicitação de texto para imagem pode pedir até 2 imagens no Gratuito, 4 no Plus e 8 no Pro e Max. As edições de imagem retornam uma imagem por solicitação.
  • A geração de vídeo, a sincronização labial e os avatares falantes exigem um plano pago Plus, Pro ou Max.
  • As tarefas de vídeo, sincronização labial e avatar retornam um resultado por solicitação.

Se você está começando no Gratuito, a geração de imagem é a maneira mais fácil de testar o fluxo de trabalho. Quando estiver pronto para vídeo, sincronização labial ou avatares falantes, a atualização para o plano Plus pago ou superior os desbloqueará.

Preços

Cada modelo tem um preço diferente, e o custo de um trabalho também depende das configurações que você escolher, como resolução, duração ou o número de imagens. Em vez de depender de uma tabela de preços, peça um orçamento ao seu agente: é gratuito e reflete o preço atual. No entanto, observe que o text-to-speech é a exceção: ele é cobrado pela extensão do texto e debitado assim que é executado.

Como os orçamentos não custam nada, você pode comparar alguns modelos ou configurações para a mesma ideia e escolher a que melhor se adapta ao seu orçamento antes que a tarefa seja cobrada.

Uploads

Algumas tarefas começam com seus próprios arquivos: uma imagem para editar ou animar, um vídeo para sincronizar lábios ou áudio para um avatar. O agente cuida do upload para você, dentro destes limites:

  • Imagens: JPEG, PNG ou WebP, até 20 MB
  • Vídeo: MP4, MOV, WebM ou MKV, até 1 GB
  • Áudio: MP3, WAV, M4A, AAC, OGG ou FLAC, até 50 MB

Modelos individuais podem ter limites mais rigorosos. Por exemplo, o Creatify Aurora Avatar aceita de 1 a 60 segundos de áudio. O agente lê os limites de cada modelo antes de orçar e, se um provedor rejeitar a entrada após o envio, a tarefa com falha será reembolsada. Resultados que você já gerou no mesmo espaço de trabalho não precisam ser carregados novamente; o agente os passa diretamente.

Prazos

As imagens geralmente ficam prontas em um minuto. Vídeos, sincronização labial e avatares podem levar vários minutos. Você não precisa ficar verificando: o agente acompanha o progresso por conta própria e retorna um link assim que o arquivo estiver pronto.


Considerações Finais: Seu Agente Agora é um Estúdio de Mídia

Os agentes de IA já conseguem planejar um lançamento, redigir a página de destino e publicar o código. Até agora, o visual era onde a maioria deles parava: na melhor das hipóteses, um único modelo de imagem integrado, com vídeo, sincronização labial e avatares falantes sendo devolvidos a uma pessoa e a uma ferramenta separada. Esta atualização preenche essa lacuna. Um MCP de geração de imagem dá ao seu agente voz, imagens, vídeo, sincronização labial e avatares falantes, sem chaves de API para gerenciar e com um orçamento antes de cada tarefa de mídia.

A mudança maior é como essas peças se conectam. Um roteiro torna-se uma voz, a voz torna-se um avatar falante e uma imagem torna-se um vídeo, com cada etapa entregando seu resultado para a próxima, em vez de arquivos circulando entre aplicativos. A voz é o que faz um vídeo parecer que alguém está realmente falando com você, e ela está no cerne do que o Fish Audio constrói. Colocá-la na mesma conversa que imagens e vídeos significa que seu agente pode levar uma ideia de poucas linhas de texto até um clipe finalizado.

À medida que novos modelos são adicionados, eles aparecem na lista de modelos ativos do seu agente, sem necessidade de reconfigurar nada. A maneira mais fácil de ver o que isso desbloqueia é conectar o servidor e pedir algo que você normalmente abriria três ferramentas diferentes para criar.

Novo no Fish Audio? Inscreva-se gratuitamente → Conecte o servidor MCP em menos de um minuto e comece com a geração de imagem, incluída no plano gratuito.

Pronto para vídeo, sincronização labial e avatares? Ver planos → O plano Plus e superiores desbloqueiam geração de vídeo, sincronização labial e avatares falantes via MCP.

Leia a documentação do servidor MCP →

Perguntas Frequentes

O Claude Code pode gerar imagens?
Não nativamente, mas pode com um servidor MCP. Adicione o servidor MCP do Fish Audio com um comando, faça o login e o Claude Code poderá gerar e editar imagens, criar vídeos e produzir vídeos com sincronização labial e avatares falantes.
Existe um MCP de geração de vídeo para o Claude Code e Cursor?
Sim. O servidor MCP do Fish Audio lida com texto para vídeo, imagem para vídeo, sincronização labial e avatares falantes no Claude Code, Cursor, Codex, Windsurf, Claude.ai e Devin. Os recursos de vídeo exigem um plano Plus ou superior.
Preciso de uma chave de API para usar o servidor MCP do Fish Audio?
Não. Você se conecta fazendo login com sua conta Fish Audio no seu navegador. Não há chave de API ou variável de ambiente para configurar.
Ele usa meus créditos da API de Desenvolvedor?
Não. As gerações via MCP usam os créditos do seu plano web, os mesmos do aplicativo web Fish Audio. Os créditos da API de Desenvolvedor são um saldo separado e não são afetados. Você pode gerenciar os créditos web em [Equipe → Planos](https://fish.audio/app/team/?tab=plans).
O agente pode gastar créditos sem me perguntar?
Não para geração de mídia. Cada tarefa de imagem, vídeo, sincronização labial e avatar é orçada primeiro, e nada é cobrado até que você aprove. O servidor verifica novamente o preço no momento do envio e rejeita o trabalho se ele tiver mudado, garantindo que a cobrança nunca exceda o valor aprovado. No entanto, o text-to-speech e speech-to-text funcionam de forma diferente: são cobrados assim que executados, com o text-to-speech cobrado pela extensão do texto.
O que acontece se uma geração falhar?
Os créditos são reembolsados automaticamente. Se o agente repetir uma solicitação após um tempo limite, o servidor reconhece a duplicata e não cobrará duas vezes.
Posso usar áudio gerado com o text-to-speech do Fish Audio para sincronização labial ou avatares?
Sim. A fala que seu agente gera com o servidor MCP do Fish Audio pode ir direto para uma tarefa de sincronização labial ou avatar no mesmo espaço de trabalho, sem necessidade de baixar e carregar novamente.
Quais agentes de IA funcionam com o servidor MCP do Fish Audio?
Qualquer cliente que suporte servidores MCP remotos via HTTP streamable com login OAuth. As etapas de configuração para Claude Code, Claude.ai, Cursor, Codex CLI, Windsurf e Devin CLI estão acima, e a [documentação do servidor MCP](https://docs.fish.audio/overview/mcp) é atualizada conforme novos clientes são adicionados.
Sabrina Shu

Sabrina Shu

Sabrina is part of Fish Audio's support and marketing team, helping users get the most out of AI voice products while turning launches, updates, and customer insights into clear, practical content.

Leia mais de Sabrina Shu

Crie vozes que parecem reais

Comece a gerar áudio da mais alta qualidade hoje.

Já tem uma conta? Entrar