MCP de Geração de Imagem: Imagens, Vídeo e Sincronização Labial com Fish Audio
O servidor MCP do Fish Audio agora gera e edita imagens, cria vídeos, sincroniza lábios com novos áudios e transforma retratos em avatares falantes — a partir do Claude Code, Claude.ai, Cursor, Codex, Windsurf e Devin. Um único login, dezenas de modelos e um orçamento de preço antes de cada tarefa de imagem, vídeo, sincronização labial ou avatar.
Outubro de 2026 | O MCP do Fish Audio agora suporta geração de imagem, geração de vídeo e sincronização labial
Peça ao seu agente de codificação uma foto de produto, um teaser de cinco segundos ou uma atualização com um apresentador falante e, geralmente, você encontrará uma barreira. Alguns agentes não conseguem criar imagens de forma alguma, outros oferecem um único modelo de imagem integrado e vídeo raramente é uma opção. A solução comum é um servidor MCP de geração de imagem, mas a maioria deles conecta um único modelo e exige que você crie e cole uma chave de API separada para cada provedor.
O Fish Audio adota uma abordagem diferente. A mesma conexão MCP que seu agente já usa para conversão de texto em fala, transcrição e pesquisa de voz agora pode gerar e editar imagens, criar vídeos, sincronizar lábios com novos áudios e transformar um retrato em um avatar falante. Você faz login uma única vez, escolhe entre dezenas de modelos de imagem, vídeo e sincronização labial e aprova um orçamento antes que qualquer tarefa de imagem, vídeo, sincronização labial ou avatar seja cobrada.
Como as ferramentas de voz residem no mesmo servidor, seu agente também pode fazer algo que nenhum MCP de finalidade única consegue: escrever um roteiro, dar voz a ele com o Fish Audio e entregar esse áudio diretamente a um modelo de avatar falante — em uma única conversa.
Já está conectado ao servidor MCP do Fish Audio? Nenhuma atualização é necessária. Peça ao seu agente para "listar os modelos de mídia do Fish Audio" e as novas ferramentas estarão prontas para uso.
Novo no Fish Audio? Inscreva-se gratuitamente → e conecte-se com seu agente em menos de um minuto.
O Que Há de Novo no Servidor MCP do Fish Audio
Comece com o que a atualização adiciona. Com ela, o servidor MCP do Fish Audio funciona como um MCP de geração de imagem, um MCP de geração de vídeo e uma ferramenta de sincronização labial, tudo em um só. As novas ferramentas de mídia estão ao lado das ferramentas de áudio existentes e utilizam os mesmos créditos do aplicativo web Fish Audio.
Por que uma única conexão em vez de um MCP por modelo?
- Sem chaves de API para coletar. Você faz login com sua conta Fish Audio. Não há chave de provedor para solicitar, colar em um arquivo de configuração ou rotacionar.
- Um único saldo. Cada modelo consome créditos do seu plano Fish Audio, portanto, mudar de um modelo de imagem para um de vídeo não significa recarregar outra conta.
- Trocar de modelo é uma frase, não uma configuração. Peça um modelo diferente em linguagem simples, e o agente buscará as opções e fornecerá o orçamento para o novo trabalho.
Aqui está o que seu agente pode fazer agora:
| Capacidade | O que você fornece | Os modelos disponíveis incluem |
|---|---|---|
| Texto para imagem | Um prompt | GPT Image 2, GPT Image 2.5 (Flare e Sunburst), Seedream 4.5 e 5.0, modelos Nano Banana |
| Edição e upscaling de imagem | Uma imagem + instruções | Os modelos acima, além do Topaz HD para upscaling |
| Texto para vídeo e imagem para vídeo | Um prompt, opcionalmente uma imagem inicial | Seedance, Kling, Veo 3.1, MiniMax H3, WAN 3.0, Gemini Omni Flash |
| Sincronização labial (baseada em vídeo) | Um vídeo + novo áudio | Sync LipSync v3, Sync LipSync v2 Pro, PixVerse Lip Sync, Veed Lip Sync |
| Avatares falantes (baseados em imagem) | Um retrato + áudio | Creatify Aurora Avatar, HeyGen Avatar 4, Veed Fabric 1.0 Avatar, Infinitalk Avatar |
A lista de modelos muda com o tempo. Seu agente sempre trabalha a partir da lista atualizada, então ele vê novos modelos assim que são adicionados.
A geração, edição e upscaling de imagens estão disponíveis no plano Gratuito. Geração de vídeo, sincronização labial e avatares falantes exigem o plano Plus pago ou superior.
Gere, Edite e Aumente a Escala de Imagens
Descreva a imagem e o agente escolherá um modelo, lerá suas opções, como proporção, resolução e qualidade, e então fornecerá o orçamento. Para editar, forneça uma imagem e uma instrução como "mantenha o elemento principal, mude o fundo para um pôr do sol quente". As imagens geralmente ficam prontas em menos de um minuto e você pode solicitar várias de uma vez, dependendo do seu plano.
Gere Vídeo a partir de Texto, Imagens ou Vídeo de Referência
As ferramentas de vídeo transformam o servidor MCP em um MCP de geração de vídeo para qualquer agente que suporte servidores MCP remotos. Comece com um prompt de texto, anime uma imagem estática ou — em modelos que suportam — guie o resultado com mídia de referência. As opções de proporção, resolução e duração variam conforme o modelo, e o agente as lê antes de fornecer o orçamento. Os vídeos podem levar alguns minutos; o agente verifica o progresso por conta própria e retorna um link quando o arquivo estiver pronto.
Sincronização Labial e Avatares Falantes
Ambas as capacidades fazem alguém na tela falar uma nova trilha de áudio. A diferença é a partir do que você começa: um vídeo existente ou uma única imagem.
Baseado em vídeo: sincronize novamente filmagens existentes. Forneça ao modelo um vídeo de alguém falando e uma nova trilha de áudio, e ele ajustará os movimentos da boca para corresponder. Foi criado para atualizar filmagens que você já possui: mudar uma fala em um vídeo de produto, gravar uma correção sem refilmar ou localizar um clipe com apresentador para outro idioma. Esses modelos funcionam apenas com vídeo e áudio e não aceitam um prompt de texto.
Baseado em imagem: anime um retrato. Forneça ao modelo um único retrato e um arquivo de áudio, e ele animará o rosto, a cabeça e a expressão para corresponder à fala. O Creatify Aurora Avatar também aceita um prompt opcional para controlar o enquadramento, o fundo e a iluminação, enquanto o Infinitalk Avatar exige um prompt e produz um visual mais expressivo.
Use material sobre o qual você possua os direitos. Antes de cada tarefa de sincronização labial ou avatar, a mensagem de confirmação lembra você de usar apenas filmagens, retratos e vozes que você tem permissão para usar.
Cada uma dessas ferramentas é útil por si só. A mudança maior é o que acontece quando elas trabalham juntas.
Do Roteiro ao Avatar Falante em uma Única Conversa
É aqui que ter voz e vídeo no mesmo servidor MCP se torna vantajoso. A maioria das ferramentas de avatar assume que você já possui o áudio finalizado. Com o Fish Audio, seu agente pode produzir o próprio áudio e passá-lo diretamente para o modelo de avatar.
Aqui está o fluxo:
- Escreva o roteiro. Cole-o ou deixe o agente criar o rascunho.
- Dê voz a ele. O agente chama
text_to_speechcom uma voz da biblioteca de vozes do Fish Audio, seu próprio clone de voz ou uma voz que você criou com o Voice Design. Adicione tags de áudio como[excited]ou[whispering]para moldar a entrega. O text-to-speech é cobrado pela extensão do texto e debitado assim que a fala é gerada, sem um orçamento separado. - Escolha um rosto. Carregue um retrato ou gere um com um modelo de imagem na mesma sessão.
- Anime-o. O agente envia o retrato e a fala que acabou de gerar para um modelo de avatar. Não há necessidade de baixar o áudio e carregá-lo novamente — a fala finalizada é passada diretamente.
- Aprove e receba. Você verá um orçamento para o vídeo do avatar, confirmará e receberá um link para o arquivo finalizado.
Testamos exatamente este caminho: um clipe de seis segundos gerado com text_to_speech foi aceito diretamente como a entrada de áudio do avatar, e o orçamento refletiu sua duração exata — sem necessidade de download e novo upload.
Copie isto em seu agente para testar:
Use o Fish Audio para criar um vídeo de avatar falante 9:16:
1. Transforme este roteiro em fala com uma voz feminina calorosa em inglês:
"Hi, welcome to Fish Audio. Today I'll show you lip sync and talking avatars."
2. Use meu retrato carregado com o HeyGen Avatar 4 em 720p e faça com que ela fale esse áudio.
3. Forneça o orçamento primeiro. Gere depois que eu confirmar e envie-me o link.
A mesma ideia funciona para sincronização labial. Aponte o agente para um vídeo de apresentador existente e dê a ele uma nova fala:
Use o Fish Audio para dar uma nova fala ao meu vídeo de apresentador carregado:
1. Gere fala com minha voz clonada: "As novidades de hoje estão com 20% de desconto. Link nos comentários."
2. Use o Sync LipSync v3 para combinar os lábios no vídeo com o novo áudio.
Forneça o orçamento primeiro e gere após minha confirmação.
Avatares falantes e sincronização labial exigem um plano Plus pago ou superior. Ver planos →
Reutilize Qualquer Resultado como a Próxima Entrada
O encadeamento não se limita ao áudio. Qualquer resultado finalizado em seu espaço de trabalho pode alimentar a próxima tarefa sem sair da conversa: gere uma imagem e, em seguida, peça ao agente para "transformar a imagem que você acabou de criar em um vídeo de quatro segundos com um zoom lento (push-in)". O agente passa a imagem por referência — nada para baixar, nada para carregar novamente.
Para arquivos em seu computador, o agente cria um espaço de upload temporário e carrega o arquivo para você. Se o seu agente não conseguir carregar arquivos diretamente, ele fornecerá um link onde você poderá arrastar o arquivo do seu navegador.
Tudo isso acontece dentro do próprio agente. Isso importa mais do que parece: por conta própria, a maioria dos agentes de IA não consegue criar vídeos ou avatares falantes, e mesmo aqueles que geram imagens estão vinculados a um único modelo integrado. Conectar um servidor MCP é o que preenche essa lacuna.
Por Que Agentes de IA Precisam de MCP para Geração de Imagem e Vídeo
Os agentes de IA de hoje são notavelmente capazes. Eles podem planejar uma campanha, escrever o roteiro e construir a página onde ele residirá. Quando se trata de visuais, no entanto, o suporte é desigual. Alguns assistentes, como o Claude, não geram fotos ou ilustrações da mesma forma que as ferramentas de geração de imagem. Outros, como ChatGPT e Codex, incluem geração de imagem, mas ela está atrelada ao modelo de um único provedor. Vídeo, sincronização labial e avatares falantes costumam estar fora de alcance.
Essa lacuna cria uma rotina familiar. Você escreve um prompt em seu agente, cola-o em um aplicativo de imagem ou vídeo separado, espera, baixa o arquivo e o traz de volta para o seu projeto. Cada revisão repete o ciclo. A alternativa que muitos desenvolvedores buscam é um servidor MCP por modelo, o que significa uma chave de API do provedor e uma entrada de configuração separada para cada um.
O Model Context Protocol (MCP) é a forma padrão de dar novas ferramentas a um agente, e é o que permite ao Fish Audio remover essas etapas extras e oferecer uma escolha de modelos. Seu agente chama as ferramentas de geração diretamente, os resultados retornam como links, e a próxima etapa, seja uma revisão, uma animação ou uma narração, acontece na mesma conversa. A geração de imagem no Claude Code, Cursor ou qualquer outro agente compatível torna-se mais uma chamada de ferramenta.
Chegar lá requer um único comando.
Como Configurar o MCP de Geração de Imagem
O servidor reside em https://api.fish.audio/mcp e usa HTTP streamable. O login acontece no seu navegador com sua conta Fish Audio — sem chave de API, sem variáveis de ambiente. Escolha seu agente abaixo.
Procurando pelo MCP de Documentação? Nosso guia anterior sobre llms.txt, MCP e Habilidades de Agentes aborda
docs.fish.audio/mcp, um servidor somente leitura que permite que agentes de codificação consultem a documentação da API do Fish Audio. O servidor neste post é diferente: ele faz login em sua conta e cria conteúdo. Você pode executar ambos lado a lado.
Claude Code
claude mcp add --transport http fish-audio https://api.fish.audio/mcp
Em seguida, execute /mcp dentro do Claude Code para fazer login.
Claude.ai
Vá em Configurações → Conectores → Adicionar conector personalizado e insira https://api.fish.audio/mcp. O Claude guiará você pelo login.
Cursor
Abra a paleta de comandos (Cmd/Ctrl+Shift+P) → Open MCP settings → Add custom MCP, e adicione:
{
"mcpServers": {
"fish-audio": { "url": "https://api.fish.audio/mcp" }
}
}
O Cursor solicitará que você faça login no primeiro uso.
Codex CLI
codex mcp add fish-audio https://api.fish.audio/mcp
codex mcp login fish-audio
O comando de login abre uma janela do navegador. Verifique a conexão com codex mcp get fish-audio.
Windsurf
Vá em Configurações → Cascade → MCP Servers → View raw config (~/.codeium/windsurf/mcp_config.json) e adicione:
{
"mcpServers": {
"fish-audio": { "url": "https://api.fish.audio/mcp" }
}
}
Devin CLI
devin mcp add fish-audio --transport http --scope user --url https://api.fish.audio/mcp --scopes mcp
devin mcp login fish-audio --scopes mcp
Confirme se está conectado com devin mcp list. Como o Devin trabalha no seu terminal, ele também pode salvar os resultados localmente — em nosso teste, ele baixou um vídeo finalizado para a pasta Downloads sob demanda.
Faça Login e Escolha sua Equipe
Cada cliente abre a mesma página de login do Fish Audio. Você aprova a conexão uma vez e escolhe em qual equipe ela trabalhará; o cliente renova o acesso automaticamente depois disso.
Uma conexão está vinculada à equipe que você escolher. Ela só pode ver os espaços de trabalho dessa equipe e usar os créditos dessa equipe. Para trabalhar em uma equipe diferente, adicione o servidor novamente e escolha essa equipe no login.
Conectado? Tente seu primeiro prompt: "Crie uma imagem em aquarela de um farol ao amanhecer na proporção 16:9. Mostre-me o preço primeiro e depois gere." Comece gratuitamente com o Fish Audio →
Como Cada Geração Funciona: Orçar, Confirmar, Gerar
Uma vez conectado, seu agente pode executar modelos pagos em seu nome. Isso levanta uma questão justa: o que o impede de gastar mais do que você pretendia? A resposta está integrada no servidor, não fica a critério do agente.
- Descoberta. O agente lista os modelos disponíveis e lê o que precisa — opções suportadas, padrões e limites de entrada.
- Orçamento. Antes de qualquer tarefa de imagem, vídeo, sincronização labial ou avatar, o agente solicita uma estimativa. As estimativas são gratuitas. Os limites do plano também são verificados aqui, portanto, se uma solicitação exigir um plano superior, você saberá antes de ser solicitado a aprovar qualquer coisa.
- Confirmação. O agente mostra o preço e aguarda. Nada é cobrado até que você aprove.
- Geração. O agente envia a solicitação exata que você aprovou. O servidor precifica novamente no momento do envio; se o preço tiver mudado, a tarefa é rejeitada e o agente deve orçar novamente. A cobrança nunca excede o valor que você aprovou.
- Entrega. O agente verifica o progresso a cada poucos segundos e retorna um link para o arquivo finalizado, junto com o valor cobrado.
As ferramentas de voz são cobradas de forma diferente. Texto para fala e fala para texto não passam pela etapa de orçamento. Eles são cobrados assim que são executados, com o texto para fala sendo cobrado pela extensão do texto.
Duas salvaguardas adicionais funcionam em segundo plano:
- Tarefas que falham são reembolsadas automaticamente. Se uma geração falhar, os créditos retornam sem você precisar pedir.
- Repetir a mesma solicitação não cobrará duas vezes. Cada solicitação paga carrega uma chave única. Se o agente reenviar a mesma solicitação com a mesma chave após um tempo limite, o servidor retornará à tarefa original em vez de iniciar e cobrar por uma nova.
Muitos agentes adicionam sua própria camada por cima: o Codex, por exemplo, solicita sua permissão antes de cada chamada de ferramenta.
Sob o Capô: As Ferramentas de Mídia MCP
Para desenvolvedores, estas são as ferramentas de mídia que o agente chama nos bastidores:
| Ferramenta | Cobra créditos? | O que faz |
|---|---|---|
| list_my_workspaces | Não | Lista os espaços de trabalho na equipe conectada |
| list_media_models / get_media_model | Não | Lista os modelos e lê as opções e limites de entrada de um modelo |
| create_media_upload | Não | Cria um espaço de upload de uma hora para um arquivo de imagem, vídeo ou áudio |
| estimate_image_generation / estimate_image_edit / estimate_video_generation | Não | Valida uma solicitação e retorna um orçamento |
| generate_image / generate_image_edit / generate_video | Sim | Envia a tarefa aprovada |
| get_generation_status / get_generation_result | Não | Acompanha o progresso e retorna os arquivos finalizados e o faturamento |
A sincronização labial e os avatares falantes funcionam através de generate_video. Ele reconhece a tarefa a partir de suas entradas: um vídeo mais áudio significa sincronização labial, e um retrato mais áudio significa um avatar. Ferramentas de áudio como text_to_speech, speech_to_text, search_voices, create_voice_clone e as ferramentas do Story Studio residem no mesmo servidor.
Você nunca precisa chamar nenhuma dessas ferramentas sozinho, no entanto. Na prática, você descreve o resultado desejado e o agente encadeia as chamadas corretas.
Exemplos de Prompts por Caso de Uso
Aqui estão alguns pontos de partida, agrupados pelo que você está criando:
| Caso de uso | O que você diz | O que o agente faz |
|---|---|---|
| Ativos de produto e aplicativo | "Gere uma imagem 1:1 de uma caneca de café de cerâmica em um balcão de mármore sob uma luz suave da manhã. Dê-me algumas variações e mostre o preço primeiro." | Escolhe um modelo de imagem, orça o lote e gera após sua confirmação |
| Ativos de produto e aplicativo | "Carregue screenshot.png e substitua o fundo por um gradiente limpo para nossa listagem na loja de aplicativos. Estime primeiro." | Carrega seu arquivo, orça a edição e a aplica após sua confirmação |
| Vídeo de marketing e social | "Faça um vídeo 9:16 de cinco segundos de tênis respingando em uma poça em câmera lenta. Faça o orçamento dos créditos e depois gere." | Orça uma tarefa de texto para vídeo e retorna um link de vídeo |
| Vídeo de marketing e social | "Transforme a imagem que você acabou de gerar em um vídeo curto com um zoom lento." | Reutiliza a imagem diretamente como o quadro inicial |
| Atualização e localização de vídeo | "Traduza este roteiro para o espanhol, dê voz a ele com meu próprio clone de voz e, em seguida, sincronize labialmente demo.mp4 com o áudio em espanhol usando o Sync LipSync v2 Pro. Orce antes de gerar." | Traduz o roteiro, gera a fala, carrega o vídeo e orça a tarefa de sincronização labial |
| Apresentadores e avatares | "Gere um retrato de uma apresentadora simpática em um estúdio iluminado e, em seguida, faça-a ler release-notes.md como um vídeo de avatar falante 9:16 com o Creatify Aurora Avatar." | Cria o retrato e a fala, e então orça o vídeo do avatar |
| Conta | "Quantos créditos do Fish Audio eu ainda tenho?" | Verifica seu saldo |
Em agentes de codificação como Claude Code, Codex e Devin, essas ferramentas funcionam em conjunto com o terminal. O agente pode gerar lotes de imagens para cada produto em uma pasta, carregar gravações locais ou baixar arquivos finalizados para o seu projeto.
Planos, Créditos e Limites
Antes de testar, é útil saber como os créditos funcionam e qual plano cada capacidade exige.
Quais Créditos Ele Usa
A geração de mídia através do MCP usa os seus créditos do plano web do Fish Audio, os mesmos créditos que você gasta no aplicativo web. Ele não utiliza créditos da API de Desenvolvedor, que são um saldo separado para a API do Fish Audio. Os dois são adquiridos em locais diferentes, então vale a pena saber qual deles recarregar.
Para adicionar créditos web ou mudar de plano, vá em Equipe → Planos. Como cada conexão MCP está vinculada à equipe que você escolheu no login, as gerações consomem créditos dessa equipe.
Qual Plano Você Precisa
O que seu agente pode gerar depende do seu plano. Os limites do plano são verificados quando o agente solicita um orçamento, portanto, um trabalho que seu plano não cobre é sinalizado antes mesmo de você ser solicitado a aprovar.
- A geração, edição e upscaling de imagens estão disponíveis no plano Gratuito, que inclui uma cota diária de imagens.
- Ao gerar imagens a partir de texto, cada solicitação de texto para imagem pode pedir até 2 imagens no Gratuito, 4 no Plus e 8 no Pro e Max. As edições de imagem retornam uma imagem por solicitação.
- A geração de vídeo, a sincronização labial e os avatares falantes exigem um plano pago Plus, Pro ou Max.
- As tarefas de vídeo, sincronização labial e avatar retornam um resultado por solicitação.
Se você está começando no Gratuito, a geração de imagem é a maneira mais fácil de testar o fluxo de trabalho. Quando estiver pronto para vídeo, sincronização labial ou avatares falantes, a atualização para o plano Plus pago ou superior os desbloqueará.
Preços
Cada modelo tem um preço diferente, e o custo de um trabalho também depende das configurações que você escolher, como resolução, duração ou o número de imagens. Em vez de depender de uma tabela de preços, peça um orçamento ao seu agente: é gratuito e reflete o preço atual. No entanto, observe que o text-to-speech é a exceção: ele é cobrado pela extensão do texto e debitado assim que é executado.
Como os orçamentos não custam nada, você pode comparar alguns modelos ou configurações para a mesma ideia e escolher a que melhor se adapta ao seu orçamento antes que a tarefa seja cobrada.
Uploads
Algumas tarefas começam com seus próprios arquivos: uma imagem para editar ou animar, um vídeo para sincronizar lábios ou áudio para um avatar. O agente cuida do upload para você, dentro destes limites:
- Imagens: JPEG, PNG ou WebP, até 20 MB
- Vídeo: MP4, MOV, WebM ou MKV, até 1 GB
- Áudio: MP3, WAV, M4A, AAC, OGG ou FLAC, até 50 MB
Modelos individuais podem ter limites mais rigorosos. Por exemplo, o Creatify Aurora Avatar aceita de 1 a 60 segundos de áudio. O agente lê os limites de cada modelo antes de orçar e, se um provedor rejeitar a entrada após o envio, a tarefa com falha será reembolsada. Resultados que você já gerou no mesmo espaço de trabalho não precisam ser carregados novamente; o agente os passa diretamente.
Prazos
As imagens geralmente ficam prontas em um minuto. Vídeos, sincronização labial e avatares podem levar vários minutos. Você não precisa ficar verificando: o agente acompanha o progresso por conta própria e retorna um link assim que o arquivo estiver pronto.
Considerações Finais: Seu Agente Agora é um Estúdio de Mídia
Os agentes de IA já conseguem planejar um lançamento, redigir a página de destino e publicar o código. Até agora, o visual era onde a maioria deles parava: na melhor das hipóteses, um único modelo de imagem integrado, com vídeo, sincronização labial e avatares falantes sendo devolvidos a uma pessoa e a uma ferramenta separada. Esta atualização preenche essa lacuna. Um MCP de geração de imagem dá ao seu agente voz, imagens, vídeo, sincronização labial e avatares falantes, sem chaves de API para gerenciar e com um orçamento antes de cada tarefa de mídia.
A mudança maior é como essas peças se conectam. Um roteiro torna-se uma voz, a voz torna-se um avatar falante e uma imagem torna-se um vídeo, com cada etapa entregando seu resultado para a próxima, em vez de arquivos circulando entre aplicativos. A voz é o que faz um vídeo parecer que alguém está realmente falando com você, e ela está no cerne do que o Fish Audio constrói. Colocá-la na mesma conversa que imagens e vídeos significa que seu agente pode levar uma ideia de poucas linhas de texto até um clipe finalizado.
À medida que novos modelos são adicionados, eles aparecem na lista de modelos ativos do seu agente, sem necessidade de reconfigurar nada. A maneira mais fácil de ver o que isso desbloqueia é conectar o servidor e pedir algo que você normalmente abriria três ferramentas diferentes para criar.
Novo no Fish Audio? Inscreva-se gratuitamente → Conecte o servidor MCP em menos de um minuto e comece com a geração de imagem, incluída no plano gratuito.
Pronto para vídeo, sincronização labial e avatares? Ver planos → O plano Plus e superiores desbloqueiam geração de vídeo, sincronização labial e avatares falantes via MCP.
Perguntas Frequentes
O Claude Code pode gerar imagens?
Existe um MCP de geração de vídeo para o Claude Code e Cursor?
Preciso de uma chave de API para usar o servidor MCP do Fish Audio?
Ele usa meus créditos da API de Desenvolvedor?
O agente pode gastar créditos sem me perguntar?
O que acontece se uma geração falhar?
Posso usar áudio gerado com o text-to-speech do Fish Audio para sincronização labial ou avatares?
Quais agentes de IA funcionam com o servidor MCP do Fish Audio?
Sabrina is part of Fish Audio's support and marketing team, helping users get the most out of AI voice products while turning launches, updates, and customer insights into clear, practical content.
Leia mais de Sabrina Shu