MCP de generación de imágenes: imágenes, video y sincronización labial con Fish Audio
El servidor MCP de Fish Audio ahora genera y edita imágenes, crea videos, sincroniza labios con audio nuevo y convierte retratos en avatares parlantes — desde Claude Code, Claude.ai, Cursor, Codex, Windsurf y Devin. Un solo inicio de sesión, docenas de modelos y un presupuesto antes de cada trabajo de imagen, video, sincronización labial o avatar.
Octubre de 2026 | El MCP de Fish Audio ahora admite generación de imágenes, generación de video y sincronización labial
Si le pides a tu agente de programación una foto de producto, un teaser de cinco segundos o una actualización con un busto parlante, normalmente te encontrarás con un obstáculo. Algunos agentes no pueden crear imágenes en absoluto, otros ofrecen un único modelo de imagen integrado y el video rara vez es una opción. La solución habitual es un servidor MCP de generación de imágenes, pero la mayoría de ellos conectan un solo modelo y te piden que crees y pegues una clave API independiente para cada proveedor.
Fish Audio adopta un enfoque diferente. La misma conexión MCP que tu agente ya utiliza para texto a voz, transcripción y búsqueda de voces ahora puede generar y editar imágenes, crear videos, sincronizar labios con audio nuevo y convertir un retrato en un avatar parlante. Inicias sesión una vez, eliges entre docenas de modelos de imagen, video y sincronización labial, y apruebas un presupuesto antes de que se cobre cualquier trabajo de imagen, video, sincronización labial o avatar.
Debido a que las herramientas de voz residen en el mismo servidor, tu agente también puede hacer algo que ningún MCP de propósito único puede: escribir un guion, ponerle voz con Fish Audio y entregar ese audio directamente a un modelo de avatar parlante — en una sola conversación.
¿Ya estás conectado al servidor MCP de Fish Audio? No es necesario actualizar. Pídele a tu agente que "enumere los modelos multimedia de Fish Audio" y las nuevas herramientas estarán listas para usar.
¿Eres nuevo en Fish Audio? Regístrate gratis → y conéctate con tu agente en menos de un minuto.
Novedades en el servidor MCP de Fish Audio
Comencemos con lo que añade la actualización. Con ella, el servidor MCP de Fish Audio funciona como un MCP de generación de imágenes, un MCP de generación de video y una herramienta de sincronización labial, todo en uno. Las nuevas herramientas multimedia se sitúan junto a las herramientas de audio existentes y utilizan los mismos créditos que la aplicación web de Fish Audio.
¿Por qué una sola conexión en lugar de un MCP por modelo?
- Sin claves API que recopilar. Inicias sesión con tu cuenta de Fish Audio. No hay ninguna clave de proveedor que solicitar, pegar en un archivo de configuración o rotar.
- Un solo saldo. Cada modelo consume créditos de tu plan de Fish Audio, por lo que cambiar de un modelo de imagen a uno de video no significa tener que recargar otra cuenta.
- Cambiar de modelo es cuestión de una frase, no de configuración. Pide un modelo diferente en lenguaje natural y el agente buscará sus opciones y presupuestará el nuevo trabajo.
Esto es lo que tu agente puede hacer ahora:
| Capacidad | Lo que le proporcionas | Los modelos disponibles incluyen |
|---|---|---|
| Texto a imagen | Un prompt | GPT Image 2, GPT Image 2.5 (Flare y Sunburst), Seedream 4.5 y 5.0, modelos Nano Banana |
| Edición y escalado de imágenes | Una imagen + instrucciones | Los modelos anteriores, más Topaz HD para escalado |
| Texto a video e imagen a video | Un prompt, opcionalmente una imagen inicial | Seedance, Kling, Veo 3.1, MiniMax H3, WAN 3.0, Gemini Omni Flash |
| Sincronización labial (basada en video) | Un video + audio nuevo | Sync LipSync v3, Sync LipSync v2 Pro, PixVerse Lip Sync, Veed Lip Sync |
| Avatares parlantes (basados en imágenes) | Un retrato + audio | Creatify Aurora Avatar, HeyGen Avatar 4, Veed Fabric 1.0 Avatar, Infinitalk Avatar |
La disponibilidad de modelos cambia con el tiempo. Tu agente siempre trabaja con la lista en tiempo real, por lo que verá los nuevos modelos tan pronto como se añadan.
La generación, edición y escalado de imágenes están disponibles en el plan gratuito. La generación de video, la sincronización labial y los avatares parlantes requieren un plan Plus de pago o superior.
Generar, editar y escalar imágenes
Describe la imagen y el agente elegirá un modelo, leerá sus opciones (como relación de aspecto, resolución y calidad) y luego presupuestará el trabajo. Para editar, dale una imagen y una instrucción como "mantén al sujeto, cambia el fondo por un atardecer cálido". Las imágenes suelen terminarse en menos de un minuto y puedes solicitar varias a la vez dependiendo de tu plan.
Generar video a partir de texto, imágenes o video de referencia
Las herramientas de video convierten al servidor MCP en un MCP de generación de video para cualquier agente que admita servidores MCP remotos. Comienza desde un prompt de texto, anima una imagen estática o — en los modelos que lo admitan — guía el resultado con medios de referencia. Las opciones de relación de aspecto, resolución y duración varían según el modelo, y el agente las lee antes de presupuestar. Los videos pueden tardar unos minutos; el agente comprueba el progreso por su cuenta y devuelve un enlace cuando el archivo está listo.
Sincronización labial y avatares parlantes
Ambas capacidades hacen que alguien en pantalla hable con una nueva pista de audio. La diferencia es desde dónde empiezas: un video existente o una sola imagen.
Basado en video: resincronizar metraje existente. Dale al modelo un video de alguien hablando y una nueva pista de audio, y este reajustará los movimientos de la boca para que coincidan. Está diseñado para actualizar metraje que ya tienes: cambiar una frase en un video de producto, grabar una corrección sin volver a filmar o localizar un clip de un busto parlante a otro idioma. Estos modelos funcionan solo con video y audio y no aceptan prompts de texto.
Basado en imagen: animar un retrato. Dale al modelo un solo retrato y un archivo de audio, y este animará la cara, la cabeza y la expresión para que coincidan con el discurso. Creatify Aurora Avatar también acepta un prompt opcional para controlar el encuadre, el fondo y la iluminación, mientras que Infinitalk Avatar requiere un prompt y produce un aspecto más expresivo.
Usa material sobre el cual tengas los derechos. Antes de cada trabajo de sincronización labial o avatar, el mensaje de confirmación te recuerda que uses únicamente metraje, retratos y voces que tengas permiso para utilizar.
Cada una de estas herramientas es útil por sí sola. El cambio más importante es lo que ocurre cuando trabajan juntas.
Del guion al avatar parlante en una sola conversación
Aquí es donde tener voz y video en el mismo servidor MCP da sus frutos. La mayoría de las herramientas de avatar asumen que ya tienes el audio terminado. Con Fish Audio, tu agente puede producir el audio por sí mismo y pasarlo directamente al modelo de avatar.
Este es el flujo:
- Escribir el guion. Pégalo o deja que el agente lo redacte.
- Ponerle voz. El agente llama a
text_to_speechcon una voz de la biblioteca de voces de Fish Audio, tu propio clon de voz o una voz que hayas creado con Voice Design. Añade etiquetas de audio como[excited](emocionado) o[whispering](susurrando) para dar forma a la entrega. El texto a voz se factura por la longitud del texto y se cobra tan pronto como se genera el discurso, sin un presupuesto aparte. - Elegir una cara. Sube un retrato o genera uno con un modelo de imagen en la misma sesión.
- Animarla. El agente envía el retrato y el discurso que acaba de generar a un modelo de avatar. No es necesario descargar el audio y volver a subirlo — el discurso terminado se pasa directamente.
- Aprobar y recibir. Verás un presupuesto para el video del avatar, lo confirmas y obtienes un enlace al archivo terminado.
Probamos exactamente esta ruta: un clip de seis segundos generado con text_to_speech fue aceptado directamente como la entrada de audio del avatar, y el presupuesto reflejó su duración exacta — sin descargas ni resubidas.
Copia esto en tu agente para probarlo:
Use Fish Audio to make a 9:16 talking-avatar video:
1. Turn this script into speech with a warm female English voice:
"Hi, welcome to Fish Audio. Today I'll show you lip sync and talking avatars."
2. Use my uploaded portrait with HeyGen Avatar 4 at 720p and have her speak that audio.
3. Quote the price first. Generate after I confirm, then send me the link.
La misma idea funciona para la sincronización labial. Dirige al agente a un video de busto parlante existente y dale una nueva línea:
Use Fish Audio to give my uploaded talking-head video a new line:
1. Generate speech with my cloned voice: "Today's new arrivals are 20% off. Link in the comments."
2. Use Sync LipSync v3 to match the lips in the video to the new audio.
Quote first, and generate after I confirm.
Los avatares parlantes y la sincronización labial requieren un plan Plus de pago o superior. Ver planes →
Reutilizar cualquier resultado como la siguiente entrada
El encadenamiento no se limita al audio. Cualquier resultado terminado en tu espacio de trabajo puede alimentar el siguiente trabajo sin salir de la conversación: genera una imagen y luego pídele al agente que "convierta la imagen que acabas de hacer en un video de cuatro segundos con un suave zoom de acercamiento". El agente pasa la imagen por referencia — nada que descargar, nada que volver a subir.
Para los archivos en tu ordenador, el agente crea un espacio de carga temporal y sube el archivo por ti. Si tu agente no puede subir archivos directamente, te dará un enlace donde podrás arrastrar el archivo desde tu navegador.
Todo esto sucede dentro del propio agente. Eso importa más de lo que parece: por sí solos, la mayoría de los agentes de IA no pueden crear videos o avatares parlantes, e incluso aquellos que generan imágenes están ligados a un único modelo integrado. Conectar un servidor MCP es lo que cierra esa brecha.
Por qué los agentes de IA necesitan MCP para la generación de imágenes y videos
Los agentes de IA actuales son increíblemente capaces. Pueden planificar una campaña, escribir el guion y construir la página donde vivirá. Sin embargo, en lo que respecta a los visuales, el soporte es desigual. Algunos asistentes, como Claude, no generan fotos ni ilustraciones de la misma manera que lo hacen las herramientas de generación de imágenes. Otros, como ChatGPT y Codex, incluyen generación de imágenes, pero está ligada al modelo de un solo proveedor. El video, la sincronización labial y los avatares parlantes suelen estar fuera de su alcance.
Esa brecha crea una rutina familiar. Escribes un prompt en tu agente, lo pegas en una aplicación de imagen o video separada, esperas, descargas el archivo y lo traes de vuelta a tu proyecto. Cada revisión repite el ciclo. La alternativa que muchos desarrolladores buscan es un servidor MCP por modelo, lo que significa una clave API de proveedor y una entrada de configuración separadas para cada uno.
El Protocolo de Contexto de Modelo (MCP) es la forma estándar de dar nuevas herramientas a un agente, y es lo que permite a Fish Audio eliminar esos pasos adicionales y ofrecer una selección de modelos. Tu agente llama a las herramientas de generación directamente, los resultados regresan como enlaces y el siguiente paso, ya sea una revisión, una animación o una locución, ocurre en la misma conversación. La generación de imágenes en Claude Code, Cursor o cualquier otro agente compatible se convierte en una llamada de herramienta más.
Llegar allí requiere un solo comando.
Cómo configurar el MCP de generación de imágenes
El servidor reside en https://api.fish.audio/mcp y utiliza HTTP de transmisión. El inicio de sesión se realiza en tu navegador con tu cuenta de Fish Audio — sin claves API, sin variables de entorno. Elige tu agente a continuación.
¿Buscas el MCP de Documentación? Nuestra guía anterior sobre llms.txt, MCP y Habilidades de Agente cubre
docs.fish.audio/mcp, un servidor de solo lectura que permite a los agentes de programación consultar la documentación de la API de Fish Audio. El servidor de este post es diferente: inicia sesión en tu cuenta y crea contenido. Puedes ejecutar ambos en paralelo.
Claude Code
claude mcp add --transport http fish-audio https://api.fish.audio/mcp
Luego ejecuta /mcp dentro de Claude Code para iniciar sesión.
Claude.ai
Ve a Configuración → Conectores → Añadir conector personalizado e introduce https://api.fish.audio/mcp. Claude te guiará a través del inicio de sesión.
Cursor
Abre la paleta de comandos (Cmd/Ctrl+Shift+P) → Open MCP settings → Add custom MCP, y añade:
{
"mcpServers": {
"fish-audio": { "url": "https://api.fish.audio/mcp" }
}
}
Cursor te pedirá que inicies sesión la primera vez que lo uses.
Codex CLI
codex mcp add fish-audio https://api.fish.audio/mcp
codex mcp login fish-audio
El comando de inicio de sesión abre una ventana del navegador. Comprueba la conexión con codex mcp get fish-audio.
Windsurf
Ve a Settings → Cascade → MCP Servers → View raw config (~/.codeium/windsurf/mcp_config.json) y añade:
{
"mcpServers": {
"fish-audio": { "url": "https://api.fish.audio/mcp" }
}
}
Devin CLI
devin mcp add fish-audio --transport http --scope user --url https://api.fish.audio/mcp --scopes mcp
devin mcp login fish-audio --scopes mcp
Confirma que está conectado con devin mcp list. Debido a que Devin trabaja en tu terminal, también puede guardar los resultados localmente — en nuestra prueba, descargó un video terminado en la carpeta de Descargas tras solicitarlo.
Iniciar sesión y elegir tu equipo
Cada cliente abre la misma página de inicio de sesión de Fish Audio. Apruebas la conexión una vez y eliges en qué equipo trabaja; el cliente renueva el acceso automáticamente después de eso.
Una conexión está ligada al equipo que elijas. Solo puede ver los espacios de trabajo de ese equipo y usar los créditos de ese equipo. Para trabajar en un equipo diferente, añade el servidor de nuevo y elige ese equipo al iniciar sesión.
¿Conectado? Prueba tu primer prompt: "Crea una imagen en acuarela de 16:9 de un faro al amanecer. Muéstrame el precio primero y luego genérala". Empieza gratis con Fish Audio →
Cómo funciona cada generación: Presupuesto, Confirmación, Generación
Una vez conectado, tu agente puede ejecutar modelos de pago en tu nombre. Eso plantea una pregunta justa: ¿qué impide que gaste más de lo que pretendías? La respuesta está integrada en el servidor, no se deja al criterio del agente.
- Descubrir. El agente enumera los modelos disponibles y lee el que necesita — opciones admitidas, valores predeterminados y límites de entrada.
- Presupuestar. Antes de cualquier trabajo de imagen, video, sincronización labial o avatar, el agente solicita una estimación. Las estimaciones son gratuitas. Los límites del plan también se comprueban aquí, de modo que si una solicitud requiere un plan superior, te enteras antes de que se te pida que apruebes nada.
- Confirmar. El agente te muestra el precio y espera. No se cobra nada hasta que apruebas.
- Generar. El agente envía la solicitud exacta que aprobaste. El servidor vuelve a ponerle precio al enviarla; si el precio ha cambiado, el trabajo es rechazado y el agente debe presupuestar de nuevo. El cargo nunca excede la cantidad que aprobaste.
- Entregar. El agente comprueba el progreso cada pocos segundos y devuelve un enlace al archivo terminado, junto con lo que se cobró.
Las herramientas de voz se facturan de forma diferente. El texto a voz y el habla a texto no pasan por el paso de presupuesto. Se cobran tan pronto como se ejecutan, con el texto a voz facturado por la longitud del texto.
Dos salvaguardas más se ejecutan en segundo plano:
- Los trabajos fallidos se reembolsan automáticamente. Si una generación falla, los créditos regresan sin que tengas que pedirlos.
- Reintentar la misma solicitud no cobrará dos veces. Cada solicitud de pago lleva una clave única. Si el agente vuelve a enviar la misma solicitud con la misma clave después de un tiempo de espera, el servidor vuelve al trabajo original en lugar de iniciar y cobrar por uno nuevo.
Muchos agentes añaden su propia capa adicional: Codex, por ejemplo, pide tu permiso antes de cada llamada a una herramienta.
Bajo el capó: Las herramientas multimedia de MCP
Para los desarrolladores, estas son las herramientas multimedia que el agente llama entre bastidores:
| Herramienta | ¿Cobra créditos? | Qué hace |
|---|---|---|
| list_my_workspaces | No | Enumera los espacios de trabajo en el equipo conectado |
| list_media_models / get_media_model | No | Enumera los modelos y lee las opciones y límites de entrada de un modelo |
| create_media_upload | No | Crea un espacio de carga de una hora para un archivo de imagen, video o audio |
| estimate_image_generation / estimate_image_edit / estimate_video_generation | No | Valida una solicitud y devuelve un presupuesto |
| generate_image / generate_image_edit / generate_video | Sí | Envía el trabajo aprobado |
| get_generation_status / get_generation_result | No | Realiza un seguimiento del progreso y devuelve los archivos terminados y la facturación |
La sincronización labial y los avatares parlantes se ejecutan a través de generate_video. Reconoce el trabajo por sus entradas: un video más audio significa sincronización labial, y un retrato más audio significa un avatar. Las herramientas de audio como text_to_speech, speech_to_text, search_voices, create_voice_clone y las herramientas de Story Studio se encuentran en el mismo servidor.
Sin embargo, nunca tienes que llamar a ninguna de estas herramientas tú mismo. En la práctica, describes el resultado que deseas y el agente encadena las llamadas adecuadas.
Prompts de ejemplo por caso de uso
Aquí tienes algunos puntos de partida, agrupados por lo que estés creando:
| Caso de uso | Lo que dices | Lo que hace el agente |
|---|---|---|
| Activos de producto y apps | "Genera una imagen 1:1 de una taza de café de cerámica sobre una encimera de mármol con luz suave matinal. Dame algunas variaciones y muestra el precio primero". | Elige un modelo de imagen, presupuesta el lote, genera después de que confirmes |
| Activos de producto y apps | "Sube screenshot.png y reemplaza el fondo con un degradado limpio para nuestro listado de la tienda de aplicaciones. Presupuesta primero". | Sube tu archivo, presupuesta la edición, la aplica después de que confirmes |
| Video de marketing y redes sociales | "Haz un video 9:16 de cinco segundos de unas zapatillas chapoteando en un charco a cámara lenta. Presupuesta los créditos y luego genera". | Presupuesta un trabajo de texto a video y devuelve un enlace al video |
| Video de marketing y redes sociales | "Convierte la imagen que acabas de generar en un video corto con un suave zoom de acercamiento". | Reutiliza la imagen directamente como el fotograma inicial |
| Actualización y localización de video | "Traduce este guion al español, ponle voz con mi propio clon de voz y luego sincroniza los labios de demo.mp4 con el audio en español usando Sync LipSync v2 Pro. Presupuesta antes de generar". | Traduce el guion, genera el habla, sube el video y presupuesta el trabajo de sincronización labial |
| Presentadores y avatares | "Genera un retrato de una presentadora amable en un estudio luminoso, luego haz que lea release-notes.md como un video de avatar parlante 9:16 con Creatify Aurora Avatar". | Crea el retrato y el discurso, luego presupuesta el video del avatar |
| Cuenta | "¿Cuántos créditos de Fish Audio me quedan?" | Comprueba tu saldo |
En agentes de programación como Claude Code, Codex y Devin, estas herramientas trabajan junto a la terminal. El agente puede generar imágenes por lotes para cada producto en una carpeta, subir grabaciones locales o descargar archivos terminados en tu proyecto.
Planes, créditos y límites
Antes de probar esto, conviene saber cómo funcionan los créditos y qué plan necesita cada capacidad.
Qué créditos utiliza
La generación de medios a través de MCP utiliza tus créditos del plan web de Fish Audio, los mismos créditos que gastas en la aplicación web. No utiliza créditos de la API de desarrollador, que son un saldo separado para la API de Fish Audio. Ambos se adquieren en lugares diferentes, por lo que vale la pena saber cuál recargar.
Para añadir créditos web o cambiar de plan, ve a Equipo → Planes. Dado que cada conexión MCP está ligada al equipo que elegiste al iniciar sesión, las generaciones consumen créditos de ese equipo.
Qué plan necesitas
Lo que tu agente puede generar depende de tu plan. Los límites del plan se comprueban cuando el agente solicita un presupuesto, por lo que un trabajo que tu plan no cubra será señalado antes de que se te pida aprobación.
- La generación, edición y escalado de imágenes están disponibles en el plan gratuito, que incluye una asignación diaria de imágenes.
- Al generar imágenes a partir de texto, cada solicitud de texto a imagen puede pedir hasta 2 imágenes en el plan Free, 4 en Plus y 8 en Pro y Max. Las ediciones de imagen devuelven una imagen por solicitud.
- La generación de video, la sincronización labial y los avatares parlantes requieren un plan Plus de pago, Pro o Max.
- Los trabajos de video, sincronización labial y avatar devuelven un resultado por solicitud.
Si estás empezando con el plan Free, la generación de imágenes es la forma más fácil de probar el flujo de trabajo. Cuando estés listo para el video, la sincronización labial o los avatares parlantes, actualizar a un plan Plus de pago o superior los desbloqueará.
Precios
Cada modelo tiene un precio diferente, y el coste de un trabajo también depende de los ajustes que elijas, como la resolución, la duración o el número de imágenes. En lugar de confiar en una lista de precios, pídele a tu agente un presupuesto: es gratis y refleja el precio actual. Sin embargo, ten en cuenta que el texto a voz es la excepción: se factura por la longitud del texto y se cobra tan pronto como se ejecuta.
Dado que los presupuestos no cuestan nada, puedes comparar varios modelos o ajustes para la misma idea y elegir el que encaje con lo que quieres gastar antes de que se cobre el trabajo.
Cargas
Algunos trabajos comienzan con tus propios archivos: una imagen para editar o animar, un video para sincronizar los labios o audio para un avatar. El agente se encarga de la carga por ti, dentro de estos límites:
- Imágenes: JPEG, PNG o WebP, hasta 20 MB
- Video: MP4, MOV, WebM o MKV, hasta 1 GB
- Audio: MP3, WAV, M4A, AAC, OGG o FLAC, hasta 50 MB
Los modelos individuales pueden tener límites más estrictos. Por ejemplo, Creatify Aurora Avatar acepta de 1 a 60 segundos de audio. El agente lee los límites de cada modelo antes de presupuestar, y si un proveedor rechaza la entrada después del envío, el trabajo fallido se reembolsa. Los resultados que ya hayas generado en el mismo espacio de trabajo no necesitan ser cargados de nuevo; el agente los pasa directamente.
Tiempos
Las imágenes suelen terminarse en un minuto. Los videos, la sincronización labial y los avatares pueden tardar varios minutos. No necesitas estar comprobando constantemente: el agente sigue el progreso por su cuenta y devuelve un enlace tan pronto como el archivo está listo.
Reflexiones finales: Tu agente es ahora un estudio multimedia
Los agentes de IA ya pueden planificar un lanzamiento, redactar la página de aterrizaje y enviar el código. Hasta ahora, los visuales eran donde la mayoría se detenía: en el mejor de los casos, un único modelo de imagen integrado, mientras que el video, la sincronización labial y los avatares parlantes se delegaban a una persona y a una herramienta separada. Esta actualización cierra esa brecha. Un solo MCP de generación de imágenes le da a tu agente voz, imágenes, video, sincronización labial y avatares parlantes, sin claves API que gestionar y con un presupuesto antes de cada trabajo multimedia.
El cambio más profundo es cómo se conectan estas piezas. Un guion se convierte en una voz, la voz se convierte en un avatar parlante y una imagen se convierte en un video, con cada paso entregando su resultado al siguiente en lugar de mover archivos de un lado a otro entre aplicaciones. La voz es lo que hace que un video se sienta como si alguien te estuviera hablando realmente, y está en el núcleo de lo que construye Fish Audio. Ponerla en la misma conversación que las imágenes y el video significa que tu agente puede llevar una idea desde unas pocas líneas de texto hasta un clip terminado.
A medida que se añadan nuevos modelos, estos aparecerán en la lista de modelos en tiempo real de tu agente, sin nada que reconfigurar. La forma más fácil de ver lo que eso desbloquea es conectar el servidor y pedir algo para lo que normalmente abrirías tres herramientas diferentes.
¿Eres nuevo en Fish Audio? Regístrate gratis → Conecta el servidor MCP en menos de un minuto y comienza con la generación de imágenes, incluida en el plan gratuito.
¿Listo para video, sincronización labial y avatares? Ver planes → Plus y superiores desbloquean la generación de video, la sincronización labial y los avatares parlantes a través de MCP.
Preguntas Frecuentes
¿Puede Claude Code generar imágenes?
¿Existe un MCP de generación de video para Claude Code y Cursor?
¿Necesito una clave API para usar el servidor MCP de Fish Audio?
¿Utiliza mis créditos de API de desarrollador?
¿Puede el agente gastar créditos sin preguntarme?
¿Qué sucede si falla una generación?
¿Puedo usar audio generado con el texto a voz de Fish Audio para sincronización labial o avatares?
¿Qué agentes de IA funcionan con el servidor MCP de Fish Audio?
Sabrina is part of Fish Audio's support and marketing team, helping users get the most out of AI voice products while turning launches, updates, and customer insights into clear, practical content.
Leer más de Sabrina Shu