如何使用 Fish Creative 生成 AI 图像、视频和嘴型同步视频 - 完整教程
根据提示词生成图像,将其转化为视频,并让画面中的人物自然地开口说话。您可以在 Fish Creative 中完成这所有三个步骤。
Fish Creative 将您的 AI 创作工具整合到一个工作区中,包括图像生成、视频生成和嘴型同步(Lip Sync)。无需在工具之间下载和上传文件,即可重复使用已创作的内容。无论您是在制作虚拟主持人、产品演示、社交媒体视频,还是拥有独特声音的角色,都可以从同一个基础工作流开始。
本教程将引导您完成从开始到结束的全过程。
跟随本教程开始创建您自己的图像和视频。尝试 Fish Creative。
使用 Fish Creative 您可以做些什么?
登录 Fish Audio 并在左侧边栏选择 图像与视频 来打开 Fish Creative。本教程侧重于三个核心工具:
- 图像: 根据文本生成图像,或上传参考图来引导新的创作。您还可以使用 Topaz HD 来放大单个图像并恢复细节。
- 视频: 根据文本、图像、首尾帧、参考图、参考视频或包含音频的混合输入创建视频。
- 嘴型同步: 为图像或视频添加音频,使画面中的人物说话与音频同步。 您的作品会自动保存到素材库中。制作好图像后,您可以直接将其发送到视频生成。视频准备就绪后,再将其发送到嘴型同步。您可以全程留在同一个工作区内。
注册 Fish Audio 账户 开始使用 Fish Creative。新用户将获得免费额度,用于尝试图像生成、视频创建和嘴型同步。
1. 从构思到成品视频:完整工作流
在上面的完整教程中观看此部分:00:19–01:06。
在开始之前,您不需要学习每个模型和按钮。先了解一段内容是如何整合在一起的会很有帮助,然后再通过下文了解各部分的细节。
在本教程中,我们将制作一段由虚拟主持人出演的短视频。这是基本序列:
计划视频 → 创建角色图像 → 动画化图像 → 准备配音 → 添加嘴型同步
请遵循以下步骤:
- 登录 Fish Audio 并从左侧边栏打开 图像与视频。
- 确定视频的用途并选择长宽比。例如,对于社交媒体上的垂直口播视频,从 9:16 开始。
- 打开 图像 并编写提示词,描述角色、环境、构图、风格和光影。
- 选择模型和设置,生成图像,并挑选出一张主体定义明确、构图适合动态处理的图像。
- 点击 生成视频 将所选图像直接发送到视频工具。
- 编写提示词,描述角色的动作和表情、镜头运动以及节奏。
- 设置视频的长宽比、时长、分辨率和输出数量,然后生成视频。
- 检查面部、动作的连续性以及嘴部的可见性。选择一段适合嘴型同步的视频。
- 在 Fish Audio 中打开 文本转语音,输入脚本,并选择库中的声音或克隆的声音来生成音频。您也可以使用自己的录音。
- 将角色视频直接发送到 嘴型同步,然后从素材库中选择音频或上传音频文件。
- 设置长宽比、分辨率和输出数量,然后生成成品视频。
- 预览嘴型同步效果。从这里,您可以重新生成、延长、下载或将结果作为参考重复使用。
提示: 您可以根据项目调整此工作流。对于一段简单的对着镜头说话的视频,可以跳过视频生成,直接在嘴型同步中使用角色图像和音频。对于电影或电商广告,创建多个参考图像和视频镜头,然后将它们编辑成完整的作品。
接下来的章节将详细介绍图像生成、视频生成和嘴型同步,并提供获得与您的构思相匹配的一致结果的技巧。
2. 创建您的第一张 AI 图像
在上面的完整教程中观看此部分:01:07–01:43。
第 1 步:打开图像工具
打开 Fish Creative 并在页面顶部选择 图像。使用中心的提示词框描述您想要创建的内容。您还可以添加参考图来引导角色、产品、构图或视觉风格。
提示: 如果您已经有了想法,只需文本即可。您不需要先准备图像。
第 2 步:编写图像提示词
图像提示词告诉模型要创建什么。一个清晰的提示词通常涵盖:
- 主体: 图像中的人、产品或物体。
- 环境: 主体所在的位置。
- 构图: 特写、全身照、俯视、广角镜头或其他取景选择。
- 风格: 摄影、插画、3D、电影感视觉或其他视觉风格。
- 光影: 柔光、自然光、霓虹灯、黄金时刻或类似的方向。 我们将使用一位面向镜头的虚拟创作者,以便在进入视频和嘴型同步环节时更易于处理。
提示词示例:
A young tech content creator standing in a modern creative studio.
Medium close-up, facing the camera with a confident, friendly expression.
A clean, uncluttered background, soft cinematic lighting, and a photorealistic style.
Clear facial features and rich detail throughout the image.
提示: 如果您计划制作垂直短视频,请在提示词中指定垂直取景,并在设置中选择匹配的长宽比。
第 3 步:根据需要添加参考图
如果您已经心仪某个角色、产品或视觉风格,请上传参考图。参考图有助于模型理解您想要保留的特征、构图或风格。在创建具有相同角色的系列内容时,它们也非常有用。
选择具有以下特征的参考图:
- 主体清晰且分辨率良好。
- 面部或产品无遮挡。
- 取景与您最终想要的结果接近。
- 光影和色彩一致。
提示: 如果您不需要参考,请跳过此步骤。
第 4 步:选择模型和设置
Fish Creative 目前提供多种图像模型,包括:
- Nano Banana 2 Lite
- GPT Image 2
- Nano Banana 2
- Nano Banana Pro
- Seedream 5.0
- Seedream 4.5
提示: 模型阵容会随着时间的推移而更新,因此请查看 Fish Creative 以获取当前选择。
您还可以调整:
- 长宽比: 横向、纵向或正方形。
- 分辨率: 输出图像的尺寸。
- 质量: 结果的质量水平。
- 输出数量: 一次生成一张或多张图像。
提示: “生成”按钮会显示预估的额度消耗以及以当前设置您的余额还能支持多少次生成。在提交之前检查一下,并根据需要调整模型、质量或输出数量。
第 5 步:生成并选择图像
对提示词和设置感到满意后,点击 生成。预览结果并选择最适合您视频的图像。
对于每张生成的图像,您可以:
- 将其用作参考。
- 重新创建。
- 放大图像(Upscale)。
- 用于嘴型同步。
- 根据其生成视频。
- 公开分享生成记录。
- 下载。
提示: 如果主体看起来正确但您需要更大的图像或更多细节,请在继续下一步之前使用 Topaz HD 放大图像。
对后续用于视频或嘴型同步的图像建议
为后续步骤创建角色图像时:
| 推荐 | 避免 |
|---|---|
| 正面视角或轻微侧角,眼睛、鼻子和嘴巴清晰可见 | 手部、头发或其他物体靠近嘴部 |
| 提前为您的发布平台选择长宽比(短视频常用 9:16) | 背景杂乱或拥挤 |
清晰的主体和平衡良好的构图能为自然动作提供更好的起点。
3. 将静态图像转化为视频
在上面的完整教程中观看此部分:01:44–02:22。
第 1 步:打开视频工具
在页面顶部选择 视频。您可以仅凭文本提示词生成视频,也可以添加图像、视频或音频作为参考素材。
Fish Creative 支持多种生成视频的方式:
- 文本转视频。
- 图像转视频。
- 首尾帧转视频。
- 参考图转视频。
- 视频参考。
- 音频参考结合其他输入。 在本教程中,我们将使用图像转视频,从我们刚刚创建的角色图像开始。
第 2 步:添加您的图像或其他参考素材
直接从您的素材库中选择图像。无需下载再重新上传。根据模型和生成模式的不同,您可能还可以添加起始帧、结束帧、参考图、参考视频或参考音频。
每种参考都有不同的用途:
- 单张图像: 建立角色、环境和初始构图。
- 首尾帧: 定义视频如何开始和结束。
- 参考图: 帮助引导角色、物体或整体外观。
- 参考视频: 为动作、镜头运动或节奏提供引导。
- 参考音频: 为支持该功能的模型提供声音和定时提示。
第 3 步:编写视频提示词
图像提示词描述画面中的内容。视频提示词应侧重于场景如何移动和变化。有用的细节包括:
- 主体的动作。
- 表情或目光的变化。
- 镜头运动。
- 背景或环境的变化。
- 节奏和视觉风格。
提示词示例:
The person looks naturally into the camera, making small movements with their head and shoulders while maintaining a confident, friendly expression.
Movements are relaxed, smooth, and realistic.
The camera slowly pushes in, and the studio lighting stays consistent.
The video should feel natural and professional.
提示: 如果您计划添加嘴型同步,请从简单的、受控的动作开始。剧烈的头部转动、快速的镜头移动以及在脸前经过的物体都会使嘴型同步变得更加困难。
第 4 步:选择视频模型
Fish Creative 支持不断增加的视频模型。以下是一些可用选项:
- MiniMax H3
- Seedance 2.0
- Seedance 2.5
- Kling O3 Pro
- Seedance 2.0 Mini
- Kling 2.6 Pro
- Hailuo 2.3
- Veo 3.1
- Kling V3 Pro
- Seedance 2.0 Fast
- Seedance 1.5 Pro
提示: 随着时间的推移会添加更多模型,请查看 Fish Creative 以获取最新选择。模型可能支持不同的输入、时长和长宽比。先选择模型,然后再从其提供的设置中进行选择。
第 5 步:设置视频参数
根据模型的不同,您可以调整:
- 长宽比: 选项包括 21:9、16:9、4:3、1:1、3:4、9:16 和自适应。
- 时长: 支持的长度因模型而异,目前从约 4 秒到 30 秒不等。
- 分辨率: 选择适合预览或最终输出的分辨率。
- 输出数量: 一次生成一个或多个视频。
提示: “生成”按钮会显示预估的额度消耗以及您剩余余额可以支持生成的视频数量。
第 6 步:生成并回顾您的视频
点击 生成 并等待视频完成。预览时,请检查:
- 面部保持一致。
- 动作看起来自然且流畅。
- 没有明显的畸变。
- 镜头运动和节奏符合您的提示词。
- 在剪辑的大部分时间里嘴部清晰可见。 您可以将结果作为参考、重新创建、发送到嘴型同步、延长视频、公开分享生成记录或下载。如果您对视频满意,点击 用于嘴型同步 继续。
4. 通过嘴型同步让您的角色说话
在上面的完整教程中观看此部分:02:23–02:44。
Fish Creative 的嘴型同步工具适用于图像和视频。添加角色的图像或视频,将其与音频配对,即可生成一段嘴部动作与语音匹配的视频。
第 1 步:准备您的角色图像或视频
您可以:
- 从您的设备上传图像或视频。
- 从素材库中选择您已经创作的内容。
- 在图像或视频结果上点击 用于嘴型同步。
第 2 步:使用文本转语音准备音频
嘴型同步需要现有的音轨。您可以上传录音,或使用 Fish Audio 的 文本转语音 工具创建一个。
要在 Fish Audio 中创建音频:
- 打开 文本转语音。
- 输入或粘贴您想让角色说的话。
- 从 Fish Audio 声音库中选择声音,或使用您创建的克隆声音。
- 生成音频并将其保存到素材库。
- 返回 Fish Creative 并在嘴型同步中选择该音频。
提示: 您也可以下载生成的音频并将其上传到嘴型同步工具。
在本教程中,尝试一段简短的脚本:
Welcome to Fish Creative.
Start with a single image, turn it into a video, and make your character speak naturally.
提示: 对于您的第一次测试,请保持在一两句话以内。简短的音频剪辑更便于检查角色的外观、说话节奏和嘴型同步情况。
第 3 步:添加您的视觉效果和音频
返回 Fish Creative,选择 嘴型同步,并添加您的角色图像或视频。然后从素材库中选择音频或上传音频文件。
提示: 还有一个可选的提示词字段。如果您不需要额外指令,请将其留白。如果您想指定有关视觉效果的内容,请按照界面指导添加简短描述。
第 4 步:选择您的设置并生成
输入就绪后,设置:
- 长宽比。
- 分辨率。
- 输出数量。 检查您是否选择了正确的角色和音频,然后点击 生成。
从头到尾观看完成的视频并检查:
- 嘴部动作遵循语音的节奏。
- 面部保持一致。
- 开头和结尾感觉自然。
- 视频和音频完整。
- 角色的动作符合声音的语调。 您可以将结果作为参考、重新创建、再次应用嘴型同步、延长视频、公开分享生成记录或下载。
获得更好嘴型同步效果的建议
| 推荐 | 避免 |
|---|---|
| 正面角色或轻微侧角 | 头发、手部或物体靠近嘴部 |
| 语音清晰且背景噪音小,从自然语速的简短脚本开始 | 视频输入中出现突然的动作和快速的转头 |
提示: 如果结果不理想,请在添加大量详细说明之前尝试不同的图像、视频或音轨。
5. 三个可尝试的项目:口播视频、AI 电影和电商广告
在上面的完整教程中观看此部分:02:45–03:39。
这些项目使用相同的图像、视频和嘴型同步工具,但每个项目都需要略有不同的方法。口播视频依赖于一致的角色和良好的语音表达。AI 电影需要镜头之间的连续性。电商广告需要准确展示产品并快速传达卖点。
以下是如何为每个项目组合使用这些工具。
项目 1:AI 主持人视频
假设您正在制作一段 15 秒的垂直解说视频,关于如何为短视频编写更有力的开头。您需要一位主持人面对镜头,用自然的声音表达一段简短的脚本。
您将需要:
- 一张正面或轻微侧角面向镜头的角色图像。
- 一段阅读时间约为 15 秒的脚本。
- 来自 Fish Audio 库的声音、克隆的声音或您自己的录音。
- 9:16 输出设置。
建议工作流:
- 在 图像 工具中创建您的角色,使用人物面对镜头的特写。
- 对于动作极简的直接口播视频,直接将图像发送到 嘴型同步。
- 如果您希望在人开口说话之前有微妙的呼吸、点头或肩膀动作,请先生成一段动作受限的视频。
- 在 文本转语音 中生成脚本音频并保存到素材库。
- 将图像或视频以及音频添加到 嘴型同步,然后生成成品。
角色图像提示词:
A young content creator sitting in a clean, modern studio.
Medium close-up, facing the camera with a relaxed, confident, approachable expression.
Soft side lighting, a slightly blurred background, and a photorealistic style.
Vertical 9:16 composition.
脚本示例:
Do not start your short video by introducing yourself.
Tell viewers what they will get out of watching.
Give them a reason to stay in those first three seconds.
提示: 保持目光、表情、嘴部动作和声音的协同工作。角色不需要太多动作。稳定的表现有助于观众集中精力听内容。
项目 2:AI 短片
想象一个 20 到 30 秒的悬疑场景:一名侦探在雨夜进入一个废弃车站,并发现远处有一个神秘身影。将此计划为一系列短镜头,而不是一次性生成整个序列。
从三个镜头开始:
- 全景镜头: 雨夜中的废弃车站。镜头缓慢向入口移动。
- 动作镜头: 侦探从画面侧面进入车站,停下,抬头环视空间。
- 对白特写: 侦探说出关键台词的特写。
建议工作流:
- 使用 图像 工具为侦探创建一个角色参考,然后创建车站的图像。
- 使用 作为参考 将选定的角色和环境带入后续图像中,帮助保持镜头的一致性。
- 分别生成这三个镜头。对于全景镜头,使用文本转视频或参考图。对于动作镜头,尝试单张图像、首尾帧或视频参考。在对白特写中保持侦探面向前方或轻微侧角。
- 在 Fish Audio 中生成对白音频,然后仅在角色说话的特写镜头中应用嘴型同步。
- 下载这些镜头并在您常用的视频编辑器中进行组接:环境、动作,然后是对白。
角色参考提示词:
A detective in their early forties, wearing a long, dark trench coat.
Short hair, a tired but alert expression, and rain droplets on the collar.
Cinematic, photorealistic character reference with cool blue tones.
Clearly defined facial features in front and three-quarter views.
镜头 1 视频提示词:
An abandoned train station on a rainy night.
Puddles reflect dim lights as fine rain continues to fall.
A thin mist drifts slowly in the distance.
The camera moves smoothly from outside the station toward the entrance.
A suspenseful cinematic atmosphere with cool blue tones.
对白示例:
I know you have been waiting for me.
提示: AI 电影的一个常见问题是每个镜头单独看都很好,但在剪辑中角色、服装和地点不匹配。建立角色参考并一次生成一个镜头,比反复从头开始描述同一个角色更容易保持一致性。
项目 3:电商产品广告
假设您正在制作一段 15 秒的垂直面部精华液广告。观众需要清晰地看到瓶子和质地,同时主持人简要说明主要功效。
计划四个镜头:
- 0–3 秒: 瓶子特写,让观众立即识别产品。
- 3–7 秒: 一个人拿起产品,展示使用情况。
- 7–11 秒: 精华液质地特写或产品细节。
- 11–15 秒: 主持人面对镜头说话,随后是展示产品和品牌的结束画面。
建议工作流:
- 上传一张清晰的产品照片作为其外观参考。
- 在 图像 工具中,创建产品静物图、某人拿着产品的图像以及质地特写。获得满意的结果后,使用 作为参考 以相同风格创建更多资产。
- 将静物和使用图像转化为短视频。保持产品镜头简单:缓慢推进、旋转或光影变化。复杂的动作可能会使瓶子或包装上的文本扭曲。
- 为主持人准备一张单独的正面图像或稳定的视频,并在 Fish Audio 中为产品信息生成音频。
- 使用 嘴型同步 创建主持人片段,然后下载片段,将其编辑在一起,并添加字幕和修饰。
产品图像提示词:
A premium facial serum in a clear glass bottle on a pale stone countertop.
The front of the bottle faces the camera.
Soft morning light falls from behind and to one side, with a few water droplets and clean reflections around the product.
High-end skincare advertising photography, a clearly defined product silhouette, and space for copy.
Vertical 9:16 composition.
产品视频提示词:
The camera slowly moves toward the serum bottle as water droplets slide gently down the glass.
The background lighting shifts softly.
The product remains steady and clearly defined, with restrained movement and the look of a high-end skincare ad.
脚本示例:
Lightweight, fast-absorbing hydration in one step.
Use it morning and night for a simpler skincare routine.
提示: 产品识别在电商内容中最为重要。使用清晰的参考图,并给产品在画面中留出足够的空间。如果包装文字、标志或瓶身形状必须完全准确,请在发布前逐帧检查视频,并在后期制作中使用实际的产品资产纠正任何差异。
6. 实用按钮及其使用场景
在上面的完整教程中观看此部分:03:40–04:32。
Fish Creative 不仅仅只有“生成”按钮。每个结果下方的按钮让您可以将图像或视频发送到下一个工具,或继续完善您喜欢的版本。以下是您最常用的按钮。
提示词优化:为初步想法添加细节
如果您的提示词很简短,例如“咖啡馆里的人”或“产品广告视频”,提示词优化可以帮助您扩展它。它会增加有关主体、环境、构图、光影、动作或镜头运动的细节。
分三步使用:
- 写下必须保持不变的关键点,例如角色的身份、产品名称、要求的动作和长宽比。
- 使用提示词优化添加视觉细节。
- 在生成前阅读修改后的提示词。删除任何不需要的内容,并确保角色、产品和动作仍符合您的初衷。
提示: 当您知道自己想要什么但不知道如何描述时,提示词优化非常有用。将结果视为在生成前供审核的草案。
重新创建:尝试另一个版本
当结果接近但表情、构图、动作或镜头运动需要调整时,使用 重新创建。它让您在现有生成的基础上进行创作,而无需从空白页重新设置任务。
在重新创建之前,理清需要改变的地方:
- 主体或环境不对: 修改提示词中的核心描述。
- 构图需要调整: 指定取景、相机位置和主体摆放。
- 动作太大: 要求减少动作,并使用“细微的”、“缓慢的”和“稳定的”等词汇。
- 您只是想要另一个变体: 保持主要设置并再次生成。
提示: 重新创建最适合对您已经满意的构想进行细微调整。
作为参考:在您喜欢的结果基础上构建
点击 作为参考 将当前的图像或视频添加到新的生成任务中。使用它来沿用您已经确定的角色、产品、环境、视觉风格或动作。
常见用途包括:
- 将同一个角色放在不同的环境中。
- 为同一个产品创建多个广告素材。
- 使用现有的镜头或动作为后续视频提供引导。
- 从一个成功的成果中构建一个系列。
提示: 参考起引导作用,而不仅仅是复制原作。您的提示词仍需说明哪些部分应保持不变,哪些部分应改变。例如:“保持角色的面部和服装一致,将背景改为夜间的街道。”
图像放大:使用 Topaz HD 恢复细节
当您对主体和构图满意但需要更高的分辨率或更精细的细节时,使用图像放大。Fish Creative 使用 Topaz HD 放大单个图像并恢复细节。
提示: 这在下载最终图像、创建封面图或进入视频生成之前非常有用。如果角色的结构或产品的形状已经有误,放大通常无法修复它。应先重新创建图像或修改提示词。
生成视频:为您喜欢的图像制作动画
图像下方的 生成视频 按钮将该结果直接发送到视频工具,省去了下载和上传的麻烦。
提示: 到达视频工具后,请将提示词重点放在动作、镜头运动和随时间发生的变化上。您不需要对静态图像进行冗长的重复描述。尝试:“人物略微抬头,镜头慢慢靠近,背景光线逐渐变亮。”
用于嘴型同步:给您的角色一个声音
您可以在图像和视频结果上选择 用于嘴型同步。使用图像时,该工具会根据图像和音频创建一段说话视频。使用视频时,它会将嘴部动作与音频同步,同时配合现有的动作。
提示: 直接从图像进行嘴型同步非常适合稳定的口播视频。从视频开始则适用于您希望有呼吸、点头或身体动作的情况。无论哪种情况,都要确保面部清晰且嘴部无遮挡。
延长视频:继续现有的剪辑
当您喜欢一段剪辑的动作、镜头运动和风格但需要它运行得更久时,使用 延长视频。延长功能让您可以继续现有的场景和动作。
提示: 在延长之前检查最后一帧。畸变的角色、快速的动作或即将离开画面的主体可能会在后续部分引起问题。以稳定、清晰的帧结束的剪辑通常更容易平滑延长。
素材库和历史记录:查找并重新使用您的作品
您的作品会自动保存到素材库和生成历史记录中。从那里,您可以找到之前的图像、视频和音频,并直接将它们添加到新任务中。
提示: 保留几个关键版本:您的原始参考图、第一个可用的结果、最终的高质量输出,以及用于嘴型同步的稳定视频。这样可以更轻松地修改某个阶段,而无需重新开始整个过程。
公开分享与下载:检查最终结果
下载将结果保存到您的设备,以便您可以对其进行编辑、在设计中使用或发布。公开分享生成记录让其他人看到您创作的内容。请仅在准备好公开内容时才使用该选项。
提示: 在下载之前,检查长宽比、分辨率、角色和产品细节以及嘴型同步。决定视频是否仍需在后期制作中添加字幕或品牌标识。
额度消耗与剩余生成数:在生成前检查
“生成”按钮显示当前设置下的预估额度消耗,以及您的余额能支持多少次生成。当您更改分辨率、时长或输出数量时,请在提交前检查估算值的变化。
提示: 这有助于您计划测试运行和最终输出。先使用初次生成来确定构图和动作,一旦对方向满意,再选择最终设置。
开始使用 Fish Creative 进行创作
Fish Creative 将您的创意工具整合到一个工作区。在本教程中,您使用了图像生成、视频生成和嘴型同步,从一个简单的提示词发展到使用 Fish Audio 声音说话的角色。
您的第一个项目可以很简单:一个取景清晰的角色、一点点动作以及一两句话。一旦您熟悉了这个过程,就可以尝试参考图、首尾帧、视频参考或更大胆的镜头语言。
开始使用 Fish Creative 创作您自己的作品 →","faq":[{"question":"我可以仅通过文本生成图像和视频吗?","answer":"是的。图像工具接受文本提示词,视频工具支持文本转视频。您还可以添加图像、视频或音频参考以获得更多控制。"},{"question":"我可以将静态图像用于嘴型同步吗?","answer":"是的。嘴型同步工具接受图像和视频。如果您希望成品中有更多肢体动作,可以先将图像转化为视频,然后再应用嘴型同步。"},{"question":"所有模型都有相同的设置吗?","answer":"不是。支持的输入、长宽比、时长和分辨率因模型而异。请在选择模型后查看显示的选项。"},{"question":"我需要手动保存生成的结果吗?","answer":"您的结果会自动保存到素材库中,您可以在不同工具之间重复使用。您也可以将它们下载到您的设备。"}]}```