2026年9月11日ガイド

Fish Creative で AI 画像、動画、リップシンク動画を生成する方法 - 完全チュートリアル

Fish Creative で AI 画像、動画、リップシンク動画を生成する方法 - 完全チュートリアル

プロンプトから画像を生成し、それを動画に変え、画面上の人物を自然に話させる。Fish Creative なら、これらすべてを行うことができます。

Fish Creative は、画像生成、動画生成、リップシンクなど、AI クリエイティブツールを一つのワークスペースに集約します。ツール間でファイルをダウンロードしたりアップロードしたりすることなく、作成したものを再利用できます。バーチャルプレゼンター、製品デモ、ソーシャルメディア動画、あるいは独自の声を持つキャラクターを作成する場合でも、同じ基本的なワークフローから始めることができます。

このチュートリアルでは、最初から最後までそのプロセスを説明します。

チュートリアルに沿って、独自の画像や動画の作成を始めましょう。Fish Creative を試す


Fish Creative で何ができる?

Fish Audio にサインインし、左側のサイドバーで Image & Video を選択して Fish Creative を開きます。このチュートリアルでは、3 つの主要ツールに焦点を当てます:

  • Image: テキストから画像を生成したり、参照画像をアップロードして新しい作成のガイドにしたりできます。また、Topaz HD を使用して個別の画像をアップスケールし、詳細を復元することもできます。
  • Video: テキスト、画像、最初と最後のフレーム、参照画像、参照動画、またはオーディオを含む入力の組み合わせから動画を作成します。
  • Lip Sync: 画像や動画にオーディオを追加して、画面上の人物がそれに合わせて同期して話すようにします。 作成したものはアセットライブラリに自動的に保存されます。画像を作成したら、それを直接動画生成に送ることができます。動画の準備ができたら、それを Lip Sync に送ります。プロセス全体を通して同じワークスペースにとどまることができます。

Fish Audio アカウントに登録 して Fish Creative の利用を開始しましょう。新規ユーザーには、画像生成、動画作成、リップシンクを試すための無料クレジットが付与されます。


1. アイデアから完成した動画まで:フルワークフロー

上記のフルチュートリアルのこのセクションを見る:00:19–01:06

始める前に、すべてのモデルやボタンを習得する必要はありません。まずコンテンツがどのように構成されるかを確認し、それから以下のセクションで詳細を確認するのが役立ちます。

このチュートリアルでは、バーチャルプレゼンターが登場する短い動画を作成します。基本的な手順は以下の通りです:

動画の計画 → キャラクター画像の作成 → 画像のアニメーション化 → 音声の準備 → リップシンクの追加

以下のステップに従ってください:

  1. Fish Audio にサインインし、左側のサイドバーから Image & Video を開きます。
  2. 動画がどこで使用されるかを決め、アスペクト比を選択します。例えば、ソーシャルメディア用の縦型解説動画の場合は、9:16 から始めます。
  3. Image を開き、キャラクター、設定、構図、スタイル、ライティングを説明するプロンプトを書きます。
  4. モデルと設定を選択し、画像を生成して、被写体がはっきりしており、動きの中でもうまく機能する構図のものを選びます。
  5. Generate Video をクリックして、選択した画像を直接動画ツールに送ります。
  6. キャラクターの動きや表情、カメラワーク、ペースを説明するプロンプトを書きます。
  7. 動画のアスペクト比、時間、解像度、出力数を設定し、生成します。
  8. 顔、動きの連続性、口の見え方を確認します。リップシンクに適した動画を選びます。
  9. Fish Audio の Text to Speech を開き、スクリプトを入力し、ライブラリの音声またはクローン音声を選択してオーディオを生成します。自分の録音を使用することもできます。
  10. キャラクター動画を直接 Lip Sync に送り、アセットライブラリからオーディオを選択するか、オーディオファイルをアップロードします。
  11. アスペクト比、解像度、出力数を設定し、完成した動画を生成します。
  12. リップシンクをプレビューします。そこから、再生成、延長、ダウンロード、または結果を参照として再利用することができます。

ヒント: このワークフローはプロジェクトに合わせて調整できます。カメラに向かって話す人の簡単な動画なら、動画生成をスキップして、キャラクター画像とオーディオを Lip Sync で使用します。映画や EC 広告の場合は、複数の参照画像と動画カットを作成し、それらを編集して一つの作品に仕上げます。

次のセクションでは、画像生成、動画生成、リップシンクについて詳しく説明し、アイデアに一致した一貫した結果を得るためのヒントを紹介します。


2. 初めての AI 画像を作成する

上記のフルチュートリアルのこのセクションを見る:01:07–01:43

ステップ 1:Image ツールを開く

Fish Creative を開き、ページ上部の Image を選択します。中央のプロンプトボックスを使用して、作成したい内容を説明します。キャラクター、製品、構図、またはビジュアルスタイルをガイドするための参照画像を追加することもできます。

ヒント: アイデアから始める場合、テキストだけで十分です。事前に画像を用意する必要はありません。

ステップ 2:画像プロンプトを書く

画像プロンプトは、モデルに何を生成すべきかを伝えます。明確なプロンプトは通常、以下をカバーします:

  • 被写体 (Subject): 画像内の人物、製品、または物体。
  • 設定 (Setting): 被写体がどこにいるか。
  • 構図 (Composition): クローズアップ、全身ショット、俯瞰、広角、またはその他のフレーミングの選択。
  • スタイル (Style): 写真、イラスト、3D、シネマティックな外観、またはその他のビジュアルスタイル。
  • ライティング (Lighting): ソフトライト、自然光、ネオン、ゴールデンアワー、または同様の方向性。 動画やリップシンクに進んだときに扱いやすいよう、カメラを向いたバーチャルクリエイターを使用します。

プロンプト例:

A young tech content creator standing in a modern creative studio.
Medium close-up, facing the camera with a confident, friendly expression.
A clean, uncluttered background, soft cinematic lighting, and a photorealistic style.
Clear facial features and rich detail throughout the image.

ヒント: 縦型のショート動画を計画している場合は、プロンプトで縦型のフレーミングを指定し、設定で一致するアスペクト比を選択してください。

ステップ 3:必要に応じて参照画像を追加する

すでにキャラクター、製品、またはビジュアルスタイルのイメージがある場合は、参照画像をアップロードします。参照画像は、モデルがどの特徴、構図、またはスタイルを維持すべきかを理解するのに役立ちます。これらは、同じキャラクターが登場するシリーズを作成する場合にも便利です。

以下の特徴を持つ参照画像を選んでください:

  • 被写体が明確で解像度が良いもの。
  • 顔や製品が遮られていないもの。
  • 最終的な結果に近いフレーミングのもの。
  • ライティングと色が一定しているもの。

ヒント: 参照が必要ない場合は、このステップをスキップしてください。

ステップ 4:モデルと設定を選択する

Fish Creative は現在、以下を含むいくつかの画像モデルを提供しています:

  • Nano Banana 2 Lite
  • GPT Image 2
  • Nano Banana 2
  • Nano Banana Pro
  • Seedream 5.0
  • Seedream 4.5

ヒント: モデルのラインナップは時間の経過とともに更新されるため、最新の選択肢については Fish Creative を確認してください。

また、以下を調整できます:

  • アスペクト比: 横長、縦長、または正方形。
  • 解像度: 出力画像の寸法。
  • 品質: 結果の品質レベル。
  • 出力数: 1 枚の画像を生成するか、一度に複数生成するか。

ヒント: Generate ボタンには、推定クレジットコストと、現在の設定で残高から何枚の画像を生成できるかが表示されます。送信前に確認し、必要に応じてモデル、品質、または出力数を調整してください。

ステップ 5:生成して画像を選択する

プロンプトと設定に満足したら、Generate をクリックします。結果をプレビューし、動画に最も適した画像を選択します。

生成された各画像について、以下のことが可能です:

  • 参照として使用する。
  • 再生成する。
  • アップスケールする。
  • リップシンクに使用する。
  • そこから動画を生成する。
  • 生成記録を公開共有する。
  • ダウンロードする。

ヒント: 被写体は良いが、より大きな画像や詳細が必要な場合は、次に進む前に Topaz HD を使用して画像をアップスケールしてください。

動画やリップシンクで使用する画像への提案

次のステップのためにキャラクター画像を作成する際:

推奨避けるべきこと
正面を向いている、またはわずかに角度がついた状態で、目、鼻、口がはっきりと見えるもの口の近くに手、髪、または他の物体があるもの
投稿プラットフォームに合わせて事前に選ばれたアスペクト比(ショート動画では 9:16 が一般的)忙しい、または混雑した背景

明確な被写体とバランスの取れた構図は、自然な動きを作るためのより良い出発点となります。


3. 静止画を動画に変える

上記のフルチュートリアルのこのセクションを見る:01:44–02:22

ステップ 1:Video ツールを開く

ページ上部の Video を選択します。テキストプロンプトのみから動画を生成することも、参照資料として画像、動画、またはオーディオを追加することもできます。

Fish Creative は、動画を生成するためのいくつかの方法をサポートしています:

  • Text to Video
  • Image to Video
  • 最初と最後のフレームから動画生成
  • 参照画像から動画生成
  • 動画リファレンス
  • 他の入力と組み合わせたオーディオリファレンス このチュートリアルでは、作成したキャラクター画像から始める Image to Video を使用します。

ステップ 2:画像または他の参照資料を追加する

アセットライブラリから直接画像を選択します。ダウンロードして再度アップロードする必要はありません。モデルや生成モードによっては、最初のフレーム、最後のフレーム、参照画像、参照動画、または参照オーディオを追加できる場合もあります。

各タイプの参照には異なる目的があります:

  • 単一画像: キャラクター、設定、開始時の構図を確立します。
  • 最初と最後のフレーム: 動画の始まりと終わりを定義します。
  • 参照画像: キャラクター、物体、または全体的な外観をガイドするのに役立ちます。
  • 参照動画: アクション、カメラワーク、またはペースのガイドを提供します。
  • 参照オーディオ: それをサポートするモデルに対して、音とタイミングのヒントを提供します。

ステップ 3:動画プロンプトを書く

画像プロンプトはフレーム内にあるものを説明しますが、動画プロンプトはシーンがどのように動き、変化するかに焦点を当てるべきです。有用な詳細には以下が含まれます:

  • 被写体のアクション。
  • 表情や視線の変化。
  • カメラワーク。
  • 背景や環境の変化。
  • ペースとビジュアルスタイル。

プロンプト例:

The person looks naturally into the camera, making small movements with their head and shoulders while maintaining a confident, friendly expression.
Movements are relaxed, smooth, and realistic.
The camera slowly pushes in, and the studio lighting stays consistent.
The video should feel natural and professional.

ヒント: リップシンクを追加する予定がある場合は、シンプルでコントロールされた動きから始めてください。急な頭の回転、速いカメラの動き、顔の前を横切る物体などは、リップシンクを難しくする可能性があります。

ステップ 4:動画モデルを選択する

Fish Creative は、増え続ける動画モデルをサポートしています。利用可能なオプションの一部を以下に示します:

  • MiniMax H3
  • Seedance 2.0
  • Seedance 2.5
  • Kling O3 Pro
  • Seedance 2.0 Mini
  • Kling 2.6 Pro
  • Hailuo 2.3
  • Veo 3.1
  • Kling V3 Pro
  • Seedance 2.0 Fast
  • Seedance 1.5 Pro

ヒント: 今後さらに多くのモデルが追加される予定ですので、最新の選択肢については Fish Creative を確認してください。モデルによって、サポートされる入力、時間、アスペクト比が異なる場合があります。まずモデルを選択してから、それが提供する設定から選択してください。

ステップ 5:動画パラメータを設定する

モデルに応じて、以下を調整できます:

  • アスペクト比: 21:9、16:9、4:3、1:1、3:4、9:16、Adaptive などのオプションがあります。
  • 時間 (Duration): サポートされる長さはモデルによって異なり、現在は約 4 秒から 30 秒の範囲です。
  • 解像度: プレビュー用または最終出力用に適した解像度を選択します。
  • 出力数: 1 つの動画を生成するか、一度に複数生成するか。

ヒント: Generate ボタンには、推定クレジットコストと、それらの設定で残高から何本の動画を生成できるかが表示されます。

ステップ 6:生成して動画を確認する

Generate をクリックし、動画が完成するのを待ちます。プレビューする際は、以下を確認してください:

  • 顔が一貫しているか。
  • 動きが自然でスムーズか。
  • 明らかな歪みがないか。
  • カメラワークとペースがプロンプトと一致しているか。
  • クリップの大部分で口がはっきりと見えているか。 結果を参照として使用したり、再生成したり、Lip Sync に送ったり、延長したり、生成記録を公開共有したり、ダウンロードしたりできます。動画に満足したら、Use for Lip Sync をクリックして続行します。

4. リップシンクでキャラクターを話させる

上記のフルチュートリアルのこのセクションを見る:02:23–02:44

Fish Creative の Lip Sync ツールは、画像と動画の両方で機能します。キャラクターの画像または動画を追加し、オーディオとペアリングして、音声に合わせた口の動きを持つ動画を生成します。

ステップ 1:キャラクターの画像または動画を準備する

以下のことが可能です:

  • デバイスから画像または動画をアップロードする。
  • アセットライブラリから作成済みのものを選択する。
  • 画像または動画の結果で Use for Lip Sync をクリックする。

ステップ 2:Text to Speech でオーディオを準備する

リップシンクには既存のオーディオトラックが必要です。録音をアップロードするか、Fish Audio の Text to Speech ツールで作成できます。

Fish Audio でオーディオを作成するには:

  1. Text to Speech を開きます。
  2. キャラクターに話させたい台詞を入力または貼り付けます。
  3. Fish Audio の音声ライブラリから音声を選択するか、作成したクローン音声を使用します。
  4. オーディオを生成し、アセットライブラリに保存します。
  5. Fish Creative に戻り、Lip Sync でそのオーディオを選択します。

ヒント: 生成されたオーディオをダウンロードして、ファイルを Lip Sync にアップロードすることもできます。

このチュートリアルでは、短いスクリプトを試してみましょう:

Welcome to Fish Creative.
Start with a single image, turn it into a video, and make your character speak naturally.

ヒント: 最初のテストでは、1〜2 文程度に抑えてください。短いオーディオクリップの方が、キャラクターの外見、話すペース、リップシンクの確認が容易になります。

ステップ 3:ビジュアルとオーディオを追加する

Fish Creative に戻り、Lip Sync を選択して、キャラクターの画像または動画を追加します。次に、アセットライブラリからオーディオを選択するか、オーディオファイルをアップロードします。

ヒント: オプションのプロンプトフィールドもあります。追加の指示が必要ない場合は空白のままにしておきます。ビジュアルについて何か指定したい場合は、インターフェースのガイダンスに従って短い説明を追加してください。

ステップ 4:設定を選択して生成する

入力が完了したら、以下を設定します:

  • アスペクト比。
  • 解像度。
  • 出力数。 正しいキャラクターとオーディオが選択されていることを確認し、Generate をクリックします。

完成した動画を最初から最後まで視聴し、以下を確認します:

  • 口の動きが音声のタイミングに従っているか。
  • 顔が一貫しているか。
  • 始まりと終わりが自然か。
  • 動画とオーディオが完全か。
  • キャラクターの動きが声のトーンに合っているか。 結果を参照として使用したり、再生成したり、再度リップシンクを適用したり、動画を延長したり、生成記録を公開共有したり、ダウンロードしたりできます。

より良いリップシンクのための提案

推奨避けるべきこと
正面を向いているキャラクター、またはわずかに角度がついたもの口の近くの髪、手、または物体
背景ノイズが少なく、自然な話すペースの短いスクリプトから始めたクリアな音声動画入力における突然の動きや速い頭の回転

ヒント: 結果がうまくいかない場合は、詳細な指示をたくさん追加する前に、別の画像、動画、またはオーディオトラックを試してみてください。


5. 試してみるべき 3 つのプロジェクト:解説動画、AI 映画、EC 広告

上記のフルチュートリアルのこのセクションを見る:02:45–03:39

これらのプロジェクトでは同じ画像、動画、リップシンクツールを使用しますが、それぞれ少し異なるアプローチが必要です。解説動画(Talking-head)は一貫したキャラクターと優れた音声デリバリーに依存します。AI 映画はカット間の一貫性が必要です。EC 広告は製品を正確に見せ、そのセールスポイントを素早く伝える必要があります。

それぞれのツールの組み合わせ方は以下の通りです。

プロジェクト 1:AI プレゼンター動画

ショート動画のより強力なオープニングの書き方についての 15 秒の縦型解説動画を作成するとします。一人のプレゼンターがカメラに向かって、自然な声で短いスクリプトを話すようにしたい場合。

必要なもの:

  • 正面またはわずかに角度がついたキャラクター画像。
  • 読むのに約 15 秒かかるスクリプト。
  • Fish Audio ライブラリの音声、クローン音声、または自分の録音。
  • 9:16 の出力設定。

推奨ワークフロー:

  1. Image で、人物がカメラを向いたミディアムクローズアップを使用してキャラクターを作成します。
  2. 動きを最小限に抑えたシンプルな解説動画の場合は、画像を直接 Lip Sync に送ります。
  3. 人が話し始める前に、微妙な呼吸、うなずき、または肩の動きを入れたい場合は、まず控えめな動きの動画を生成します。
  4. Text to Speech でスクリプトオーディオを生成し、アセットライブラリに保存します。
  5. 画像または動画とオーディオを Lip Sync に追加し、完成品を生成します。

キャラクター画像プロンプト:

A young content creator sitting in a clean, modern studio.
Medium close-up, facing the camera with a relaxed, confident, approachable expression.
Soft side lighting, a slightly blurred background, and a photorealistic style.
Vertical 9:16 composition.

サンプルスクリプト:

Do not start your short video by introducing yourself.
Tell viewers what they will get out of watching.
Give them a reason to stay in those first three seconds.

ヒント: 視線、表情、口の動き、声を連動させ続けます。キャラクターはあまり動く必要はありません。安定した存在感は、視聴者が話されている内容に集中するのを助けます。

プロジェクト 2:AI 短編映画

20〜30 秒のサスペンスシーンを想像してください:雨の夜、刑事が廃駅に入り、遠くに謎の人物を見つけます。これを一度に生成するのではなく、一連の短いショットとして計画します。

3 つのショットから始めます:

  1. エスタブリッシング・ショット: 雨の夜の廃駅。カメラはゆっくりと入り口に向かって移動します。
  2. アクション・ショット: 刑事がフレームの端から駅に入り、立ち止まって周囲を見渡します。
  3. 台詞のクローズアップ: 重要な台詞を言う刑事のクローズアップ。

推奨ワークフロー:

  1. Image を使用して刑事のキャラクターリファレンスを作成し、次に駅の画像を作成します。
  2. As Reference を使用して、選択したキャラクターと設定を後の画像に引き継ぎ、ショットの一貫性を保ちます。
  3. 3 つのショットを個別に生成します。エスタブリッシング・ショットには Text to Video または参照画像を使用します。アクション・ショットには、単一画像、最初と最後のフレーム、または動画リファレンスを試してください。台詞のクローズアップでは、刑事が正面またはわずかに角度をつけた状態を維持します。
  4. Fish Audio で台詞オーディオを生成し、キャラクターが話すクローズアップにのみリップシンクを適用します。
  5. ショットをダウンロードし、通常の動画エディタで組み立てます:設定、アクション、そして台詞。

キャラクターリファレンスプロンプト:

A detective in their early forties, wearing a long, dark trench coat.
Short hair, a tired but alert expression, and rain droplets on the collar.
Cinematic, photorealistic character reference with cool blue tones.
Clearly defined facial features in front and three-quarter views.

ショット 1 の動画プロンプト:

An abandoned train station on a rainy night.
Puddles reflect dim lights as fine rain continues to fall.
A thin mist drifts slowly in the distance.
The camera moves smoothly from outside the station toward the entrance.
A suspenseful cinematic atmosphere with cool blue tones.

サンプル台詞:

I know you have been waiting for me.

ヒント: AI 映画でよくある問題は、個々のショットは良く見えても、キャラクター、服装、場所がカット間で一致しないことです。キャラクターリファレンスを確立し、一度に 1 ショットずつ生成することで、同じキャラクターを一から繰り返し説明するよりも一貫性を保ちやすくなります。

プロジェクト 3:EC 製品広告

フェイシャルセラムの 15 秒の縦型広告を作成するとします。視聴者はボトルとテクスチャをはっきりと見る必要があり、プレゼンターが主な利点を簡単に説明します。

4 つのショットを計画します:

  • 0〜3 秒: 視聴者がすぐに製品を認識できるよう、ボトルのクローズアップ。
  • 3〜7 秒: 人が製品を手に取り、使用している様子を見せる。
  • 7〜11 秒: セラムのテクスチャまたは製品の詳細のクローズアップ。
  • 11〜15 秒: プレゼンターがカメラに向かって話し、最後に製品とブランドが登場するクロージングフレーム。

推奨ワークフロー:

  1. 製品の外観の参照として、鮮明な製品写真をアップロードします。
  2. Image で、製品の静物画、誰かが製品を持っている画像、テクスチャのクローズアップを作成します。気に入った結果が得られたら、As Reference を使用して同じスタイルでより多くのアセットを作成します。
  3. 静物画と使用中の画像を短い動画に変えます。製品ショットは、ゆっくりとしたプッシュイン、回転、またはライティングの変化など、シンプルに保ちます。複雑な動きは、ボトルやパッケージのテキストを歪ませる可能性があります。
  4. プレゼンター用に別の正面画像または安定した動画を用意し、Fish Audio で製品メッセージのオーディオを生成します。
  5. Lip Sync を使用してプレゼンターセグメントを作成し、クリップをダウンロードして編集し、キャプションや仕上げを追加します。

製品画像プロンプト:

A premium facial serum in a clear glass bottle on a pale stone countertop.
The front of the bottle faces the camera.
Soft morning light falls from behind and to one side, with a few water droplets and clean reflections around the product.
High-end skincare advertising photography, a clearly defined product silhouette, and space for copy.
Vertical 9:16 composition.

製品動画プロンプト:

The camera slowly moves toward the serum bottle as water droplets slide gently down the glass.
The background lighting shifts softly.
The product remains steady and clearly defined, with restrained movement and the look of a high-end skincare ad.

サンプルスクリプト:

Lightweight, fast-absorbing hydration in one step.
Use it morning and night for a simpler skincare routine.

ヒント: EC コンテンツでは製品認識が最も重要です。明確な参照画像を使用し、フレーム内で製品に十分なスペースを与えてください。パッケージのテキスト、ロゴ、またはボトルの形状を正確にする必要がある場合は、公開前に動画をフレームごとに検査し、ポストプロダクションで実際の製品アセットを使用して不一致を修正してください。


6. 便利なボタンとその使用タイミング

上記のフルチュートリアルのこのセクションを見る:03:40–04:32

Fish Creative には、最初の Generate をクリックする以上の機能があります。各結果の下にあるボタンを使用すると、画像や動画を次のツールに送ったり、気に入ったバージョンをさらに洗練させたりできます。ここでは、最も頻繁に使用するものを紹介します。

Prompt Optimization(プロンプトの最適化):初期のアイデアに詳細を追加する

プロンプトが「カフェにいる人」や「製品広告動画」のように簡潔な場合、プロンプトの最適化を使用して拡張できます。被写体、設定、構図、ライティング、アクション、またはカメラワークに関する詳細が追加されます。

3 つのステップで使用します:

  1. キャラクターのアイデンティティ、製品名、必要なアクション、アスペクト比など、変えてはいけない必須事項を書き留めます。
  2. プロンプトの最適化を使用してビジュアルの詳細を追加します。
  3. 生成する前に修正されたプロンプトを読みます。不要なものを削除し、キャラクター、製品、アクションが元のアイデアと一致していることを確認します。

ヒント: プロンプトの最適化は、やりたいことはわかっているが、それをどう説明すればよいかわからない場合に役立ちます。結果は生成前のドラフトとして確認してください。

Recreate(再生成):別のバージョンを試す

結果は近いが、表情、構図、アクション、またはカメラワークを修正したい場合に Recreate を使用します。白紙からやり直すことなく、既存の生成物をベースに構築できます。

再生成する前に、何を変える必要があるかを明確にします:

  • 被写体や設定が違う: プロンプトの核心部分の説明を修正します。
  • 構図を直したい: フレーミング、カメラ位置、被写体の配置を指定します。
  • 動きが多すぎる: アクションを減らすように頼み、「subtle(微妙な)」、「slow(ゆっくり)」、「steady(安定した)」などの言葉を使用します。
  • 単に別のバリエーションが欲しい: 主要な設定はそのままに、もう一度生成します。

ヒント: Recreate は、すでに満足しているアイデアへの小さな調整に最適です。

As Reference(参照として使用):気に入った結果をベースにする

As Reference をクリックして、現在の画像または動画を新しい生成タスクに追加します。すでに確立したキャラクター、製品、設定、ビジュアルスタイル、または動きを次に引き継ぐために使用します。

一般的な用途は以下の通りです:

  • 同じキャラクターを異なる設定に配置する。
  • 同じ製品に対して複数の広告アセットを作成する。
  • 既存のショットや動きを使用して、後の動画をガイドする。
  • 一つの成功した結果からシリーズを構築する。

ヒント: 参照は次の生成をガイドするものであり、単にオリジナルを複製するものではありません。プロンプトには、何を維持し、何を変えるべきかを記述する必要があります。例:「キャラクターの顔と服装は一貫性を保ち、背景を夜の通りに変えてください。」

Image Upscaling(画像のアップスケール):Topaz HD で詳細を復元する

被写体と構図には満足しているが、より高い解像度やより細かい詳細が必要な場合に、画像のアップスケールを使用します。Fish Creative は Topaz HD を使用して個別の画像をアップスケールし、詳細を復元します。

ヒント: これは、最終的な画像をダウンロードしたり、カバー画像を作成したり、動画生成に進んだりする前に役立ちます。キャラクターの解剖学的構造や製品の形状がすでに間違っている場合、アップスケールでは通常修正できません。まず画像を再生成するか、プロンプトを修正してください。

Generate Video(動画生成):気に入った画像をアニメーション化する

画像の下にある Generate Video ボタンは、その結果をそのまま動画ツールに送り、ダウンロードとアップロードの手間を省きます。

ヒント: 動画ツールに移動したら、プロンプトではアクション、カメラワーク、時間の経過に伴う変化に集中してください。静止画の長い説明を繰り返す必要はありません。例:「人物がわずかに頭を上げ、カメラがゆっくりと近づき、背景のライトが徐々に明るくなる。」

Use for Lip Sync(リップシンクに使用):キャラクターに声を与える

画像と動画の両方の結果で Use for Lip Sync を選択できます。画像の場合、ツールは画像とオーディオから話す動画を作成します。動画の場合、既存の動きを活かしながら、口の動きをオーディオと同期させます。

ヒント: 画像から直接リップシンクに進むのは、安定した解説動画に適しています。動画から始めるのは、呼吸、うなずき、または体の動きを入れたい場合に便利です。いずれの場合も、顔がはっきり見え、口が遮られていないことを確認してください。

Extend Video(動画の延長):既存のクリップを継続する

クリップのアクション、カメラワーク、スタイルは気に入っているが、もっと長く再生させたい場合に Extend Video を使用します。延長することで、既存のシーンと動きを継続できます。

ヒント: 延長する前に最後のフレームを確認してください。キャラクターの歪み、速い動き、または被写体がフレームから外れそうな状態は、継続時に問題を引き起こす可能性があります。安定したクリアなフレームで終わるクリップは、通常、スムーズに延長するのが簡単です。

Asset Library and History(アセットライブラリと履歴):作品を見つけて再利用する

作成したものはアセットライブラリと生成履歴に自動的に保存されます。そこから以前の画像、動画、オーディオを見つけて、新しいタスクに直接追加できます。

ヒント: いくつかの主要なバージョンを保存しておきましょう:元の参照、最初の使用可能な結果、最終的な高品質出力、およびリップシンクに使用する安定した動画です。これにより、プロセス全体をやり直すことなく、一つの段階を修正することが容易になります。

Public Sharing and Download(公開共有とダウンロード):最終結果を確認する

ダウンロードすると結果がデバイスに保存され、編集したり、デザインに使用したり、公開したりできます。生成記録を公開共有すると、他の人があなたの作品を見ることができるようになります。このオプションは、コンテンツを公開する準備ができたときにのみ使用してください。

ヒント: ダウンロードする前に、アスペクト比、解像度、キャラクターと製品の詳細、およびリップシンクを確認してください。ポストプロダクションで動画にキャプションやブランディングが必要かどうかも検討してください。

Credit Cost and Remaining Generations(クレジットコストと残り生成数):生成前に確認する

Generate ボタンには、現在の設定での推定クレジットコストと、その設定で残高から何枚の画像または動画を生成できるかが表示されます。解像度、時間、または出力数を変更する際、送信前に推定値がどのように変わるかを確認してください。

ヒント: これは、テスト実行と最終出力を計画するのに役立ちます。初期の生成を使用して構図と動きを決定し、方向に満足したら最終的な設定を選択してください。


Fish Creative で作成を始めよう

Fish Creative は、クリエイティブツールを一つのワークスペースに集約します。このチュートリアルでは、画像生成、動画生成、リップシンクを使用して、一つのプロンプトから Fish Audio の声で話すキャラクターまで作成しました。

最初のプロジェクトはシンプルで構いません。明確にフレーミングされた一人のキャラクター、少しの動き、そして 1〜2 文の台詞。プロセスに慣れたら、参照画像、最初と最後のフレーム、動画リファレンス、またはより野心的なカメラワークに挑戦してみてください。

Fish Creative で自分の作品作りを始める →", "image_alt": "Fish Creative のインターフェースと AI 生成された画像・動画のワークフロー", "image_caption": "Fish Creative を使用して、画像生成、動画生成、リップシンクを一つの連続したワークフローで実行できます。", "faq": [{"question": "テキストのみから画像や動画を生成できますか?", "answer": "はい。Image ツールはテキストプロンプトを受け付け、Video ツールは Text to Video をサポートしています。より詳細にコントロールしたい場合は、画像、動画、またはオーディオの参照を追加することもできます。"}, {"question": "静止画をリップシンクに使用できますか?", "answer": "はい。リップシンクは画像と動画の両方を受け付けます。完成した結果により多くの体の動きを加えたい場合は、まず画像を動画に変えてからリップシンクを適用できます。"}, {"question": "すべてのモデルで同じ設定が使えますか?", "answer": "いいえ。サポートされる入力、アスペクト比、時間、および解像度はモデルによって異なります。モデルを選択した後に表示されるオプションを確認してください。"}, {"question": "生成された結果を手動で保存する必要がありますか?", "answer": "結果は自動的にアセットライブラリに保存され、ツールをまたいで再利用できます。また、デバイスにダウンロードすることも可能です。"}]}```

よくある質問

Can I Generate Images and Videos from Text Alone?
Yes. The Image tool accepts text prompts, and the Video tool supports text to video. You can also add image, video, or audio references for more control.
Can I Use a Still Image for Lip Sync?
Yes. Lip Sync accepts both images and videos. If you want more body movement in the finished result, you can turn the image into a video first, then apply lip sync.
Do All Models Have the Same Settings?
No. Supported inputs, aspect ratios, durations, and resolutions vary by model. Check the options shown after selecting your model.
Do I Need to Save Generated Results Manually?
Your results are saved to the asset library, where you can reuse them across tools. You can also download them to your device.
Frank Lu

Frank Lu

Product, Operation & Data Engineer

Frank Luの他の記事を読む

自然で感情豊かな声を生み出す

今日から、最高品質の音声作成を始めましょう

すでにアカウントをお持ちですか? ログイン