Wie man KI-Bilder, Videos & Lip-Sync-Videos mit Fish Creative erstellt – Vollständiges Tutorial
Generieren Sie ein Bild aus einem Prompt, verwandeln Sie es in ein Video und lassen Sie die Person auf dem Bildschirm natürlich sprechen. In Fish Creative können Sie all das tun.
Fish Creative vereint Ihre kreativen KI-Tools in einem Arbeitsbereich, einschließlich Bildgenerierung, Videogenerierung und Lip Sync. Nutzen Sie alles, was Sie bereits erstellt haben, weiter, ohne Dateien zwischen verschiedenen Tools herunter- und hochzuladen. Ganz gleich, ob Sie einen virtuellen Presenter, eine Produktdemo, ein Social-Media-Video oder einen Charakter mit eigener Stimme erstellen – Sie können immer mit demselben grundlegenden Workflow beginnen.
Dieses Tutorial führt Sie Schritt für Schritt durch den Prozess.
Folgen Sie dem Tutorial und beginnen Sie mit der Erstellung Ihrer eigenen Bilder und Videos. Fish Creative ausprobieren.
Was kann man mit Fish Creative machen?
Melden Sie sich bei Fish Audio an und wählen Sie Image & Video in der linken Seitenleiste, um Fish Creative zu öffnen. Dieses Tutorial konzentriert sich auf drei Kernwerkzeuge:
- Image: Generieren Sie Bilder aus Text oder laden Sie ein Referenzbild hoch, um eine neue Kreation zu steuern. Sie können auch Topaz HD verwenden, um einzelne Bilder hochzuskalieren und Details wiederherzustellen.
- Video: Erstellen Sie Videos aus Text, Bildern, Start- und End-Frames, Referenzbildern, Referenzvideos oder einem Mix aus Eingaben, der auch Audio enthält.
- Lip Sync: Fügen Sie Audio zu einem Bild oder Video hinzu, damit die Person auf dem Bildschirm synchron dazu spricht. Ihre Kreationen werden automatisch in Ihrer Asset-Bibliothek gespeichert. Sobald Sie ein Bild erstellt haben, können Sie es direkt an die Videogenerierung senden. Wenn das Video fertig ist, senden Sie es an Lip Sync. Sie können während des gesamten Prozesses im selben Arbeitsbereich bleiben.
Registrieren Sie sich für ein Fish Audio Konto, um Fish Creative zu nutzen. Neue Benutzer erhalten kostenlose Credits, um Bildgenerierung, Videoerstellung und Lip Sync auszuprobieren.
1. Von der Idee zum fertigen Video: Der vollständige Workflow
Sehen Sie sich diesen Abschnitt im vollständigen Tutorial oben an: 00:19–01:06.
Sie müssen nicht jedes Modell und jede Schaltfläche lernen, bevor Sie beginnen. Es hilft, zuerst zu sehen, wie ein Inhalt entsteht, und dann die Details in den folgenden Abschnitten durchzuarbeiten.
Für dieses Tutorial erstellen wir ein kurzes Video mit einem virtuellen Presenter. Hier ist der grundlegende Ablauf:
Video planen → Charakterbild erstellen → Bild animieren → Stimme vorbereiten → Lip Sync hinzufügen
Folgen Sie diesen Schritten:
- Melden Sie sich bei Fish Audio an und öffnen Sie Image & Video in der linken Seitenleiste.
- Entscheiden Sie, wo das Video verwendet wird, und wählen Sie ein Seitenverhältnis. Für ein vertikales Talking-Head-Video in sozialen Medien wählen Sie beispielsweise 9:16.
- Öffnen Sie Image und schreiben Sie einen Prompt, der Charakter, Umgebung, Komposition, Stil und Beleuchtung beschreibt.
- Wählen Sie ein Modell und die Einstellungen, generieren Sie Ihre Bilder und suchen Sie eines mit einem klar definierten Subjekt und einer Komposition aus, die in Bewegung gut funktionieren wird.
- Klicken Sie auf Generate Video, um das ausgewählte Bild direkt an das Video-Tool zu senden.
- Schreiben Sie einen Prompt, der die Bewegungen und Ausdrücke des Charakters, die Kamerabewegung und das Tempo beschreibt.
- Legen Sie Seitenverhältnis, Dauer, Auflösung und Anzahl der Ergebnisse fest und generieren Sie das Video.
- Überprüfen Sie das Gesicht, die Kontinuität der Bewegung und die Sichtbarkeit des Mundes. Wählen Sie ein Video, das gut für Lip Sync geeignet ist.
- Öffnen Sie Text to Speech in Fish Audio, geben Sie Ihr Skript ein und wählen Sie eine Stimme aus der Bibliothek oder eine geklonte Stimme, um das Audio zu generieren. Sie können auch eine eigene Aufnahme verwenden.
- Senden Sie das Charaktervideo direkt an Lip Sync und wählen Sie dann das Audio aus Ihrer Asset-Bibliothek aus oder laden Sie eine Audiodatei hoch.
- Legen Sie Seitenverhältnis, Auflösung und Anzahl der Ergebnisse fest und generieren Sie das fertige Video.
- Prüfen Sie die Vorschau des Lip Sync. Von dort aus können Sie das Ergebnis neu generieren, verlängern, herunterladen oder als Referenz wiederverwenden.
Tipp: Sie können diesen Workflow an das jeweilige Projekt anpassen. Für ein schnelles Video von jemandem, der in die Kamera spricht, überspringen Sie die Videogenerierung und verwenden Sie ein Charakterbild zusammen mit Audio in Lip Sync. Für einen Film oder eine E-Commerce-Anzeige erstellen Sie mehrere Referenzbilder und Videoaufnahmen und schneiden diese dann zu einem fertigen Werk zusammen.
Die nächsten Abschnitte behandeln Bildgenerierung, Videogenerierung und Lip Sync im Detail, mit Tipps für konsistente Ergebnisse, die Ihrer Idee entsprechen.
2. Erstellen Sie Ihr erstes KI-Bild
Sehen Sie sich diesen Abschnitt im vollständigen Tutorial oben an: 01:07–01:43.
Schritt 1: Das Image-Tool öffnen
Öffnen Sie Fish Creative und wählen Sie Image oben auf der Seite aus. Verwenden Sie das Prompt-Feld in der Mitte, um zu beschreiben, was Sie erstellen möchten. Sie können auch Referenzbilder hinzufügen, um den Charakter, das Produkt, die Komposition oder den visuellen Stil zu steuern.
Tipp: Wenn Sie mit einer Idee beginnen, reicht Text völlig aus. Sie müssen nicht erst ein Bild vorbereiten.
Schritt 2: Ihren Bild-Prompt schreiben
Ein Bild-Prompt sagt dem Modell, was es erstellen soll. Ein klarer Prompt deckt normalerweise Folgendes ab:
- Subjekt: Die Person, das Produkt oder das Objekt im Bild.
- Umgebung: Wo sich das Subjekt befindet.
- Komposition: Nahaufnahme, Ganzkörperaufnahme, Draufsicht, Weitwinkel oder eine andere Wahl des Bildausschnitts.
- Stil: Fotografie, Illustration, 3D, kinofreundlicher Look oder ein anderer visueller Stil.
- Beleuchtung: Weiches Licht, natürliches Licht, Neon, Golden Hour oder eine ähnliche Richtung. Wir werden einen virtuellen Creator verwenden, der in die Kamera blickt, damit das Bild leicht zu bearbeiten ist, wenn wir zu Video und Lip Sync übergehen.
Beispiel-Prompt:
Ein junger Tech-Content-Creator, der in einem modernen kreativen Studio steht.
Halbnahaufnahme, blickt mit einem selbstbewussten, freundlichen Ausdruck in die Kamera.
Ein sauberer, aufgeräumter Hintergrund, weiche filmische Beleuchtung und ein fotorealistischer Stil.
Klare Gesichtszüge und detailreich im gesamten Bild.
Tipp: Wenn Sie ein vertikales Kurzvideo planen, geben Sie die vertikale Rahmung im Prompt an und wählen Sie das passende Seitenverhältnis in den Einstellungen.
Schritt 3: Referenzbilder hinzufügen (falls nötig)
Wenn Sie bereits einen Charakter, ein Produkt oder einen visuellen Stil im Kopf haben, laden Sie ein Referenzbild hoch. Referenzen helfen dem Modell zu verstehen, welche Merkmale, Kompositionen oder Stile Sie beibehalten möchten. Sie sind auch nützlich, wenn Sie eine Serie mit demselben Charakter erstellen.
Wählen Sie Referenzbilder mit:
- Einem klaren Subjekt und guter Auflösung.
- Einem unverdeckten Gesicht oder Produkt.
- Einer Rahmung, die dem gewünschten Endergebnis nahekommt.
- Konsistenter Beleuchtung und Farbe.
Tipp: Wenn Sie keine Referenz benötigen, überspringen Sie diesen Schritt.
Schritt 4: Modell und Einstellungen wählen
Fish Creative bietet derzeit verschiedene Bildmodelle an, darunter:
- Nano Banana 2 Lite
- GPT Image 2
- Nano Banana 2
- Nano Banana Pro
- Seedream 5.0
- Seedream 4.5
Tipp: Die Modellauswahl wird im Laufe der Zeit aktualisiert, prüfen Sie also Fish Creative auf die aktuelle Auswahl.
Sie können auch Folgendes anpassen:
- Seitenverhältnis: Querformat, Porträt oder Quadrat.
- Auflösung: Die Abmessungen des Ausgabebildes.
- Qualität: Die Qualitätsstufe für das Ergebnis.
- Anzahl der Ergebnisse: Generieren Sie ein Bild oder mehrere gleichzeitig.
Tipp: Die Schaltfläche "Generate" zeigt die geschätzten Credit-Kosten an und wie viele Bilder Ihr Guthaben bei den aktuellen Einstellungen noch abdeckt. Prüfen Sie dies vor dem Absenden und passen Sie das Modell, die Qualität oder die Anzahl der Ausgaben bei Bedarf an.
Schritt 5: Generieren und Bild auswählen
Sobald Sie mit dem Prompt und den Einstellungen zufrieden sind, klicken Sie auf Generate. Prüfen Sie die Ergebnisse und wählen Sie das Bild aus, das am besten für Ihr Video geeignet ist.
Für jedes generierte Bild können Sie:
- Es als Referenz verwenden.
- Es neu erstellen.
- Es hochskalieren.
- Es für Lip Sync verwenden.
- Ein Video daraus generieren.
- Den Generierungsdatensatz öffentlich teilen.
- Es herunterladen.
Tipp: Wenn das Subjekt gut aussieht, Sie aber ein größeres Bild oder mehr Details benötigen, verwenden Sie Topaz HD, um das Bild hochzuskalieren, bevor Sie fortfahren.
Empfehlungen für Bilder, die Sie in Video oder Lip Sync verwenden
Wenn Sie ein Charakterbild für die nächsten Schritte erstellen:
| Empfohlen | Vermeiden |
|---|---|
| Eine Frontalansicht oder ein leichter Winkel, bei dem Augen, Nase und Mund klar sichtbar sind | Hände, Haare oder andere Objekte in der Nähe des Mundes |
| Ein frühzeitig für Ihre Plattform gewähltes Seitenverhältnis (9:16 ist üblich für kurze vertikale Videos) | Unruhige oder überladene Hintergründe |
Ein klares Subjekt und eine ausgewogene Komposition bieten eine bessere Ausgangsbasis für natürliche Bewegungen.
3. Ein Standbild in ein Video verwandeln
Sehen Sie sich diesen Abschnitt im vollständigen Tutorial oben an: 01:44–02:22.
Schritt 1: Das Video-Tool öffnen
Wählen Sie Video oben auf der Seite. Sie können ein Video allein aus einem Text-Prompt generieren oder Bilder, Videos oder Audio als Referenzmaterial hinzufügen.
Fish Creative unterstützt verschiedene Arten der Videogenerierung:
- Text zu Video.
- Bild zu Video.
- Start- und End-Frame zu Video.
- Referenzbild zu Video.
- Video-Referenz.
- Audio-Referenz kombiniert mit anderen Eingaben. Für dieses Tutorial verwenden wir Bild zu Video und beginnen mit dem Charakterbild, das wir gerade erstellt haben.
Schritt 2: Ihr Bild oder anderes Referenzmaterial hinzufügen
Wählen Sie das Bild direkt aus Ihrer Asset-Bibliothek aus. Es ist nicht nötig, es herunter- und wieder hochzuladen. Je nach Modell und Generierungsmodus können Sie auch einen Start-Frame, einen End-Frame, Referenzbilder, Referenzvideos oder Referenz-Audio hinzufügen.
Jede Art von Referenz dient einem anderen Zweck:
- Einzelbild: Legt den Charakter, die Umgebung und die Startkomposition fest.
- Start- und End-Frames: Definieren, wie das Video beginnt und endet.
- Referenzbilder: Helfen, Charaktere, Objekte oder den allgemeinen Look zu steuern.
- Referenzvideo: Dient als Leitfaden für Action, Kamerabewegung oder Tempo.
- Referenz-Audio: Bietet Sound- und Timing-Hinweise für Modelle, die dies unterstützen.
Schritt 3: Ihren Video-Prompt schreiben
Ein Bild-Prompt beschreibt, was im Bild zu sehen ist. Ein Video-Prompt sollte sich darauf konzentrieren, wie sich die Szene bewegt und verändert. Nützliche Details sind:
- Die Aktionen des Subjekts.
- Änderungen im Ausdruck oder Blick.
- Kamerabewegung.
- Änderungen im Hintergrund oder in der Umgebung.
- Tempo und visueller Stil.
Beispiel-Prompt:
Die Person blickt natürlich in die Kamera und macht kleine Bewegungen mit Kopf und Schultern, während sie einen selbstbewussten, freundlichen Ausdruck beibehält.
Die Bewegungen sind entspannt, flüssig und realistisch.
Die Kamera fährt langsam näher heran, und die Studiobeleuchtung bleibt konsistent.
Das Video soll natürlich und professionell wirken.
Tipp: Wenn Sie Lip Sync hinzufügen möchten, beginnen Sie mit einfachen, kontrollierten Bewegungen. Starke Kopfdrehungen, schnelle Kamerabewegungen und Objekte, die vor dem Gesicht vorbeiziehen, können Lip Sync erschweren.
Schritt 4: Ein Video-Modell wählen
Fish Creative unterstützt eine wachsende Auswahl an Video-Modellen. Hier sind einige der verfügbaren Optionen:
- MiniMax H3
- Seedance 2.0
- Seedance 2.5
- Kling O3 Pro
- Seedance 2.0 Mini
- Kling 2.6 Pro
- Hailuo 2.3
- Veo 3.1
- Kling V3 Pro
- Seedance 2.0 Fast
- Seedance 1.5 Pro
Tipp: Im Laufe der Zeit werden weitere Modelle hinzugefügt, schauen Sie also bei Fish Creative nach der neuesten Auswahl. Modelle können unterschiedliche Eingaben, Längen und Seitenverhältnisse unterstützen. Wählen Sie zuerst ein Modell aus und treffen Sie dann die Auswahl aus den angebotenen Einstellungen.
Schritt 5: Die Video-Parameter festlegen
Je nach Modell können Sie Folgendes anpassen:
- Seitenverhältnis: Optionen sind 21:9, 16:9, 4:3, 1:1, 3:4, 9:16 und Adaptiv.
- Dauer: Die unterstützten Längen variieren je nach Modell und reichen derzeit von etwa 4 bis 30 Sekunden.
- Auflösung: Wählen Sie eine Auflösung, die für eine Vorschau oder Ihr Endergebnis geeignet ist.
- Anzahl der Ergebnisse: Generieren Sie ein Video oder mehrere gleichzeitig.
Tipp: Die Schaltfläche "Generate" zeigt die geschätzten Credit-Kosten an und wie viele Videos Ihr verbleibendes Guthaben bei diesen Einstellungen abdeckt.
Schritt 6: Generieren und Ihr Video überprüfen
Klicken Sie auf Generate und warten Sie, bis das Video fertig ist. Wenn Sie die Vorschau ansehen, prüfen Sie, ob:
- Das Gesicht konsistent bleibt.
- Bewegungen natürlich aussehen und flüssig ineinander übergehen.
- Keine offensichtlichen Verzerrungen auftreten.
- Kamerabewegung und Tempo zu Ihrem Prompt passen.
- Der Mund während des Großteils des Clips klar sichtbar bleibt. Sie können das Ergebnis als Referenz verwenden, es neu erstellen, an Lip Sync senden, verlängern, den Generierungsdatensatz öffentlich teilen oder es herunterladen. Wenn Sie mit dem Video zufrieden sind, klicken Sie auf Use for Lip Sync, um fortzufahren.
4. Lassen Sie Ihren Charakter mit Lip Sync sprechen
Sehen Sie sich diesen Abschnitt im vollständigen Tutorial oben an: 02:23–02:44.
Das Lip Sync Werkzeug von Fish Creative funktioniert sowohl mit Bildern als auch mit Videos. Fügen Sie ein Bild oder Video Ihres Charakters hinzu, kombinieren Sie es mit Audio und generieren Sie ein Video mit Mundbewegungen, die zur Sprache passen.
Schritt 1: Ihr Charakterbild oder -video vorbereiten
Sie können:
- Ein Bild oder Video von Ihrem Gerät hochladen.
- Etwas auswählen, das Sie bereits in Ihrer Asset-Bibliothek erstellt haben.
- Bei einem Bild- oder Videoergebnis auf Use for Lip Sync klicken.
Schritt 2: Audio mit Text to Speech vorbereiten
Lip Sync benötigt eine vorhandene Audiospur. Sie können eine Aufnahme hochladen oder eine mit dem Text to Speech Werkzeug von Fish Audio erstellen.
So erstellen Sie Audio in Fish Audio:
- Öffnen Sie Text to Speech.
- Tippen Sie die Zeilen ein oder fügen Sie sie ein, die Ihr Charakter sagen soll.
- Wählen Sie eine Stimme aus der Fish Audio Stimmenbibliothek oder verwenden Sie eine von Ihnen erstellte geklonte Stimme.
- Generieren Sie das Audio und speichern Sie es in Ihrer Asset-Bibliothek.
- Kehren Sie zu Fish Creative zurück und wählen Sie dieses Audio in Lip Sync aus.
Tipp: Sie können das generierte Audio auch herunterladen und die Datei in Lip Sync hochladen.
Probieren Sie für dieses Tutorial ein kurzes Skript aus:
Willkommen bei Fish Creative.
Beginnen Sie mit einem einzelnen Bild, verwandeln Sie es in ein Video und lassen Sie Ihren Charakter natürlich sprechen.
Tipp: Beschränken Sie sich für Ihren ersten Test auf ein oder zwei Sätze. Kurze Audioclips machen es einfacher, das Aussehen des Charakters, das Sprechtempo und den Lip Sync zu überprüfen.
Schritt 3: Visuelles Material und Audio hinzufügen
Kehren Sie zu Fish Creative zurück, wählen Sie Lip Sync und fügen Sie Ihr Charakterbild oder -video hinzu. Wählen Sie dann Audio aus Ihrer Asset-Bibliothek aus oder laden Sie eine Audiodatei hoch.
Tipp: Es gibt auch ein optionales Prompt-Feld. Lassen Sie es leer, wenn Sie keine zusätzlichen Anweisungen benötigen. Wenn Sie etwas Spezifisches zu den visuellen Aspekten angeben möchten, fügen Sie eine kurze Beschreibung gemäß den Anweisungen in der Benutzeroberfläche hinzu.
Schritt 4: Einstellungen wählen und generieren
Wenn Ihre Eingaben bereit sind, legen Sie fest:
- Seitenverhältnis.
- Auflösung.
- Anzahl der Ergebnisse. Prüfen Sie, ob Sie den richtigen Charakter und das richtige Audio ausgewählt haben, und klicken Sie dann auf Generate.
Sehen Sie sich das fertige Video von Anfang bis Ende an und prüfen Sie, ob:
- Die Mundbewegungen dem Timing der Sprache folgen.
- Das Gesicht konsistent bleibt.
- Anfang und Ende natürlich wirken.
- Video und Audio vollständig sind.
- Die Bewegung des Charakters zum Tonfall der Stimme passt. Sie können das Ergebnis als Referenz verwenden, es neu erstellen, Lip Sync erneut anwenden, das Video verlängern, den Generierungsdatensatz öffentlich teilen oder es herunterladen.
Empfehlungen für besseren Lip Sync
| Empfohlen | Vermeiden |
|---|---|
| Ein frontal ausgerichteter Charakter oder ein leichter Winkel | Haare, Hände oder Objekte in der Nähe des Mundes |
| Klare Sprache mit wenig Hintergrundgeräuschen, beginnend mit einem kurzen Skript in natürlichem Sprechtempo | Plötzliche Bewegungen und schnelle Kopfdrehungen in Video-Eingaben |
Tipp: Wenn das Ergebnis nicht funktioniert, versuchen Sie es mit einem anderen Bild, Video oder einer anderen Audiospur, bevor Sie viele detaillierte Anweisungen hinzufügen.
5. Drei Projekte zum Ausprobieren: Talking-Head-Videos, KI-Filme und E-Commerce-Anzeigen
Sehen Sie sich diesen Abschnitt im vollständigen Tutorial oben an: 02:45–03:39.
Diese Projekte verwenden dieselben Bild-, Video- und Lip-Sync-Werkzeuge, erfordern aber jeweils einen etwas anderen Ansatz. Ein Talking-Head-Video hängt von einem konsistenten Charakter und einer guten stimmlichen Darbietung ab. Ein KI-Film benötigt Kontinuität zwischen den Aufnahmen. Eine E-Commerce-Anzeige muss das Produkt genau zeigen und seine Verkaufsargumente schnell vermitteln.
Hier erfahren Sie, wie Sie die Werkzeuge für jedes Projekt kombinieren.
Projekt 1: Ein KI-Presenter-Video
Angenommen, Sie erstellen ein vertikales 15-sekündiges Erklärvideo darüber, wie man einen stärkeren Einstieg für ein Kurzvideo schreibt. Sie möchten einen Presenter, der in die Kamera blickt und ein kurzes Skript mit natürlicher Stimme vorträgt.
Was Sie benötigen:
- Ein Charakterbild, das nach vorne oder in einem leichten Winkel blickt.
- Ein Skript, das etwa 15 Sekunden zum Vorlesen benötigt.
- Eine Stimme aus der Fish Audio Bibliothek, eine geklonte Stimme oder eine eigene Aufnahme.
- Eine 9:16 Ausgabeeinstellung.
Empfohlener Workflow:
- Erstellen Sie Ihren Charakter in Image mit einer Halbnahaufnahme der Person, die in die Kamera blickt.
- Für ein einfaches Talking-Head-Video mit minimaler Bewegung senden Sie das Bild direkt an Lip Sync.
- Wenn Sie subtiles Atmen, ein Nicken oder Schulterbewegungen wünschen, bevor die Person anfängt zu sprechen, generieren Sie zuerst ein Video mit zurückhaltender Bewegung.
- Generieren Sie das Skript-Audio in Text to Speech und speichern Sie es in Ihrer Asset-Bibliothek.
- Fügen Sie das Bild oder Video und das Audio zu Lip Sync hinzu und generieren Sie das fertige Stück.
Prompt für das Charakterbild:
Ein junger Content-Creator, der in einem sauberen, modernen Studio sitzt.
Halbnahaufnahme, blickt mit einem entspannten, selbstbewussten und nahbaren Ausdruck in die Kamera.
Weiches Seitenlicht, ein leicht verschwommener Hintergrund und ein fotorealistischer Stil.
Vertikale 9:16 Komposition.
Beispiel-Skript:
Beginne dein Kurzvideo nicht damit, dich selbst vorzustellen.
Sage den Zuschauern, was sie davon haben, wenn sie zusehen.
Gib ihnen einen Grund, in diesen ersten drei Sekunden dranzubleiben.
Tipp: Achten Sie darauf, dass Blick, Ausdruck, Lippenbewegungen und Stimme zusammenpassen. Der Charakter muss sich nicht viel bewegen. Eine ruhige Präsenz hilft den Zuschauern, sich auf das Gesagte zu konzentrieren.
Projekt 2: Ein KI-Kurzfilm
Stellen Sie sich eine 20- bis 30-sekündige Spannungsszene vor: Ein Detektiv betritt in einer regnerischen Nacht einen verlassenen Bahnhof und entdeckt in der Ferne eine mysteriöse Gestalt. Planen Sie dies als eine Serie von kurzen Aufnahmen, anstatt die gesamte Sequenz in einem Durchgang zu generieren.
Beginnen Sie mit drei Aufnahmen:
- Establishing Shot: Ein verlassener Bahnhof in einer regnerischen Nacht. Die Kamera bewegt sich langsam auf den Eingang zu.
- Action Shot: Der Detektiv betritt den Bahnhof von der Seite des Bildes, hält an und schaut auf, um den Raum zu sondieren.
- Dialog-Nahaufnahme: Eine Nahaufnahme des Detektivs, der einen wichtigen Satz sagt.
Empfohlener Workflow:
- Verwenden Sie Image, um eine Charakterreferenz für den Detektiv und dann ein Bild des Bahnhofs zu erstellen.
- Verwenden Sie As Reference, um den ausgewählten Charakter und die Umgebung in spätere Bilder zu übernehmen, damit die Aufnahmen konsistent aussehen.
- Generieren Sie die drei Aufnahmen separat. Verwenden Sie für den Establishing Shot Text-zu-Video oder Referenzbilder. Versuchen Sie für den Action Shot ein einzelnes Bild, Start- und End-Frames oder eine Video-Referenz. Lassen Sie den Detektiv in der Dialog-Nahaufnahme nach vorne oder in einem leichten Winkel blicken.
- Generieren Sie den Dialog-Ton in Fish Audio und wenden Sie Lip Sync nur auf die Nahaufnahme an, in der der Charakter spricht.
- Laden Sie die Aufnahmen herunter und setzen Sie sie in Ihrem gewohnten Videoeditor zusammen: Umgebung, Action, dann Dialog.
Prompt für die Charakterreferenz:
Ein Detektiv in den frühen Vierzigern, der einen langen, dunklen Trenchcoat trägt.
Kurzes Haar, ein müder, aber wacher Ausdruck und Regentropfen auf dem Kragen.
Filmische, fotorealistische Charakterreferenz mit kühlen Blautönen.
Klar definierte Gesichtszüge in Frontal- und Dreiviertelansicht.
Video-Prompt für Aufnahme 1:
Ein verlassener Bahnhof in einer regnerischen Nacht.
Pfützen reflektieren gedimmtes Licht, während feiner Regen weiter fällt.
Ein dünner Nebel zieht langsam in der Ferne vorbei.
Die Kamera bewegt sich sanft von außerhalb des Bahnhofs in Richtung Eingang.
Eine spannungsgeladene, filmische Atmosphäre mit kühlen Blautönen.
Beispiel-Dialog:
Ich weiß, dass du auf mich gewartet hast.
Tipp: Ein häufiges Problem bei KI-Filmen ist, dass jede Aufnahme für sich gut aussieht, aber die Charaktere, Kleidung und Orte bei den Schnitten nicht zusammenpassen. Eine Charakterreferenz zu etablieren und eine Aufnahme nach der anderen zu generieren, macht Konsistenz einfacher, als denselben Charakter immer wieder von Grund auf neu zu beschreiben.
Projekt 3: Eine E-Commerce-Produktanzeige
Angenommen, Sie erstellen eine vertikale 15-sekündige Anzeige für ein Gesichtsserum. Die Zuschauer müssen die Flasche und die Textur klar sehen, während ein Presenter kurz die wichtigsten Vorteile erklärt.
Planen Sie vier Aufnahmen:
- 0–3 Sekunden: Eine Nahaufnahme der Flasche, damit die Zuschauer das Produkt sofort erkennen.
- 3–7 Sekunden: Eine Person nimmt das Produkt in die Hand und zeigt es in der Anwendung.
- 7–11 Sekunden: Eine Nahaufnahme der Textur des Serums oder ein Produktdetail.
- 11–15 Sekunden: Ein Presenter spricht in die Kamera, gefolgt von einem Schlussbild mit Produkt und Marke.
Empfohlener Workflow:
- Laden Sie ein klares Produktfoto als Referenz für dessen Aussehen hoch.
- Erstellen Sie in Image ein Produkt-Stillleben, ein Bild von jemandem, der das Produkt hält, und eine Textur-Nahaufnahme. Wenn Sie Ergebnisse haben, die Ihnen gefallen, verwenden Sie As Reference, um weitere Assets im gleichen Stil zu erstellen.
- Verwandeln Sie das Stillleben und die Anwendungsbilder in kurze Videos. Halten Sie Produktaufnahmen einfach: ein langsames Heranfahren, eine Drehung oder eine Änderung der Beleuchtung. Komplexe Bewegungen können die Flasche oder den Text auf der Verpackung verzerren.
- Bereiten Sie ein separates, frontal ausgerichtetes Bild oder ein ruhiges Video für den Presenter vor und generieren Sie das Audio für die Produktbotschaft in Fish Audio.
- Verwenden Sie Lip Sync, um das Presenter-Segment zu erstellen, laden Sie dann die Clips herunter, schneiden Sie sie zusammen und fügen Sie Untertitel und den letzten Schliff hinzu.
Prompt für das Produktbild:
Ein hochwertiges Gesichtsserum in einer klaren Glasflasche auf einer hellen Steinarbeitsplatte.
Die Vorderseite der Flasche zeigt zur Kamera.
Weiches Morgenlicht fällt von hinten und von einer Seite ein, mit ein paar Wassertropfen und sauberen Reflexionen um das Produkt herum.
Hochwertige Hautpflege-Werbefotografie, eine klar definierte Produktsilhouette und Platz für Text.
Vertikale 9:16 Komposition.
Prompt für das Produktvideo:
Die Kamera bewegt sich langsam auf die Serumflasche zu, während Wassertropfen sanft am Glas heruntergleiten.
Die Hintergrundbeleuchtung verschiebt sich weich.
Das Produkt bleibt ruhig und klar definiert, mit zurückhaltender Bewegung und dem Look einer hochwertigen Hautpflegeanzeige.
Beispiel-Skript:
Leichte, schnell einziehende Feuchtigkeit in einem Schritt.
Verwenden Sie es morgens und abends für eine einfachere Hautpflegeroutine.
Tipp: Die Produkterkennung ist bei E-Commerce-Inhalten am wichtigsten. Verwenden Sie klare Referenzbilder und geben Sie dem Produkt genügend Platz im Bild. Wenn der Verpackungstext, Logos oder die Form der Flasche exakt sein müssen, prüfen Sie das Video vor der Veröffentlichung Bild für Bild und verwenden Sie die tatsächlichen Produkt-Assets, um etwaige Unstimmigkeiten in der Postproduktion zu korrigieren.
6. Nützliche Schaltflächen und wann man sie verwendet
Sehen Sie sich diesen Abschnitt im vollständigen Tutorial oben an: 03:40–04:32.
Fish Creative bietet mehr als nur den ersten Klick auf "Generate". Die Schaltflächen unter jedem Ergebnis ermöglichen es Ihnen, ein Bild oder Video an das nächste Werkzeug zu senden oder eine Version, die Ihnen gefällt, weiter zu verfeinern. Hier sind die Funktionen, die Sie am häufigsten verwenden werden.
Prompt-Optimierung: Details zu einer ersten Idee hinzufügen
Wenn Ihr Prompt sehr kurz ist, wie zum Beispiel "eine Person in einem Café" oder "ein Werbevideo für ein Produkt", kann die Prompt-Optimierung helfen, ihn zu erweitern. Sie fügt Details zum Subjekt, zur Umgebung, zur Komposition, zur Beleuchtung, zur Action oder zur Kamerabewegung hinzu.
Verwenden Sie sie in drei Schritten:
- Schreiben Sie die wesentlichen Punkte auf, die gleich bleiben müssen, wie die Identität des Charakters, den Produktnamen, die erforderliche Action und das Seitenverhältnis.
- Verwenden Sie die Prompt-Optimierung, um visuelle Details hinzuzufügen.
- Lesen Sie den überarbeiteten Prompt vor dem Generieren. Entfernen Sie alles, was Sie nicht benötigen, und stellen Sie sicher, dass Charakter, Produkt und Aktionen immer noch Ihrer ursprünglichen Idee entsprechen.
Tipp: Die Prompt-Optimierung ist nützlich, wenn Sie wissen, was Sie wollen, aber nicht sicher sind, wie Sie es beschreiben sollen. Betrachten Sie das Ergebnis als Entwurf, den Sie vor der Generierung prüfen.
Recreate: Eine andere Version versuchen
Verwenden Sie Recreate, wenn ein Ergebnis nah dran ist, aber der Ausdruck, die Komposition, die Action oder die Kamerabewegung noch nicht ganz passen. So können Sie auf einer bestehenden Generierung aufbauen, ohne die Aufgabe von Grund auf neu einzurichten.
Überlegen Sie sich vor dem erneuten Erstellen, was geändert werden muss:
- Falsches Subjekt oder falsche Umgebung: Überarbeiten Sie die Kernbeschreibung in Ihrem Prompt.
- Komposition muss verbessert werden: Geben Sie Bildausschnitt, Kameraposition und Platzierung des Subjekts an.
- Zu viel Bewegung: Fordern Sie weniger Aktionen und verwenden Sie Wörter wie "subtil", "langsam" und "ruhig".
- Sie möchten einfach eine weitere Variation: Behalten Sie die Haupteinstellungen bei und generieren Sie erneut.
Tipp: Recreate funktioniert am besten für kleine Anpassungen an einer Idee, mit der Sie bereits zufrieden sind.
As Reference: Auf einem Ergebnis aufbauen, das Ihnen gefällt
Klicken Sie auf As Reference, um das aktuelle Bild oder Video einer neuen Generierungsaufgabe hinzuzufügen. Verwenden Sie dies, um einen Charakter, ein Produkt, eine Umgebung, einen visuellen Stil oder eine Bewegung zu übernehmen, die Sie bereits festgelegt haben.
Häufige Anwendungsfälle sind:
- Denselben Charakter in verschiedenen Umgebungen platzieren.
- Mehrere Werbe-Assets für dasselbe Produkt erstellen.
- Eine vorhandene Aufnahme oder Bewegung verwenden, um ein späteres Video zu steuern.
- Eine Serie aus einem erfolgreichen Ergebnis aufbauen.
Tipp: Eine Referenz leitet die nächste Generierung; sie dupliziert nicht einfach das Original. Ihr Prompt muss immer noch angeben, was bleiben und was sich ändern soll. Zum Beispiel: "Behalte das Gesicht und die Kleidung des Charakters bei und ändere den Hintergrund in eine nächtliche Straße."
Bild-Upscaling: Details mit Topaz HD wiederherstellen
Verwenden Sie das Bild-Upscaling, wenn Sie mit dem Subjekt und der Komposition zufrieden sind, aber eine höhere Auflösung oder feinere Details benötigen. Fish Creative verwendet Topaz HD, um einzelne Bilder hochzuskalieren und Details zurückzugewinnen.
Tipp: Dies ist nützlich vor dem Herunterladen eines endgültigen Bildes, dem Erstellen eines Titelbildes oder dem Übergang zur Videogenerierung. Wenn die Anatomie des Charakters oder die Form des Produkts bereits falsch ist, hilft Upscaling meist nicht. Erstellen Sie das Bild neu oder überarbeiten Sie zuerst den Prompt.
Generate Video: Ein Bild animieren, das Ihnen gefällt
Die Schaltfläche Generate Video unter einem Bild sendet genau dieses Ergebnis direkt an das Video-Tool, was Ihnen das Herunter- und Hochladen erspart.
Tipp: Wenn Sie dort sind, konzentrieren Sie den Prompt auf Action, Kamerabewegung und Veränderungen über die Zeit. Sie benötigen keine weitere ausführliche Beschreibung des Standbildes. Versuchen Sie: "Die Person hebt leicht den Kopf, die Kamera kommt langsam näher und die Hintergrundbeleuchtung wird allmählich heller."
Use for Lip Sync: Ihrem Charakter eine Stimme geben
Sie können Use for Lip Sync sowohl bei Bild- als auch bei Videoergebnissen auswählen. Bei einem Bild erstellt das Werkzeug aus dem Bild und dem Audio ein sprechendes Video. Bei einem Video synchronisiert es die Mundbewegungen mit dem Audio, während die vorhandene Bewegung beibehalten wird.
Tipp: Der direkte Weg vom Bild zum Lip Sync eignet sich gut für ein ruhiges Talking-Head-Video. Der Start mit einem Video ist nützlich, wenn Sie Atmen, Nicken oder Körperbewegungen wünschen. In beiden Fällen stellen Sie sicher, dass das Gesicht klar und der Mund unverdeckt ist.
Extend Video: Einen vorhandenen Clip verlängern
Verwenden Sie Extend Video, wenn Ihnen die Action, die Kamerabewegung und der Stil eines Clips gefallen, dieser aber länger sein soll. Das Verlängern ermöglicht es Ihnen, die vorhandene Szene und Bewegung fortzusetzen.
Tipp: Überprüfen Sie den letzten Frame vor dem Verlängern. Ein verzerrter Charakter, eine schnelle Bewegung oder ein Subjekt, das kurz davor ist, das Bild zu verlassen, kann Probleme bei der Fortsetzung verursachen. Ein Clip, der mit einem ruhigen, klaren Bild endet, lässt sich normalerweise leichter flüssig verlängern.
Asset-Bibliothek und Verlauf: Ihre Arbeit finden und wiederverwenden
Ihre Kreationen werden automatisch in der Asset-Bibliothek und im Generierungsverlauf gespeichert. Dort können Sie frühere Bilder, Videos und Audioaufnahmen finden und sie direkt neuen Aufgaben hinzufügen.
Tipp: Behalten Sie einige Schlüsselversionen: Ihre Originalreferenz, das erste brauchbare Ergebnis, die endgültige hochwertige Ausgabe und das ruhige Video, das Sie für den Lip Sync verwenden. Das macht es einfacher, eine Phase zu überarbeiten, ohne den gesamten Prozess von vorne beginnen zu müssen.
Öffentliches Teilen und Herunterladen: Das Endergebnis prüfen
Der Download speichert das Ergebnis auf Ihrem Gerät, damit Sie es bearbeiten, in einem Design verwenden oder veröffentlichen können. Das öffentliche Teilen eines Generierungsdatensatzes ermöglicht es anderen, zu sehen, was Sie erstellt haben. Verwenden Sie diese Option nur, wenn Sie bereit sind, den Inhalt öffentlich zu machen.
Tipp: Überprüfen Sie vor dem Herunterladen Seitenverhältnis, Auflösung, Charakter- und Produktdetails sowie den Lip Sync. Entscheiden Sie, ob das Video in der Postproduktion noch Untertitel oder Branding benötigt.
Credit-Kosten und verbleibende Generierungen: Vor dem Generieren prüfen
Die Schaltfläche "Generate" zeigt die geschätzten Credit-Kosten für Ihre aktuellen Einstellungen an und wie viele Bilder oder Videos Ihr Guthaben bei diesen Einstellungen abdeckt. Wenn Sie die Auflösung, Dauer oder Anzahl der Ausgaben ändern, prüfen Sie vor dem Absenden, wie sich die Schätzung ändert.
Tipp: Dies hilft Ihnen bei der Planung von Testläufen und endgültigen Ausgaben. Verwenden Sie frühe Generierungen, um Komposition und Bewegung auszuarbeiten, und wählen Sie Ihre endgültigen Einstellungen erst, wenn Sie mit der Richtung zufrieden sind.
Starten Sie Ihre Kreationen mit Fish Creative
Fish Creative vereint Ihre kreativen Werkzeuge in einem einzigen Arbeitsbereich. In diesem Tutorial haben Sie Bildgenerierung, Videogenerierung und Lip Sync verwendet, um von einem einfachen Prompt zu einem Charakter zu gelangen, der mit einer Fish Audio Stimme spricht.
Ihr erstes Projekt kann ganz einfach sein: ein klar gerahmter Charakter, ein wenig Bewegung und ein oder zwei Sätze. Wenn Sie mit dem Prozess vertraut sind, probieren Sie Referenzbilder, Start- und End-Frames, Video-Referenzen oder anspruchsvollere Kameraarbeit aus.
Beginnen Sie mit der Erstellung Ihrer eigenen Werke mit Fish Creative →