Einen Charakter in der neuen Szene halten
Nimm dasselbe Gesicht und Outfit als Image 1 und schreib die neue Aktion. Die Identität mitzunehmen ist das Ziel, keine pixelgenaue Garantie — leg das Ergebnis neben deine Referenz.
Bei MiniMax H3 Max Referenz zu Video lädst du bis zu 12 Bilder, Clips und Audio. Der Prompt nimmt Motiv, Stil, Bewegung oder Stimme mit in eine neue 5–15-Sekunden-Szene.
Production preview
Beide aus der Beispielgalerie dieses Modells. Derselbe Generator wie oben, dieselben zwei Referenzen, zwei Takes.
Referenzen: Image 1 ist ein Solo-Foto des vorderen Mannes; Image 2 ist ein Solo-Foto des hinteren Mannes — die beiden wurden nie zusammen fotografiert. Prompt: "The near man says flatly: 'Did you hear about H3 Max?' A beat of silence, wind moving across the lot. The far man's mouth pulls into a slow half-smile and he answers, warm and certain: 'Dude, I love it.' The near man exhales and shakes his head once, almost smiling. Native audio, lip-synced English dialogue, distant traffic hum, wind. No music, no subtitles, no camera movement." Das Ergebnis setzt beide Männer in eine generierte Szene, hält Gesicht und Outfit aus dem jeweiligen Solo-Foto und legt den Dialog als nativen, lippensynchronen Ton im selben Pass.

Dieselben zwei Solo-Fotos, derselbe Prompt — als zweite Take in der Beispielgalerie. Ausschnitt und Spiel landen etwas anders. Gut zu sehen, wie weit zwei Takes mit identischen Referenzen und Prompt auseinandergehen können.

Motiv, Figur oder Stil — im Prompt als Image 1, Image 2 und so weiter benannt.
Bewegung oder Kamera, je 2–15 Sekunden, zusammen höchstens 15 Sekunden — benannt als Video 1, Video 2.
Stimme oder Sound, je 2–15 Sekunden — benannt als Audio 1, Audio 2. Jede der drei Arten ist für sich optional; mischen bis 12 Dateien insgesamt.
Das Seitenverhältnis sitzt standardmäßig auf adaptiv — es nimmt die Form aus deinen Referenzen — oder du wählst eines von sechs festen Formaten.
Dieselben drei Auflösungen wie Text-zu-Video und Bild-zu-Video bei diesem Modell — 480P zum schnellen Blick, 768P oder 1080P für die Take zum Behalten.
Aus demselben Referenz-Set und Prompt auf einem bezahlten Plan mehr als eine Ausgabe drehen; die erste Ausgabe gibt es in jedem Plan.
Bis zu 9 Bilder, 3 Videoclips (je 2–15s) und 3 Audioclips (je 2–15s) — höchstens 12 Dateien, und keine der drei Arten ist allein Pflicht.
Nenn jede Referenz nach Art und Reihenfolge — Image 1, Video 1, Audio 1 — und beschreib die neue Aktion. Das Modell liest die Referenzen über diese Reihenfolge, nicht über Dateinamen.
480P, 768P oder 1080P; 5 bis 15 Sekunden; adaptives Seitenverhältnis als Standard. Ergebnis ansehen, eine Referenz oder eine Zeile ändern, nochmal drehen.
Jobs, bei denen etwas Bestimmtes in die neue Einstellung mit soll — nicht ein leerer Prompt.
Nimm dasselbe Gesicht und Outfit als Image 1 und schreib die neue Aktion. Die Identität mitzunehmen ist das Ziel, keine pixelgenaue Garantie — leg das Ergebnis neben deine Referenz.
Eine Packungs- oder Produktreferenz hält Farbe, Form und Label, während der Rest der Szene sich darum ändert.
Ein kurzer Referenzclip kann seine Bewegung abgeben — ein Schwenk, eine Dollyfahrt, eine Drehung — an ein neues Motiv und einen neuen Schauplatz.
Ein Referenz-Audioclip kann die Stimme halten, während der Prompt neuen Dialog für die Szene schreibt.
Figurenbild, Produktbild und einen kurzen Bewegungsclip im selben Prompt mischen — bis zu 12 Dateien über alle drei Arten.
Die Referenzen einer funktionierenden Szene behalten und im Prompt nur den Dialog für eine neue Sprachfassung umschreiben.
Bild-zu-Video nimmt ein Standbild als tatsächliches Startframe des Clips. Referenz zu Video behandelt bis zu 12 Bilder, Clips und Audio als Material, aus dem das neue Video Motiv, Stil, Bewegung oder Stimme zieht — keins muss das Startframe sein, und es dürfen mehrere gleichzeitig rein.
Nein. Bilder, Videos und Audio sind jeweils für sich optional — nur Bilder, nur ein Video, oder jede Mischung, solange zusammen höchstens 12 Dateien bleiben.
Nenn sie im Prompt nach Art und Reihenfolge — Image 1, Image 2, Video 1, Audio 1 — in der Reihenfolge, in der du sie angehängt hast. So findet das Modell die Referenzen, nicht über den Dateinamen.
Je 2 bis 15 Sekunden. Die kombinierte Videolänge und, getrennt davon, die kombinierte Audiolänge sind ebenfalls auf 15 Sekunden begrenzt.
480P, 768P oder 1080P, und 5 bis 15 Sekunden. Das Seitenverhältnis sitzt standardmäßig auf adaptiv — es nimmt die Form aus den Referenzen — oder du nimmst eines von sechs festen Formaten.
Dieselben Credits pro Sekunde wie Text-zu-Video und Bild-zu-Video bei diesem Modell: 480P kostet 7 Credits pro Sekunde, 768P kostet 15 und 1080P kostet 30 — eine 5-Sekunden-Take in 480P kostet 35 Credits.
Konsistenz ist das Ziel, keine Garantie — leg das echte Ergebnis neben deine Referenz, besonders bei genauer Ähnlichkeit oder einem bestimmten Produktdetail.
Im Generator oben: MiniMax H3 Max wählen und den Tab Referenz zu Video. Das ist derselbe Generator, den die Links „Referenz-Set drehen“ auf dieser Seite öffnen.
Die schnellere, günstigere Spur — die Öffnung suchen, bevor die Take zum Behalten dran ist.
Welche Spur für 2K, Entwürfe oder die Take zum Behalten — nebeneinander.
Was eine Take mit Referenz zu Video hier kostet, bevor du startest.
Ein Standbild plus dein eigenes Audio — der Mund folgt dem Soundtrack.
480P kostet 7 Credits pro Sekunde, 768P kostet 15 und 1080P kostet 30 — dieselbe Tabelle wie Text-zu-Video und Bild-zu-Video bei diesem Modell. Eine 5-Sekunden-Take in 480P kostet 35 Credits.
Genieße für kurze Zeit 30% OFF!
Bis zu 12 Bilder, Clips und Audio rein. Ein neues Video raus — Motiv, Stil, Bewegung oder Stimme aus den Referenzen mitgenommen.