MiniMax H3 Max Lip Sync: Standbild spricht dein Audio
Gesicht und Ton hast du schon. MiniMax H3 Max Lip Sync nimmt ein Standbild und das Audio, das du lieferst, und gibt einen Clip zurück, in dem der Mund diesem Soundtrack folgt.
Production preview
Standbilder, die schon sprechen
Drei Clips von @influencer_seo. Demos von MiniMax H3 Max Lip Sync, nicht auf dieser Site generiert. Schau, wie der Mund zum Ton sitzt.
Ein Moderator, ein Standbild, ein Soundtrack
Gepostet von @influencer_seo. Ein Talking-Head-Standbild spricht das hochgeladene Audio — eine der Sprach-Demos in dem Thread. Quelle @influencer_seo. Nicht auf dieser Site generiert.

Andere Sprache, selber Job
Gepostet von @influencer_seo als zweite Sprach-Take derselben Lip-Sync-Spur: Standbild plus Audio rein, sprechender Clip raus. Quelle @influencer_seo. Nicht auf dieser Site generiert.

Ein Gemälde, das spricht
Gepostet von @influencer_seo als historisch treues, sprechendes Gemälde. Das Standbild ist das Gemälde; der Mund folgt dem Soundtrack. Quelle @influencer_seo. Nicht auf dieser Site generiert.

Aus den veröffentlichten Beispielen dieses Modells
Standbild plus geliefertes Audio rein, sprechender Clip raus. Das sind Clips aus der Beispielgalerie dieses Modells, keine Ergebnisse vom Generator auf dieser Seite.
Standbild und Audio, ein Clip zurück
Aus der veröffentlichten Beispielgalerie dieses Modells. Ein Standbild wird so animiert, dass der Mund dem gelieferten Soundtrack folgt. Nicht auf dieser Site generiert.

Gleicher Input, andere Take
Aus der veröffentlichten Beispielgalerie dieses Modells. Derselbe Job wie der Clip darüber: Standbild plus Audio, sprechender Clip raus. Nicht auf dieser Site generiert.

Eine dritte Galerie-Take
Aus der veröffentlichten Beispielgalerie dieses Modells. Damit siehst du ein weiteres Standbild plus Soundtrack, nicht als Ergebnis von dieser Seite. Nicht auf dieser Site generiert.

Dein Audio, oder eine geschriebene Zeile?
Drei Jobs auf dieser Site sehen ähnlich aus. Der Input ist nicht derselbe. Wenn der Soundtrack schon da ist, ist das die Seite. Soll das Modell die Stimme noch schreiben, ist das nicht die Seite.
Standbild plus deine Aufnahme
MiniMax H3 Max Lip Sync. Es gibt keinen Prompt. Der Mund folgt dem Soundtrack, den du hochgeladen hast.
Standbild plus eine Zeile, die du schreibst
MiniMax H3 Max Bild-zu-Video im Generator auf der Startseite. Schreib die gesprochene Zeile in den Prompt, die Stimme kommt mit dem Bild.
Referenzen plus ein Prompt
MiniMax H3 Max Referenz zu Video. Nimm ein Gesicht, einen Clip oder eine Stimme in eine neue Szene mit — den Prompt schreibst du trotzdem.
So startest du MiniMax H3 Max Lip Sync
- 1
Standbild hochladen
Ein sichtbarer Mund hilft. Der Clip folgt dem Frame des Standbilds.
- 2
Audio hochladen
Mindestens fünf Sekunden. Alles über etwa 15 Sekunden wird auf den Anfang gekürzt. Der fertige Clip ist so lang wie dieses gekürzte Audio.
- 3
Auflösung wählen und generieren
480P, 768P oder 1080P. 480P reicht, um den Mund zu prüfen. Die Take zum Behalten in 768P oder 1080P fertigmachen.
Länge, Frame, Credits
Die Länge kommt vom Audio. Einen Dauerregler gibt es nicht.
Fünf Sekunden bis etwa 15
Fünf Sekunden sind die Untergrenze. Etwa 15 Sekunden die Obergrenze. Der Clip entspricht dem Audio, das du schickst.
480P, 768P oder 1080P
Dieselben drei Größen wie MiniMax H3 Max auf dieser Site. 480P, um den Mund zu prüfen; 768P oder 1080P für die Take zum Behalten.
Dieselben Credits wie MiniMax H3 Max
7 Credits pro Sekunde bei 480P, 15 bei 768P, 30 bei 1080P. Ein 5-Sekunden-Lauf in 480P ist 35 Credits.
Clips vom bezahlten Plan gehören dir
Kommerzielle Nutzung inklusive auf einem bezahlten Plan. Abbild im Standbild und Rechte am Soundtrack räumst du trotzdem selbst.
Bevor du das Standbild hochlädst
Audio hochladen. MiniMax H3 Max Lip Sync liest das Standbild und den Soundtrack, den du lieferst. Soll das Modell die gesprochene Zeile erfinden, nimm MiniMax H3 Max Bild-zu-Video und pack die Zeile in den Prompt.
So lang wie das Audio, das du hochlädst, mindestens fünf Sekunden. Audio über etwa 15 Sekunden wird auf den Anfang gekürzt.
480P, 768P oder 1080P.
Dieselbe Tabelle pro Sekunde wie MiniMax H3 Max: 7 Credits bei 480P, 15 bei 768P, 30 bei 1080P. Fünf Sekunden in 480P sind 35 Credits.
Ein sichtbarer Mund ist der Check, der zählt. Ein Gemälde kann sitzen — eine der Demos ist ein sprechendes Gemälde — aber der Mund muss im Frame sein.
Nein. Der andere Weg erfindet die gesprochene Zeile. Dieser Weg nutzt das Audio, das du schon hast.
Clips, die du auf einem bezahlten Plan generierst, gehören dir, kommerzielle Nutzung inklusive. Abbild und Soundtrack räumst du trotzdem selbst.
Mehr Wege zum Erstellen
Schnellere Entwürfe, Referenz-Sets oder Kamerafahrten — jeder davon ist ein anderer Input als Standbild plus dein Audio.
MiniMax H3 Max Turbo
Schnellere Entwürfe aus einem Satz oder einem Startframe, Ton schon in der Datei.
MiniMax H3 Max Referenz zu Video
Nimm Motiv, Stil oder Stimme in eine neue Szene mit — den Prompt schreibst du trotzdem.
MiniMax H3 Max Kamerasteuerung
Schreib die Kamerafahrt, oder wähl ein Preset. Für den Frame, nicht für den Mund.
Was eine Lip-Sync-Take hier kostet
480P kostet 7 Credits pro Sekunde, 768P kostet 15 und 1080P kostet 30 — dieselbe Tabelle wie MiniMax H3 Max. Ein 5-Sekunden-Lauf in 480P ist 35 Credits.
Genieße für kurze Zeit 30% OFF!
Gesicht und Ton hast du schon.
Leg Standbild und Audio in den Generator auf dieser Seite. Der Mund folgt diesem Soundtrack.

