同じキャラを、新しいシーンでも崩さない
Image 1 に同じ顔と服装を渡し、新しい動きを書く。顔を揃えるのは狙いであって、見た目が完全に一致する保証ではありません。結果は参照と見比べてください。
このモデルの作例ギャラリーからです。上のジェネレーターと同じ参照から動画で、同じ2枚を2回出しています。
参照:Image 1 は手前の男性のソロ写真。Image 2 は奥の男性のソロ写真。二人は一緒に撮られていません。プロンプト:"The near man says flatly: 'Did you hear about H3 Max?' A beat of silence, wind moving across the lot. The far man's mouth pulls into a slow half-smile and he answers, warm and certain: 'Dude, I love it.' The near man exhales and shakes his head once, almost smiling. Native audio, lip-synced English dialogue, distant traffic hum, wind. No music, no subtitles, no camera movement." 結果は、それぞれの顔と服装をソロ写真から残したまま、二人を同じ生成シーンに置き、英語のセリフを口の動きに合わせた音声として、一度の生成で出します。

同じソロ写真2枚と、同じプロンプト。このモデルの作例ギャラリーに、2本目として載っています。画角もセリフの運びも少し違う。同じ参照とプロンプトでも、テイクごとにどこまで変わるかの目安になります。

被写体、キャラ、スタイルの参照。プロンプトでは Image 1、Image 2 と順に呼びます。
動きやカメラの参照。1本 2〜15秒、合計も15秒まで。プロンプトでは Video 1、Video 2。
声や音の参照。1本 2〜15秒。プロンプトでは Audio 1、Audio 2。3種はそれぞれ任意。混ぜて合計12ファイルまで。
画角の初期値は参照の形に合わせます。固定の画角を6種から選ぶこともできます。
このモデルのテキストから動画、画像から動画と同じ3つの解像度です。確認は480P。残す一本は768Pか1080P。
有料プランなら、同じ参照素材とプロンプトから複数本出せます。1本目はどのプランでも出せます。
画像最大9枚、動画3本(各2〜15秒)、音声3本(各2〜15秒)。合計12ファイルまで。3種のうち、どれかが必須というわけではありません。
種類と順番で呼ぶ。Image 1、Video 1、Audio 1。新しい動きを書く。モデルはファイル名ではなく、この順番で参照を読みます。
480P、768P、1080P。5〜15秒。画角の初期値は参照の形に合わせます。結果を見て、参照か一文を一つ変えて、もう一回。
白紙の一文から始める仕事ではない。手元の何かを、新しいカットへ渡す仕事です。
Image 1 に同じ顔と服装を渡し、新しい動きを書く。顔を揃えるのは狙いであって、見た目が完全に一致する保証ではありません。結果は参照と見比べてください。
パッケージや商品の参照が、色、形、ラベルを固定します。シーンの残りは変えてよい。
短い参照クリップが、パン、ドリー、回転といった動きを、新しい被写体と場所へ渡します。
参照音声が声の軸になる。プロンプト側で、そのシーンの新しいセリフを書きます。
キャラの画像、商品の画像、短い動きのクリップを同じプロンプトに混ぜる。3種合わせて最大12ファイル。
うまくいったシーンの参照はそのまま。プロンプトのセリフだけ、別言語に書き換える。
画像から動画は、静止画1枚をクリップの開始フレームとして使います。参照から動画は、画像・クリップ・音声を最大12ファイルまで、被写体・スタイル・動き・声の素材として読みます。どれも開始フレームである必要はなく、複数を同時に渡せます。
不要です。参照画像、参照動画、参照音声はそれぞれ任意。画像だけ、動画だけ、どの組み合わせでも出せます。合計が12ファイル以内なら問題ありません。
プロンプト本文で、種類と順番で呼んでください。Image 1、Image 2、Video 1、Audio 1。付けた順番と揃えます。モデルはファイル名ではなく、この呼び方で参照を読みます。
1本あたり 2〜15秒。動画の合計尺と、音声の合計尺は、それぞれ別に15秒までです。
480P、768P、1080P。尺は 5〜15秒。画角の初期値は参照の形に合わせます。固定の画角を6種から選ぶこともできます。
このモデルのテキストから動画、画像から動画と同じ秒単価です。480P は1秒 7クレジット、768P は15、1080P は30。5秒の480Pなら 35クレジットです。
揃えるのは狙いであって、保証ではありません。特に似せたい顔や、商品の細部は、実際の結果を参照と見比べてください。
上のジェネレーターで MiniMax H3 Max を選び、「参照画像から動画生成」タブを開きます。このページの「参照から1本出す」も、同じジェネレーターを開きます。
1秒あたり 480P は7クレジット、768P は15、1080P は30。このモデルのテキストから動画、画像から動画と同じ表です。5秒の480Pなら 35クレジット。
期間限定の30% OFFをお楽しみください!
画像・クリップ・音声を最大12ファイル。新しい動画が1本返る。参照の被写体、スタイル、動き、声が乗ります。