ビルド対象を選び、セクションごとに内容を入力します。リファレンス素材は「存在」と「用途」だけを指定します(画像・動画・音声そのものはどこにも送信されません)。 「プロンプト生成」を押すと、入力内容のみをお手元のGemini APIキーで送信し、対象モデル用の英語プロンプトを生成します。 入力内容はこのブラウザ内にのみ保存されます(保存先は下の「保存先」で選べます)。
キーはこのブラウザのストレージ(下の「保存先」で選んだセッションストレージまたはローカルストレージ)にのみ保存され、このアプリのサーバーには一切送信されません。 生成時はブラウザから直接 Google の API に対して通信します。キーと保存先はすべてのビルド対象で共通です。 キーは Google AI Studio で無料発行できます。
「混雑しています(high demand)」と出て自動再試行でも失敗する場合は、時間をおくか別のモデルに切り替えてください。 生成されたプロンプトの形式や質が物足りない場合は、3.6 / 3.8 Flash を試してください。
動画に登場する人物・キャラクターを定義します。リファレンス素材の「用途」からここで定義した被写体を紐づけられます。 最終的なプロンプトでは "Subject 1" "Subject 2" のように登録順の連番で参照されるため、ここでの名前はあくまで人間が見分けるための呼び名です。
名前・呼び名のつけ方: 短く、他の被写体と重複しない一意な呼び名にしてください(例: 「ボーカル」「ギタリスト」「案内役の女性」)。 外見・服装・声質などの詳細情報は名前欄ではなく下の説明欄に書いてください。 またシーン描写・カメラワーク・その他の指示の欄で同じ人物に言及する際も、ここで付けた名前を一貫して使うと、Geminiが被写体と記述内容を正しく対応付けやすくなります。
場所、行動、照明、雰囲気、時間経過など。日本語で構いません(生成時に英語へ変換されます)。
アングル、動き、レンズ感、カット割りなど。空欄でも構いません。
口の動きを同期させたいテキストです。歌詞・セリフをそのまま入力してください。
背景音、環境音、BGMの雰囲気など。無音にしたい場合もその旨を書いてください。
ComfyUIの「MiniMax H3 リファレンスから動画へ」ノードの入力枠に合わせています。 素材そのものはアップロードせず、「あり/なし」のチェックのみを行います。用途と、必要なら紐づく被写体を選んでください。
動画に登場する人物・キャラクターを定義します。台詞の話者は登録順に S1, S2 … として参照されます。 名前は短く一意な呼び名にし、外見・服装・声質などは説明欄に書いてください。
映像の種類・質感・画風など、すべてのショットに共通する方針です。
使用する画像に「あり」をチェックしてください。画像の中身は Gemini に送られないため、写っている内容(人物の特徴・髪型・服装・ポーズ・背景・照明など)を書いておくと、プロンプトに正確に反映されます。 first_frame は最初のショット、last_frame は最後のショットに対応します。
ショットごとにシーン・動作・表情・カメラワーク・台詞を書きます。日本語で構いません。台詞は原文のままプロンプトに入ります。
声・環境音・効果音など、映像内で鳴っている音。鳴っていない音(「音楽なし」など)も書くと確実です。
映像の外から流れる音楽。空欄の場合は N/A として扱います。
使用する画像に「あり」をチェックし、用途を選んでください。タグはスロット番号どおりに <image1>〜<image10> となります。 画像の中身は Gemini に送られないため、引き継ぎたい要素(例: 「黒髪ボブ、ピアス」)や引き継がない要素を補足メモに書くと正確になります。
一般的な破綻(指の崩れ・ぼやけ・透かし文字など)は自動で含まれます。それ以外に避けたいものを書いてください。