ステップ 01 — 入力をアップロード
ターゲットシーンと顔のリファレンスを追加すると、モデルがターゲットの構図に合わせながら主要なアイデンティティの手がかりを保持できます。
ターゲット画像と顔参照をアップロードし、Joint Mode TrainingとFace Control Trainingを前提にしたワークフローで、人物の雰囲気と顔の特徴を崩しにくい出力へ。CLIP Image Encoder(clip_vision_h)で参照を取り込み、確認ポイントを押さえて運用できます。






ターゲットシーンと顔のリファレンスから、モデルに忠実な結果まで — Cleep.ai 内で完結。
ターゲットシーンと顔のリファレンスを追加すると、モデルがターゲットの構図に合わせながら主要なアイデンティティの手がかりを保持できます。
出力解像度と再生時間を設定し、顔のリファレンスが結果をどれだけ強く導くかを調整します。
生成をクリックして数分待ちます。Wan VACE が結果を生成します。ダウンロードするか、入力を入れ替えて高速バッチを実行しましょう。

まずターゲット画像で全体の雰囲気(構図・服・質感)を固定し、次に顔参照で人物の特徴を寄せます。参照の取り込みはCLIP Image Encoder(clip_vision_h)を前提にし、同じ参照で再実行して差分を比較すると調整が速くなります。Joint Mode Trainingを使う場合は、両参照の影響が強く出すぎないかを1回目の出力で必ず確認します。

ECや広告では、同一人物の印象を保ったまま背景や衣装だけを差し替える用途に向きます。動画サムネやSNS用の量産では、ターゲット参照でトーンを揃え、顔参照で人物のブレを抑える運用が取りやすくなります。人物の寄せを強めたいときはFace Control Trainingを軸に、過度な固定化が起きていないかを並列に確認します。

最初に「顔の左右差・目線・口元の形」が参照と一致しすぎて不自然になっていないか、次に「肌の質感や照明」がターゲットの意図と合っているかを見ます。Joint Mode Trainingでは2つの参照が競合して、輪郭だけが強く残るケースがあるため、同条件で2〜3回出して安定性を確認します。問題が出た場合は参照画像をより近い画角に揃えるか、顔参照の影響を弱めて再実行します。

このツールはCLIP Image Encoderを使った参照理解(clip_vision_h)を前提に、ターゲット参照と顔参照の役割分担を作りやすいのが特徴です。Joint Mode Trainingで全体の整合を取りつつ、Face Control Trainingで顔の特徴を狙って寄せる、という切り分けができます。運用では「参照の画角・解像感・表情」を揃えるほど、再現性が上がります。

Cleep AI上でターゲット参照と顔参照を入れ替えながら、出力の差分を短いサイクルで確認できます。まずは同一条件で複数回実行し、安定している設定だけをテンプレート化するのが近道です。必要に応じてJoint Mode TrainingとFace Control Trainingの使い分けを固定し、チーム内の再現性を揃えます。
