Verification: 234cbc2215f1fb96

Wan VACE

ターゲット画像と顔参照をアップロードし、Joint Mode TrainingとFace Control Trainingを前提にしたワークフローで、人物の雰囲気と顔の特徴を崩しにくい出力へ。CLIP Image Encoder(clip_vision_h)で参照を取り込み、確認ポイントを押さえて運用できます。

Wan VACEWan VACEWan VACEWan VACEWan VACEWan VACE
使い方

Wan VACE で 3 ステップで画像を作成

ターゲットシーンと顔のリファレンスから、モデルに忠実な結果まで — Cleep.ai 内で完結。

ステップ 01 — 入力をアップロード

ターゲットシーンと顔のリファレンスを追加すると、モデルがターゲットの構図に合わせながら主要なアイデンティティの手がかりを保持できます。

ステップ 02 — 出力設定を選択

出力解像度と再生時間を設定し、顔のリファレンスが結果をどれだけ強く導くかを調整します。

ステップ 03 — 生成してダウンロード

生成をクリックして数分待ちます。Wan VACE が結果を生成します。ダウンロードするか、入力を入れ替えて高速バッチを実行しましょう。

生成してダウンロード
できること

Wan VACE の使い方

参照2枚で始める基本フロー

まずターゲット画像で全体の雰囲気(構図・服・質感)を固定し、次に顔参照で人物の特徴を寄せます。参照の取り込みはCLIP Image Encoder(clip_vision_h)を前提にし、同じ参照で再実行して差分を比較すると調整が速くなります。Joint Mode Trainingを使う場合は、両参照の影響が強く出すぎないかを1回目の出力で必ず確認します。

参照2枚で始める基本フロー

現場で使いやすい適用シーン

ECや広告では、同一人物の印象を保ったまま背景や衣装だけを差し替える用途に向きます。動画サムネやSNS用の量産では、ターゲット参照でトーンを揃え、顔参照で人物のブレを抑える運用が取りやすくなります。人物の寄せを強めたいときはFace Control Trainingを軸に、過度な固定化が起きていないかを並列に確認します。

現場で使いやすい適用シーン

出力の確認ポイント(破綻・寄り過ぎを防ぐ)

最初に「顔の左右差・目線・口元の形」が参照と一致しすぎて不自然になっていないか、次に「肌の質感や照明」がターゲットの意図と合っているかを見ます。Joint Mode Trainingでは2つの参照が競合して、輪郭だけが強く残るケースがあるため、同条件で2〜3回出して安定性を確認します。問題が出た場合は参照画像をより近い画角に揃えるか、顔参照の影響を弱めて再実行します。

出力の確認ポイント(破綻・寄り過ぎを防ぐ)

参照理解を支える設計:CLIPと学習モード

このツールはCLIP Image Encoderを使った参照理解(clip_vision_h)を前提に、ターゲット参照と顔参照の役割分担を作りやすいのが特徴です。Joint Mode Trainingで全体の整合を取りつつ、Face Control Trainingで顔の特徴を狙って寄せる、という切り分けができます。運用では「参照の画角・解像感・表情」を揃えるほど、再現性が上がります。

参照理解を支える設計:CLIPと学習モード

参照の一貫性を、最短の手順で検証する

Cleep AI上でターゲット参照と顔参照を入れ替えながら、出力の差分を短いサイクルで確認できます。まずは同一条件で複数回実行し、安定している設定だけをテンプレート化するのが近道です。必要に応じてJoint Mode TrainingとFace Control Trainingの使い分けを固定し、チーム内の再現性を揃えます。

参照の一貫性を、最短の手順で検証する
FAQ

よくある質問

2.2ワークフローでは何を最初に確認すべきですか?

最初は同じ参照・同じ条件で2〜3回出力し、顔の崩れとトーンの揺れが許容範囲かを見ます。揺れが大きい場合は参照の画角や表情を揃え、影響の強い側(多くは顔参照)を弱めて再実行します。

顔の入れ替え(フェイススワップ)用途に使えますか?

顔参照で特徴を寄せる運用は可能ですが、完全な入れ替えを保証する設計ではありません。自然さを優先する場合は、顔参照を近い角度・近い照明の素材にし、寄せ過ぎの兆候(不自然な輪郭固定)をチェックしてください。

2.2のggufはそのまま使えますか?

Ggufの可否は実行環境の対応状況に依存します。Cleep AI側の対応形式に合わせて選択し、参照取り込み(CLIP Image Encoder/clip_vision_h)が有効になっている構成で動作確認するのが確実です。

CLIP Image Encoder(clip_vision_h)は何のために必要ですか?

参照画像の特徴を安定して取り込むための前提要素です。ターゲット参照と顔参照の差分を比較しやすくなり、再実行時のブレの原因切り分けにも役立ちます。

Joint Mode TrainingとFace Control Trainingはどう使い分けますか?

全体の雰囲気や構図の整合を優先するならJoint Mode Training、顔の特徴を狙って寄せたいならFace Control Trainingを軸にします。両方を併用する場合は、最初の出力で「寄り過ぎ」と「競合(輪郭だけ強く残る)」が出ていないかを必ず確認します。

選ぶ前に知っておくべき制約はありますか?

参照画像の画角・表情・照明が離れているほど、出力が不安定になりやすい点です。まずは近い条件の参照で基準設定を作り、そこから差分を広げる運用が安全です。