步骤 01 — 上传你的输入
添加目标场景和人脸参考,让模型在匹配目标构图的同时保留关键的身份特征。
把“目标视频的动作与镜头”与“人脸素材的身份特征”合到一起,并用 ControlNet 做结构保留、用 Composer 做合成,输出更一致的短视频结果;由 WanPipeline 统一调度关键步骤,便于复现与迭代。






从目标场景和人脸参考到贴合模型的结果——全程在 Cleep.ai 内完成。
添加目标场景和人脸参考,让模型在匹配目标构图的同时保留关键的身份特征。
设置输出分辨率和时长,然后调节人脸参考对结果的引导强度。
点击生成,等待几分钟。Wan VACE 会生成你的结果。下载它,或更换输入再跑一个快速批次。

先上传目标视频作为动作与镜头的“骨架”,再上传清晰的人脸素材作为身份来源。系统在 WanPipeline 中先用 ControlNet 约束关键结构(如姿态与轮廓),再交给 Composer 进行多帧合成与细节融合。生成后建议先抽查 3–5 个关键帧,再决定是否调整强度、裁切或参考图。

适用于短视频口播:保留原口型与头部运动节奏,同时替换为指定身份形象。也适用于电商/品牌内容:在同一镜头脚本下批量生成不同人物版本,保持构图一致便于对比投放。对需要“动作一致、画面统一”的团队,结构保留能减少反复返工的时间成本。

先核对结构:肩颈比例、手部位置、头部转动是否与目标视频一致,这是 ControlNet 约束是否生效的直观信号。再核对身份:眉眼距离、鼻梁与嘴角形态在不同帧是否稳定,避免“越跑越像别人”。最后检查合成边缘:发际线、耳廓与光影过渡是否自然;若出现抖动,可降低合成强度或换更干净的人脸素材。

该方案把“结构约束”和“多帧合成”拆成可理解的两段:先用 ControlNet 把动作与构图锁住,再用 Composer 做身份与质感融合,减少一把梭导致的不可解释失败。通过 WanPipeline 记录关键步骤与输入输出,便于团队复现同一套参数并做小步迭代。对需要稳定交付的项目,这种可追溯流程更适合做版本管理与验收。

把目标视频与人脸素材上传后,先用默认参数跑一版作为基线,再按关键帧抽检结果微调结构强度与合成权重。需要更稳的结果时,优先更换更清晰、角度更接近的人脸素材,并保持目标视频人物无遮挡。现在即可在 Cleep AI 上开始一次可核查、可复跑的生成流程。
