让人像开口说话,并根据音频生成口型同步视频。Cleep 将会说话的照片与口型同步模型整合到同一个界面,你可以根据源图片、配音音轨和期望的动态幅度选择最合适的方案。
上传清晰的人像或源视频,然后添加支持的音频文件或生成一段配音。选择模型并在导出前预览结果。正面朝向的面部、均匀的光线、清晰可见的嘴唇和干净的音频,通常能为模型提供最理想的输入。
根据你现有的素材,在会说话的照片模型和口型同步模型之间做出选择。对比支持的音频长度、支持的语言、头部和身体动作、口型时间对齐、身份保真度、分辨率以及处理时间。如果脚本中包含人名、数字或专业术语,建议先做一次简短的发音测试。
制作主持人草稿、本地化信息、角色测试、教学短片和社交内容。使用他人面部或声音前务必获得授权,在适当情况下为合成媒体添加标注,并检查最终输出的时间对齐、发音以及是否存在意外的面部瑕疵。
您可以使用每个新账户附带的积分免费开始,并在生成前查看每个片段所需的积分。付费方案提供每月积分、优先处理和更长的音频时长限制,付费方案下创建的片段可用于讲解视频、广告、课程和社交内容等商业用途。
文本转语音涵盖 20 种语言、50 多种自然声音,口型同步模型可跟随音频文件中任何语言的节奏。上传您自己的录音或根据脚本生成语音,然后使用 OmniHuman 同步到人像,或使用 PixVerse Lip Sync 同步到现有视频。输出为内嵌音频的 MP4 文件。