Verification: 234cbc2215f1fb96

AI语音生成器 - 在线文字转语音

让人像开口说话,并根据音频生成口型同步视频。Cleep 将会说话的照片与口型同步模型整合到同一个界面,你可以根据源图片、配音音轨和期望的动态幅度选择最合适的方案。

如何制作会说话的照片或口型同步视频?

上传清晰的人像或源视频,然后添加支持的音频文件或生成一段配音。选择模型并在导出前预览结果。正面朝向的面部、均匀的光线、清晰可见的嘴唇和干净的音频,通常能为模型提供最理想的输入。

会说话的照片还是口型同步——我应该选择哪款模型?

根据你现有的素材,在会说话的照片模型和口型同步模型之间做出选择。对比支持的音频长度、支持的语言、头部和身体动作、口型时间对齐、身份保真度、分辨率以及处理时间。如果脚本中包含人名、数字或专业术语,建议先做一次简短的发音测试。

AI 语音和虚拟形象可以用在哪些场景?

制作主持人草稿、本地化信息、角色测试、教学短片和社交内容。使用他人面部或声音前务必获得授权,在适当情况下为合成媒体添加标注,并检查最终输出的时间对齐、发音以及是否存在意外的面部瑕疵。

会说话的照片生成器是免费的吗?

您可以使用每个新账户附带的积分免费开始,并在生成前查看每个片段所需的积分。付费方案提供每月积分、优先处理和更长的音频时长限制,付费方案下创建的片段可用于讲解视频、广告、课程和社交内容等商业用途。

支持哪些语言和声音?

文本转语音涵盖 20 种语言、50 多种自然声音,口型同步模型可跟随音频文件中任何语言的节奏。上传您自己的录音或根据脚本生成语音,然后使用 OmniHuman 同步到人像,或使用 PixVerse Lip Sync 同步到现有视频。输出为内嵌音频的 MP4 文件。

FAQ

会说话的照片和口型同步有什么区别?
会说话的照片是根据音轨让静态人像动起来——头部动作、表情和嘴唇(OmniHuman)。口型同步则是替换现有视频中的嘴部动作,使其与新音频匹配(PixVerse Lip Sync),例如将片段配音成另一种语言时。
可以使用哪些音频?
MP3 或 WAV 录音,或在 Cleep.ai 内从文本生成的语音。没有背景音乐的干净音频能带来最准确的口型节奏。
片段可以多长?
根据模型不同,会说话的照片片段通常最长 30 秒,口型同步片段最长一分钟。较长的脚本可以拆分为多个片段。
可以使用我自己或客户的面孔吗?
仅在获得许可的情况下。您必须拥有使用任何人的肖像和声音的权利,并在必要时对合成媒体进行标注。《内容安全政策》禁止冒充和欺骗性内容。
支持非英语语音吗?
支持。口型同步会跟随音频中的音素,与语言无关;文本转语音声音支持 20 种语言,包括西班牙语、德语、日语、阿拉伯语和印地语。