인물 사진에 음성을 입혀 움직이게 하고, 오디오로 립싱크 영상을 만들어 보세요. Cleep은 토킹 포토와 립싱크 모델을 하나의 인터페이스에 결합해, 소스 이미지와 음성 트랙, 원하는 움직임 수준에 맞는 방식을 선택할 수 있습니다.
선명한 인물 사진이나 소스 영상을 업로드한 뒤, 지원되는 오디오 파일을 추가하거나 음성 트랙을 생성하세요. 모델을 선택하고 내보내기 전에 결과를 미리 확인합니다. 정면을 향한 얼굴, 고른 조명, 잘 보이는 입술, 깨끗한 오디오가 있으면 모델이 가장 좋은 결과를 낼 수 있습니다.
이미 가지고 있는 소스에 따라 토킹 포토 모델과 립싱크 모델 중에서 선택하세요. 허용되는 오디오 길이, 지원 언어, 머리와 몸의 움직임, 입술 타이밍, 인물 정체성 유지, 해상도, 처리 시간을 비교하면 됩니다. 스크립트에 이름, 숫자, 전문 용어가 포함되어 있다면 짧은 발음 테스트를 먼저 진행하세요.
프레젠터 초안, 현지화된 메시지, 캐릭터 테스트, 교육용 클립, 소셜 콘텐츠를 만들어 보세요. 타인의 얼굴이나 음성을 사용할 때는 반드시 허락을 받고, 필요한 경우 합성 미디어임을 표시하며, 최종 결과물의 타이밍, 발음, 의도치 않은 얼굴 아티팩트를 확인하세요.
모든 신규 계정에 포함된 크레딧으로 무료로 시작할 수 있으며, 생성 전에 각 클립의 크레딧 비용을 확인할 수 있습니다. 유료 플랜은 월간 크레딧, 우선 처리, 더 긴 오디오 한도를 제공하며, 유료 플랜에서 만든 클립은 설명 영상, 광고, 강의, 소셜 콘텐츠에 상업적으로 사용할 수 있습니다.
텍스트 음성 변환은 20개 언어, 50개 이상의 자연스러운 목소리를 지원하며, 립싱크 모델은 오디오 파일에 담긴 어떤 언어의 타이밍이든 따라갑니다. 직접 녹음한 파일을 업로드하거나 스크립트에서 목소리를 생성한 뒤, OmniHuman으로 인물 사진에 또는 PixVerse Lip Sync로 기존 영상에 동기화하세요. 결과물은 오디오가 포함된 MP4입니다.