ポートレートに音声を吹き込み、オーディオからリップシンク動画を作成できます。Cleepはトーキングフォトとリップシンクのモデルをひとつのインターフェースにまとめているため、元画像、音声トラック、求める動きの度合いに合ったアプローチを選べます。
鮮明なポートレートまたは元動画をアップロードし、対応する音声ファイルを追加するか、音声トラックを生成します。モデルを選び、書き出す前に結果をプレビューしましょう。正面を向いた顔、均一なライティング、はっきり見える口元、クリアな音声があれば、モデルは最も良い結果を出しやすくなります。
手元にある素材に応じて、トーキングフォトモデルとリップシンクモデルを使い分けましょう。対応する音声の長さ、対応言語、頭や体の動き、口の動きのタイミング、本人らしさの保持、解像度、処理時間を比較します。台本に名前、数字、専門用語が含まれる場合は、短い発音テストを行ってください。
プレゼンターの試作、ローカライズしたメッセージ、キャラクターテスト、教育用クリップ、SNSコンテンツなどを作成できます。人物の顔や声を使用する際は必ず許可を得て、必要に応じて合成メディアであることを明示し、最終出力のタイミング、発音、意図しない顔のアーティファクトを確認してください。
新規アカウントに含まれるクレジットで無料で始められ、生成前に各クリップのクレジット消費量を確認できます。有料プランでは毎月のクレジット、優先処理、より長い音声の上限が追加され、有料プランで作成したクリップは解説動画、広告、講座、SNSコンテンツで商用利用が可能です。
テキスト読み上げは 20 言語・50 種類以上の自然なボイスに対応し、リップシンクモデルは音声ファイル内のあらゆる言語のタイミングに追従します。自分の録音をアップロードするか、台本からボイスを生成し、OmniHuman でポートレートに、または PixVerse Lip Sync で既存の動画に同期させます。出力は音声が埋め込まれた MP4 です。