リップシンク
ポートレートにオーディオの内容を話させたり、既存の動画の口の動きを新しい音声に合わせ直して吹き替えたりできます。Kling Avatar、OmniHuman、Seedance などに対応しています。
リップシンク(Lip Sync)ノードは、オーディオトラックに合わせて、顔が話しているように動かします。ポートレートと音声トラックを渡すと、トーキングヘッド動画を作ります。動画と新しいオーディオを渡すと、動画の口の動きを新しい音声に合わせ直し、クリップを吹き替えます。モデルを選ぶと、そのモデルに必要な入力がノードに表示されます。
使いどころ
- 1 枚の写真から作るトーキングヘッド。たとえば、AI で生成したキャラクターにナレーションを付けたものです。
- 商品デモ用の、スポークスパーソンが話す動画。
- 動画の吹き替え版。翻訳した音声を、話者の口の動きに合わせ直します。
- OmniHuman 1.5 を使った、プロンプトで演出するパフォーマンス。たとえば、マイクに向かって歌う場面です。
音声と字幕を組み込んだ、脚本からの本格的なアバター動画には、AI アバター(AI Avatar)を使います。
クイックスタート
ノードを追加する
キャンバス上で Tab を押し、動画 › アニメーションと演技 › リップシンクを選びます。
モデルを選ぶ
設定パネルを開き、プロバイダーでモデルを選びます。すると、そのモデルに必要な入力がノードに表示されます。ポートレート、元動画、またはその両方です。
顔と声を接続する
画像をポートレートに、または動画を元動画に接続し、オーディオノードをオーディオに接続します。オーディオノードには、たとえばテキストから音声(Text to Speech)を使えます。
実行する
実行をクリックします。リップシンクした動画がノードに表示されます。
ポートレートか動画か
| 接続するもの | ノードが作るもの | モデル |
|---|---|---|
| ポートレートとオーディオ | 静止画から作る、新しいトーキングヘッド動画です。 | Kling Avatar、Kling Avatar Pro、InfiniTalk、OmniHuman 1.5、Seedance 2、Seedance 2 Fast、Seedance 2 Mini、Seedance 2.5、SadTalker |
| 元動画とオーディオ | 同じ動画の口の動きを、新しいオーディオに合わせ直したものです。 | Volcengine Lip Sync、Sync Lipsync v3、Lipsync 2 Pro、HeyGen Lipsync Precision、LatentSync、Video-Retalking |
| どちらか一方とオーディオ | Wav2Lip は、ポートレートと動画のどちらも受け付けます。 | Wav2Lip |
入力
| 入力 | 接続できるノード | 説明 |
|---|---|---|
| オーディオ | オーディオ系ノード | 話し声やナレーションです。すべてのモデルで必須です。 |
| ポートレート | 画像系ノード | 顔がはっきり写った写真です。ポートレート用のモデルで使います。 |
| 元動画 | 動画系ノード | 吹き替えるクリップです。吹き替え用のモデルで使います。 |
出力の動画は、リップシンクした動画の URL です。複数のノードが接続されている場合は、ノードのカード上で、使う画像、動画、オーディオを選べます。
設定
| 設定 | 説明 |
|---|---|
| プロバイダー | リップシンクのモデルです。デフォルトは Kling Avatar です。 |
| 解像度 | Kling Avatar、Kling Avatar Pro、InfiniTalk、Seedance の各モデルでは、480p か 720p で、デフォルトは 720p です。Seedance 2 では 1080p も選べます。OmniHuman 1.5 では 720p か 1080p で、デフォルトは 1080p です。 |
| モーションプロンプト(任意) | 上と同じモデルで使えます。頭の動きと表情の動きを指定します。たとえば「slight head nods」や「expressive eyebrows」です。OmniHuman 1.5 では、演技全体を演出します。 |
| 前後のテキスト | モーションプロンプトの前後に必ず追加されるテキストです。プロンプトの前後のテキストを参照してください。 |
モデル別の設定
| モデル | 設定 |
|---|---|
| OmniHuman 1.5 | モーションプロンプトで演技を演出します。たとえば「sing confidently into a microphone」です。高速モードは、品質を少し犠牲にして速度を上げます。シードを使うと、結果を再現できます。-1 はランダムです。人物、ペット、アニメを、どのアスペクト比でも動かせます。 |
| HeyGen Lipsync Precision | 長さの自動調整(オン)は、出力の長さを新しいオーディオに合わせます。音楽トラックを除去(オフ)は、元の動画から BGM を取り除きます。音声強調(オフ)は、話し声を聞き取りやすくします。 |
| Lipsync 2 Pro | 同期モードは、オーディオと動画の長さが違う場合の処理を決めます。ループ(デフォルト)、バウンス、切り捨て、無音、リマップから選びます。温度(0〜1)は、リップシンクの表現の豊かさを決めます。デフォルトは 0.5 です。アクティブな話者の検出は、話している人に合わせて同期します。 |
| Sync Lipsync v3 | 同期モード(デフォルトは切り捨て)と、アクティブな話者の検出です。複数の人が映っている動画では、アクティブな話者の検出をオンにしてください。表現の豊かさは、モデルが自動で調整します。 |
| Volcengine Lip Sync | モード:正面を向いた話者 1 人なら、より高速なライトを、複数の話者がいる複雑なシーンならベーシックを選びます。ボーカルを分離(ノイズ除去)は、オーディオからノイズを取り除きます。シーン検出+話者識別(ベーシックのみ)は、シーンの切り替わりと、話している人を検出します。オーディオの方が長い場合は動画をループ(ライトのみ、デフォルトでオン)とリバースループ(ピンポン)で、動画より長いオーディオの扱いを決めます。テンプレートの開始時間(秒)は、動画のどの時点から口の動きを合わせ始めるかを決めます。出力はオーディオと同じ長さになります。動画のほうが長い場合はカットされ、短い場合はループします。 |
Seedance の各モデルは、8 を超える言語で、音素レベルのネイティブなリップシンクを行います。動作は動画生成(Generate Video)と同じで、オーディオはリファレンスオーディオとして送られます。
モデル
| モデル | 開発元 | モード | クレジット | 詳細 |
|---|---|---|---|---|
| minimax-h3 | MiniMax | 画像から動画、テキストから動画 | 230 から | MiniMax Hailuo 3 はプレミアムなマルチモーダルのティアで、最初と最後のフレームに加えて画像/動画/オーディオのリファレンスを使え、ネイティブオーディオに対応し、2K(デフォルト)または 768P で出力し、長さは 4〜15 秒で料金は秒単位です。 |
| Kling Avatar Standard | Kuaishou | リップシンク | 280 | 静止画のポートレートを、元になるオーディオに合わせてリップシンクします。品質は標準です。 |
| Kling Avatar Pro | Kuaishou | リップシンク | 560 | プレミアムなリップシンクで、口の形とタイミングがより正確です。 |
| Seedance 2 | Bytedance | 画像から動画、テキストから動画 | 230 から | Seedance 2 は、ネイティブオーディオ付きのプレミアムなティアです。料金は解像度ごとの秒単位です。 |
| Seedance 2 Fast | Bytedance | 画像から動画、テキストから動画 | 180 から | Seedance 2 の、より安価で高速なティアです。 |
| Seedance 2 Mini | Bytedance | 画像から動画、テキストから動画 | 120 から | Seedance 2 の低価格なティアで、480p/720p のみに対応し、料金は解像度ごとの秒単位です。 |
| Seedance 2.5 | Bytedance | 画像から動画、テキストから動画 | 340 から | Seedance 2.5 は、1 ショットで最大 30 秒を生成でき、ネイティブオーディオと幅広いマルチモーダルのリファレンスに対応しています。解像度は 480p/720p/1080p です。 |
| OmniHuman 1.5 | Bytedance | リップシンク | 1020 から | 静止画とオーディオから、プロンプトで演出できるプレミアムな話すアバターを作ります。720p または 1080p で、長さは最大 60 秒です。人物、ペット、アニメに対応しています。 |
| InfiniTalk | InfiniTalk | リップシンク | 110 から | 静止画から、オーディオに合わせて話すトーキングヘッドを作ります。解像度は 480p または 720p です。 |
| Sync Lipsync v3 | Sync | リップシンク | 1000 から | 既存の映像を吹き替え、唇の動きを新しいオーディオトラックに合わせ直します。動画を入力し、1 秒ごとに課金されます。 |
| Volcengine Lip Sync | Volcengine | リップシンク | 300 から | 動画から動画への AI 吹き替えで、唇の動きを新しいボーカルトラックに合わせ直します。ベーシックモードでは複数話者に対応します(シーン検出と話者の識別)。動画を入力し、1 秒ごとに課金されます。 |
プロバイダーの一覧には、ほかにも吹き替え用の HeyGen Lipsync Precision と Lipsync 2 Pro があります。さらに、歌に最適な LatentSync、最も速くて安い Wav2Lip、顔の補正機能を内蔵した Video-Retalking、SadTalker もあります。Hailuo 3 (minimax-h3) は、プロバイダーの一覧ではなく、API から使えます。
オーディオの長さ
| モデル | オーディオの最大の長さ |
|---|---|
| Kling Avatar、Kling Avatar Pro | 5 分 |
| Volcengine Lip Sync | 5 分 |
| HeyGen Lipsync Precision、Lipsync 2 Pro、Sync Lipsync v3 | 5 分(クレジット確保の上限) |
| OmniHuman 1.5 | 60 秒 |
| InfiniTalk | 15 秒 |
| Seedance 2 Fast | 1 本あたり 15.2 秒 |
| Seedance 2.5 | 1 本あたり 30 秒 |
Kling Avatar、InfiniTalk、OmniHuman 1.5、Volcengine Lip Sync では、上限を超えるオーディオは実行前にトリミングされます。HeyGen Lipsync Precision、Lipsync 2 Pro、Sync Lipsync v3 では、5 分はクレジットを確保する際の上限で、トリミングはされません。それより長いクリップでは、5 分の段階の料金が確保されます。Kling Avatar と Volcengine Lip Sync の長い実行には数十分かかることがあり、エディターは最大で約 1 時間待ちます。
クレジット
ほとんどのモデルは秒単位で料金がかかり、次の長さの段階に切り上げられます。オーディオを接続すると、ノードがその長さを測るため、ノードのクレジット表示が更新されます。長さがわからない場合は、5 分の段階の料金が確保されます。実際の費用を超えた分のクレジットは、動画ができあがると返還されます。
| モデル | 15 秒 | 30 秒 | 1 分 | 2 分 | 5 分 |
|---|---|---|---|---|---|
| Kling Avatar(720p) | 300 | 600 | 1,200 | 2,400 | 6,000 |
| Kling Avatar Pro(1080p) | 600 | 1,200 | 2,400 | 4,800 | 12,000 |
| OmniHuman 1.5 | 1,020 | 2,030 | 4,050 | — | — |
| Volcengine Lip Sync | 300 | 600 | 1,200 | 2,400 | 6,000 |
| HeyGen Lipsync Precision | 510 | 1,010 | 2,010 | 4,010 | 10,010 |
| Lipsync 2 Pro | 630 | 1,250 | 2,500 | 5,000 | 12,490 |
| Sync Lipsync v3 | 1,000 | 2,000 | 4,000 | 8,000 | 20,000 |
- OmniHuman 1.5 が受け付けるオーディオは最大 60 秒なので、15 秒、30 秒、1 分の段階だけが適用されます。解像度によって料金は変わりません。
- InfiniTalk は、1 回の実行ごとの定額料金です。480p で 110 クレジット、720p で 420 クレジットです。
- Seedance の各モデルは、動画生成と同じく、秒単位で料金が決まります。
ヒント
- 正面を向いた、鮮明なポートレートを使う:解像度より顔の画質のほうが重要です。ぼやけた 4K の写真より、くっきりした 720p の写真のほうがうまくいきます。
- 先にオーディオをきれいにする:音楽やノイズのない話し声が、最もよく同期します。声だけを取り出すには、音声抽出(Voice Extractor)を使います。
- 小さな動きを加える:「slight head nods」のようなモーションプロンプトを加えると、リアルさが増します。
- 複数の言語で吹き替える:吹き替え(Dubbing)や新しいナレーションで話し声を翻訳してから、吹き替え用のモデルで口の動きを合わせ直します。
- 短いクリップは安い:料金は秒単位なので、短いセリフなら費用はわずかです。オーディオを接続したら、クレジット表示を確認してください。
API から
API、SDK、MCP から Sync Lipsync v3 か Volcengine Lip Sync を呼び出すときは、出力の長さ(秒)を audioDurationSec で渡してください。渡さない場合、実行は 5 分の段階の料金で請求され、返還もありません。Sync Lipsync v3 では 20,000 クレジット、Volcengine Lip Sync では 6,000 クレジットです。エディターでは、オーディオの長さが自動で測られます。単体のノードを実行するを参照してください。
よくある質問
関連ページ
AI アバター
テキストから音声
吹き替え
音声抽出
動画モデル
最終更新