Nodaro ドキュメント
ドキュメントノードリファレンスモデルAI エージェント(MCP)開発者向けセルフホスティングリサーチ
動画

リップシンク

ポートレートにオーディオの内容を話させたり、既存の動画の口の動きを新しい音声に合わせ直して吹き替えたりできます。Kling Avatar、OmniHuman、Seedance などに対応しています。

リップシンク(Lip Sync)ノードは、オーディオトラックに合わせて、顔が話しているように動かします。ポートレートと音声トラックを渡すと、トーキングヘッド動画を作ります。動画と新しいオーディオを渡すと、動画の口の動きを新しい音声に合わせ直し、クリップを吹き替えます。モデルを選ぶと、そのモデルに必要な入力がノードに表示されます。

使いどころ

  • 1 枚の写真から作るトーキングヘッド。たとえば、AI で生成したキャラクターにナレーションを付けたものです。
  • 商品デモ用の、スポークスパーソンが話す動画。
  • 動画の吹き替え版。翻訳した音声を、話者の口の動きに合わせ直します。
  • OmniHuman 1.5 を使った、プロンプトで演出するパフォーマンス。たとえば、マイクに向かって歌う場面です。

音声と字幕を組み込んだ、脚本からの本格的なアバター動画には、AI アバター(AI Avatar)を使います。

クイックスタート

ノードを追加する

キャンバス上で Tab を押し、動画 › アニメーションと演技 › リップシンクを選びます。

モデルを選ぶ

設定パネルを開き、プロバイダーでモデルを選びます。すると、そのモデルに必要な入力がノードに表示されます。ポートレート、元動画、またはその両方です。

顔と声を接続する

画像をポートレートに、または動画を元動画に接続し、オーディオノードをオーディオに接続します。オーディオノードには、たとえばテキストから音声(Text to Speech)を使えます。

実行する

実行をクリックします。リップシンクした動画がノードに表示されます。

ポートレートオーディオ画像生成正面向きのポートレートテキスト話すセリフテキストから音声ElevenLabs v3リップシンクKling Avatar Pro
ポートレートと、生成したセリフの音声から、トーキングヘッド動画ができます。

ポートレートか動画か

接続するものノードが作るものモデル
ポートレートとオーディオ静止画から作る、新しいトーキングヘッド動画です。Kling Avatar、Kling Avatar Pro、InfiniTalk、OmniHuman 1.5、Seedance 2、Seedance 2 Fast、Seedance 2 Mini、Seedance 2.5、SadTalker
元動画とオーディオ同じ動画の口の動きを、新しいオーディオに合わせ直したものです。Volcengine Lip Sync、Sync Lipsync v3、Lipsync 2 Pro、HeyGen Lipsync Precision、LatentSync、Video-Retalking
どちらか一方とオーディオWav2Lip は、ポートレートと動画のどちらも受け付けます。Wav2Lip

入力

入力接続できるノード説明
オーディオオーディオ系ノード話し声やナレーションです。すべてのモデルで必須です。
ポートレート画像系ノード顔がはっきり写った写真です。ポートレート用のモデルで使います。
元動画動画系ノード吹き替えるクリップです。吹き替え用のモデルで使います。

出力の動画は、リップシンクした動画の URL です。複数のノードが接続されている場合は、ノードのカード上で、使う画像、動画、オーディオを選べます。

設定

設定説明
プロバイダーリップシンクのモデルです。デフォルトは Kling Avatar です。
解像度Kling Avatar、Kling Avatar Pro、InfiniTalk、Seedance の各モデルでは、480p か 720p で、デフォルトは 720p です。Seedance 2 では 1080p も選べます。OmniHuman 1.5 では 720p か 1080p で、デフォルトは 1080p です。
モーションプロンプト(任意)上と同じモデルで使えます。頭の動きと表情の動きを指定します。たとえば「slight head nods」や「expressive eyebrows」です。OmniHuman 1.5 では、演技全体を演出します。
前後のテキストモーションプロンプトの前後に必ず追加されるテキストです。プロンプトの前後のテキストを参照してください。

モデル別の設定

モデル設定
OmniHuman 1.5モーションプロンプトで演技を演出します。たとえば「sing confidently into a microphone」です。高速モードは、品質を少し犠牲にして速度を上げます。シードを使うと、結果を再現できます。-1 はランダムです。人物、ペット、アニメを、どのアスペクト比でも動かせます。
HeyGen Lipsync Precision長さの自動調整(オン)は、出力の長さを新しいオーディオに合わせます。音楽トラックを除去(オフ)は、元の動画から BGM を取り除きます。音声強調(オフ)は、話し声を聞き取りやすくします。
Lipsync 2 Pro同期モードは、オーディオと動画の長さが違う場合の処理を決めます。ループ(デフォルト)、バウンス、切り捨て、無音、リマップから選びます。温度(0〜1)は、リップシンクの表現の豊かさを決めます。デフォルトは 0.5 です。アクティブな話者の検出は、話している人に合わせて同期します。
Sync Lipsync v3同期モード(デフォルトは切り捨て)と、アクティブな話者の検出です。複数の人が映っている動画では、アクティブな話者の検出をオンにしてください。表現の豊かさは、モデルが自動で調整します。
Volcengine Lip Syncモード:正面を向いた話者 1 人なら、より高速なライトを、複数の話者がいる複雑なシーンならベーシックを選びます。ボーカルを分離(ノイズ除去)は、オーディオからノイズを取り除きます。シーン検出+話者識別(ベーシックのみ)は、シーンの切り替わりと、話している人を検出します。オーディオの方が長い場合は動画をループ(ライトのみ、デフォルトでオン)とリバースループ(ピンポン)で、動画より長いオーディオの扱いを決めます。テンプレートの開始時間(秒)は、動画のどの時点から口の動きを合わせ始めるかを決めます。出力はオーディオと同じ長さになります。動画のほうが長い場合はカットされ、短い場合はループします。

Seedance の各モデルは、8 を超える言語で、音素レベルのネイティブなリップシンクを行います。動作は動画生成(Generate Video)と同じで、オーディオはリファレンスオーディオとして送られます。

モデル

モデル開発元モードクレジット詳細
minimax-h3MiniMax画像から動画、テキストから動画230 からMiniMax Hailuo 3 はプレミアムなマルチモーダルのティアで、最初と最後のフレームに加えて画像/動画/オーディオのリファレンスを使え、ネイティブオーディオに対応し、2K(デフォルト)または 768P で出力し、長さは 4〜15 秒で料金は秒単位です。
Kling Avatar StandardKuaishouリップシンク280静止画のポートレートを、元になるオーディオに合わせてリップシンクします。品質は標準です。
Kling Avatar ProKuaishouリップシンク560プレミアムなリップシンクで、口の形とタイミングがより正確です。
Seedance 2Bytedance画像から動画、テキストから動画230 からSeedance 2 は、ネイティブオーディオ付きのプレミアムなティアです。料金は解像度ごとの秒単位です。
Seedance 2 FastBytedance画像から動画、テキストから動画180 からSeedance 2 の、より安価で高速なティアです。
Seedance 2 MiniBytedance画像から動画、テキストから動画120 からSeedance 2 の低価格なティアで、480p/720p のみに対応し、料金は解像度ごとの秒単位です。
Seedance 2.5Bytedance画像から動画、テキストから動画340 からSeedance 2.5 は、1 ショットで最大 30 秒を生成でき、ネイティブオーディオと幅広いマルチモーダルのリファレンスに対応しています。解像度は 480p/720p/1080p です。
OmniHuman 1.5Bytedanceリップシンク1020 から静止画とオーディオから、プロンプトで演出できるプレミアムな話すアバターを作ります。720p または 1080p で、長さは最大 60 秒です。人物、ペット、アニメに対応しています。
InfiniTalkInfiniTalkリップシンク110 から静止画から、オーディオに合わせて話すトーキングヘッドを作ります。解像度は 480p または 720p です。
Sync Lipsync v3Syncリップシンク1000 から既存の映像を吹き替え、唇の動きを新しいオーディオトラックに合わせ直します。動画を入力し、1 秒ごとに課金されます。
Volcengine Lip SyncVolcengineリップシンク300 から動画から動画への AI 吹き替えで、唇の動きを新しいボーカルトラックに合わせ直します。ベーシックモードでは複数話者に対応します(シーン検出と話者の識別)。動画を入力し、1 秒ごとに課金されます。

プロバイダーの一覧には、ほかにも吹き替え用の HeyGen Lipsync Precision と Lipsync 2 Pro があります。さらに、歌に最適な LatentSync、最も速くて安い Wav2Lip、顔の補正機能を内蔵した Video-Retalking、SadTalker もあります。Hailuo 3 (minimax-h3) は、プロバイダーの一覧ではなく、API から使えます。

オーディオの長さ

モデルオーディオの最大の長さ
Kling Avatar、Kling Avatar Pro5 分
Volcengine Lip Sync5 分
HeyGen Lipsync Precision、Lipsync 2 Pro、Sync Lipsync v35 分(クレジット確保の上限)
OmniHuman 1.560 秒
InfiniTalk15 秒
Seedance 2 Fast1 本あたり 15.2 秒
Seedance 2.51 本あたり 30 秒

Kling Avatar、InfiniTalk、OmniHuman 1.5、Volcengine Lip Sync では、上限を超えるオーディオは実行前にトリミングされます。HeyGen Lipsync Precision、Lipsync 2 Pro、Sync Lipsync v3 では、5 分はクレジットを確保する際の上限で、トリミングはされません。それより長いクリップでは、5 分の段階の料金が確保されます。Kling Avatar と Volcengine Lip Sync の長い実行には数十分かかることがあり、エディターは最大で約 1 時間待ちます。

クレジット

ほとんどのモデルは秒単位で料金がかかり、次の長さの段階に切り上げられます。オーディオを接続すると、ノードがその長さを測るため、ノードのクレジット表示が更新されます。長さがわからない場合は、5 分の段階の料金が確保されます。実際の費用を超えた分のクレジットは、動画ができあがると返還されます。

モデル15 秒30 秒1 分2 分5 分
Kling Avatar(720p)3006001,2002,4006,000
Kling Avatar Pro(1080p)6001,2002,4004,80012,000
OmniHuman 1.51,0202,0304,050——
Volcengine Lip Sync3006001,2002,4006,000
HeyGen Lipsync Precision5101,0102,0104,01010,010
Lipsync 2 Pro6301,2502,5005,00012,490
Sync Lipsync v31,0002,0004,0008,00020,000
  • OmniHuman 1.5 が受け付けるオーディオは最大 60 秒なので、15 秒、30 秒、1 分の段階だけが適用されます。解像度によって料金は変わりません。
  • InfiniTalk は、1 回の実行ごとの定額料金です。480p で 110 クレジット、720p で 420 クレジットです。
  • Seedance の各モデルは、動画生成と同じく、秒単位で料金が決まります。

ヒント

  • 正面を向いた、鮮明なポートレートを使う:解像度より顔の画質のほうが重要です。ぼやけた 4K の写真より、くっきりした 720p の写真のほうがうまくいきます。
  • 先にオーディオをきれいにする:音楽やノイズのない話し声が、最もよく同期します。声だけを取り出すには、音声抽出(Voice Extractor)を使います。
  • 小さな動きを加える:「slight head nods」のようなモーションプロンプトを加えると、リアルさが増します。
  • 複数の言語で吹き替える:吹き替え(Dubbing)や新しいナレーションで話し声を翻訳してから、吹き替え用のモデルで口の動きを合わせ直します。
  • 短いクリップは安い:料金は秒単位なので、短いセリフなら費用はわずかです。オーディオを接続したら、クレジット表示を確認してください。

API から

API、SDK、MCP から Sync Lipsync v3 か Volcengine Lip Sync を呼び出すときは、出力の長さ(秒)を audioDurationSec で渡してください。渡さない場合、実行は 5 分の段階の料金で請求され、返還もありません。Sync Lipsync v3 では 20,000 クレジット、Volcengine Lip Sync では 6,000 クレジットです。エディターでは、オーディオの長さが自動で測られます。単体のノードを実行するを参照してください。

よくある質問

最終更新

目次