# リップシンク

> ポートレートにオーディオの内容を話させたり、既存の動画の口の動きを新しい音声に合わせ直して吹き替えたりできます。Kling Avatar、OmniHuman、Seedance などに対応しています。

Source: https://nodaro.ai/ja/docs/nodes/video/lip-sync

**リップシンク**（Lip Sync）ノードは、オーディオトラックに合わせて、顔が話しているように動かします。ポートレートと音声トラックを渡すと、トーキングヘッド動画を作ります。動画と新しいオーディオを渡すと、動画の口の動きを新しい音声に合わせ直し、クリップを吹き替えます。モデルを選ぶと、そのモデルに必要な入力がノードに表示されます。

- Found in: Video › Animate & Perform
- Output: video
- Credits: 110–20000 per run, by model
- Models: 11
- API type: `lip-sync`

## 使いどころ
- 1 枚の写真から作るトーキングヘッド。たとえば、AI で生成したキャラクターにナレーションを付けたものです。
- 商品デモ用の、スポークスパーソンが話す動画。
- 動画の吹き替え版。翻訳した音声を、話者の口の動きに合わせ直します。
- OmniHuman 1.5 を使った、プロンプトで演出するパフォーマンス。たとえば、マイクに向かって歌う場面です。

音声と字幕を組み込んだ、脚本からの本格的なアバター動画には、[**AI アバター**（AI Avatar）](https://nodaro.ai/docs/nodes/video/ai-avatar)を使います。

## クイックスタート
### ノードを追加する
キャンバス上で Tab を押し、**動画 › アニメーションと演技 › リップシンク**を選びます。

### モデルを選ぶ
設定パネルを開き、**プロバイダー**でモデルを選びます。すると、そのモデルに必要な入力がノードに表示されます。**ポートレート**、**元動画**、またはその両方です。

### 顔と声を接続する
画像を**ポートレート**に、または動画を**元動画**に接続し、オーディオノードを**オーディオ**に接続します。オーディオノードには、たとえば[**テキストから音声**（Text to Speech）](https://nodaro.ai/docs/nodes/audio/text-to-speech)を使えます。

### 実行する
**実行**をクリックします。リップシンクした動画がノードに表示されます。

Workflow: ポートレートと、生成したセリフの音声から、トーキングヘッド動画ができます。

- テキスト → テキストから音声
- 画像生成 → リップシンク (ポートレート)
- テキストから音声 → リップシンク (オーディオ)

## ポートレートか動画か
| 接続するもの | ノードが作るもの | モデル |
| --- | --- | --- |
| **ポートレート**と**オーディオ** | 静止画から作る、新しいトーキングヘッド動画です。 | Kling Avatar、Kling Avatar Pro、InfiniTalk、OmniHuman 1.5、Seedance 2、Seedance 2 Fast、Seedance 2 Mini、Seedance 2.5、SadTalker |
| **元動画**と**オーディオ** | 同じ動画の口の動きを、新しいオーディオに合わせ直したものです。 | Volcengine Lip Sync、Sync Lipsync v3、Lipsync 2 Pro、HeyGen Lipsync Precision、LatentSync、Video-Retalking |
| どちらか一方と**オーディオ** | Wav2Lip は、ポートレートと動画のどちらも受け付けます。 | Wav2Lip |

## 入力
| 入力 | 接続できるノード | 説明 |
| --- | --- | --- |
| **オーディオ** | オーディオ系ノード | 話し声やナレーションです。すべてのモデルで必須です。 |
| **ポートレート** | 画像系ノード | 顔がはっきり写った写真です。ポートレート用のモデルで使います。 |
| **元動画** | 動画系ノード | 吹き替えるクリップです。吹き替え用のモデルで使います。 |

出力の**動画**は、リップシンクした動画の URL です。複数のノードが接続されている場合は、ノードのカード上で、使う画像、動画、オーディオを選べます。

## 設定
| 設定 | 説明 |
| --- | --- |
| **プロバイダー** | リップシンクのモデルです。デフォルトは **Kling Avatar** です。 |
| **解像度** | Kling Avatar、Kling Avatar Pro、InfiniTalk、Seedance の各モデルでは、480p か 720p で、デフォルトは 720p です。Seedance 2 では 1080p も選べます。OmniHuman 1.5 では 720p か 1080p で、デフォルトは 1080p です。 |
| **モーションプロンプト（任意）** | 上と同じモデルで使えます。頭の動きと表情の動きを指定します。たとえば「slight head nods」や「expressive eyebrows」です。OmniHuman 1.5 では、演技全体を演出します。 |
| **前後のテキスト** | モーションプロンプトの前後に必ず追加されるテキストです。[プロンプトの前後のテキスト](https://nodaro.ai/docs/concepts/prompt-pre-post-text)を参照してください。 |

### モデル別の設定
| モデル | 設定 |
| --- | --- |
| **OmniHuman 1.5** | **モーションプロンプト**で演技を演出します。たとえば「sing confidently into a microphone」です。**高速モード**は、品質を少し犠牲にして速度を上げます。**シード**を使うと、結果を再現できます。-1 はランダムです。人物、ペット、アニメを、どのアスペクト比でも動かせます。 |
| **HeyGen Lipsync Precision** | **長さの自動調整**（オン）は、出力の長さを新しいオーディオに合わせます。**音楽トラックを除去**（オフ）は、元の動画から BGM を取り除きます。**音声強調**（オフ）は、話し声を聞き取りやすくします。 |
| **Lipsync 2 Pro** | **同期モード**は、オーディオと動画の長さが違う場合の処理を決めます。**ループ**（デフォルト）、**バウンス**、**切り捨て**、**無音**、**リマップ**から選びます。**温度**（0〜1）は、リップシンクの表現の豊かさを決めます。デフォルトは 0.5 です。**アクティブな話者の検出**は、話している人に合わせて同期します。 |
| **Sync Lipsync v3** | **同期モード**（デフォルトは**切り捨て**）と、**アクティブな話者の検出**です。複数の人が映っている動画では、**アクティブな話者の検出**をオンにしてください。表現の豊かさは、モデルが自動で調整します。 |
| **Volcengine Lip Sync** | **モード**：正面を向いた話者 1 人なら、より高速な**ライト**を、複数の話者がいる複雑なシーンなら**ベーシック**を選びます。**ボーカルを分離（ノイズ除去）**は、オーディオからノイズを取り除きます。**シーン検出＋話者識別**（ベーシックのみ）は、シーンの切り替わりと、話している人を検出します。**オーディオの方が長い場合は動画をループ**（ライトのみ、デフォルトでオン）と**リバースループ（ピンポン）**で、動画より長いオーディオの扱いを決めます。**テンプレートの開始時間（秒）**は、動画のどの時点から口の動きを合わせ始めるかを決めます。出力はオーディオと同じ長さになります。動画のほうが長い場合はカットされ、短い場合はループします。 |

Seedance の各モデルは、8 を超える言語で、音素レベルのネイティブなリップシンクを行います。動作は[**動画生成**（Generate Video）](https://nodaro.ai/docs/nodes/video/generate-video)と同じで、オーディオはリファレンスオーディオとして送られます。

## モデル
| Model | Maker | Modes | Credits | Details |
| --- | --- | --- | --- | --- |
| [minimax-h3](https://nodaro.ai/docs/models/video/minimax-h3) | MiniMax | Image to video, Text to video | from 230 | MiniMax Hailuo 3 — premium multimodal tier: first/last frame + image/video/audio references, native audio, 2K (default) or 768P output, 4-15s per-second pricing. |
| [Kling Avatar Standard](https://nodaro.ai/docs/models/video/kling-avatar-standard) | Kuaishou | Lip sync | 280 | Lip-sync a still portrait to driving audio. Standard quality. |
| [Kling Avatar Pro](https://nodaro.ai/docs/models/video/kling-avatar-pro) | Kuaishou | Lip sync | 560 | Premium lip-sync — better mouth shape and timing. |
| [Seedance 2](https://nodaro.ai/docs/models/video/seedance-2) | Bytedance | Image to video, Text to video | from 230 | Seedance 2 — premium tier with native audio. Per-second pricing by resolution. |
| [Seedance 2 Fast](https://nodaro.ai/docs/models/video/seedance-2-fast) | Bytedance | Image to video, Text to video | from 180 | Cheaper / quicker Seedance 2 tier. |
| [Seedance 2 Mini](https://nodaro.ai/docs/models/video/seedance-2-mini) | Bytedance | Image to video, Text to video | from 120 | Budget Seedance 2 tier — 480p/720p only, per-second pricing by resolution. |
| [Seedance 2.5](https://nodaro.ai/docs/models/video/seedance-2-5) | Bytedance | Image to video, Text to video | from 340 | Seedance 2.5 — up to 30s in one shot, native audio, wide multimodal references. 480p/720p/1080p. |
| [OmniHuman 1.5](https://nodaro.ai/docs/models/video/omnihuman-1-5) | Bytedance | Lip sync | from 1020 | Premium prompt-directed talking avatar from a still image + audio. 720p / 1080p, up to 60s. People, pets, anime. |
| [InfiniTalk](https://nodaro.ai/docs/models/video/infinitalk) | InfiniTalk | Lip sync | from 110 | Audio-driven talking-head from a still image. 480p / 720p. |
| [Sync Lipsync v3](https://nodaro.ai/docs/models/video/sync-lipsync-v3) | Sync | Lip sync | from 1000 | Dub existing footage — re-syncs lips to a new audio track. Video input, billed per second. |
| [Volcengine Lip Sync](https://nodaro.ai/docs/models/video/volcengine-lip-sync) | Volcengine | Lip sync | from 300 | Video-to-video AI dubbing — re-syncs lips to a new vocal track. Multi-speaker (scene detection + speaker ID) in basic mode. Video input, billed per second. |

**プロバイダー**の一覧には、ほかにも吹き替え用の HeyGen Lipsync Precision と Lipsync 2 Pro があります。さらに、歌に最適な LatentSync、最も速くて安い Wav2Lip、顔の補正機能を内蔵した Video-Retalking、SadTalker もあります。Hailuo 3 (minimax-h3) は、**プロバイダー**の一覧ではなく、API から使えます。

## オーディオの長さ
| モデル | オーディオの最大の長さ |
| --- | --- |
| Kling Avatar、Kling Avatar Pro | 5 分 |
| Volcengine Lip Sync | 5 分 |
| HeyGen Lipsync Precision、Lipsync 2 Pro、Sync Lipsync v3 | 5 分（クレジット確保の上限） |
| OmniHuman 1.5 | 60 秒 |
| InfiniTalk | 15 秒 |
| Seedance 2 Fast | 1 本あたり 15.2 秒 |
| Seedance 2.5 | 1 本あたり 30 秒 |

Kling Avatar、InfiniTalk、OmniHuman 1.5、Volcengine Lip Sync では、上限を超えるオーディオは実行前にトリミングされます。HeyGen Lipsync Precision、Lipsync 2 Pro、Sync Lipsync v3 では、5 分はクレジットを確保する際の上限で、トリミングはされません。それより長いクリップでは、5 分の段階の料金が確保されます。Kling Avatar と Volcengine Lip Sync の長い実行には数十分かかることがあり、エディターは最大で約 1 時間待ちます。

## クレジット
ほとんどのモデルは秒単位で料金がかかり、次の長さの段階に切り上げられます。オーディオを接続すると、ノードがその長さを測るため、ノードのクレジット表示が更新されます。長さがわからない場合は、5 分の段階の料金が確保されます。実際の費用を超えた分のクレジットは、動画ができあがると返還されます。

| モデル | 15 秒 | 30 秒 | 1 分 | 2 分 | 5 分 |
| --- | ---: | ---: | ---: | ---: | ---: |
| Kling Avatar（720p） | 300 | 600 | 1,200 | 2,400 | 6,000 |
| Kling Avatar Pro（1080p） | 600 | 1,200 | 2,400 | 4,800 | 12,000 |
| OmniHuman 1.5 | 1,020 | 2,030 | 4,050 | — | — |
| Volcengine Lip Sync | 300 | 600 | 1,200 | 2,400 | 6,000 |
| HeyGen Lipsync Precision | 510 | 1,010 | 2,010 | 4,010 | 10,010 |
| Lipsync 2 Pro | 630 | 1,250 | 2,500 | 5,000 | 12,490 |
| Sync Lipsync v3 | 1,000 | 2,000 | 4,000 | 8,000 | 20,000 |

- **OmniHuman 1.5** が受け付けるオーディオは最大 60 秒なので、15 秒、30 秒、1 分の段階だけが適用されます。解像度によって料金は変わりません。
- **InfiniTalk** は、1 回の実行ごとの定額料金です。480p で 110 クレジット、720p で 420 クレジットです。
- **Seedance の各モデル**は、[動画生成](https://nodaro.ai/docs/nodes/video/generate-video)と同じく、秒単位で料金が決まります。

## ヒント
- **正面を向いた、鮮明なポートレートを使う**：解像度より顔の画質のほうが重要です。ぼやけた 4K の写真より、くっきりした 720p の写真のほうがうまくいきます。
- **先にオーディオをきれいにする**：音楽やノイズのない話し声が、最もよく同期します。声だけを取り出すには、[**音声抽出**（Voice Extractor）](https://nodaro.ai/docs/nodes/audio/voice-extractor)を使います。
- **小さな動きを加える**：「slight head nods」のようなモーションプロンプトを加えると、リアルさが増します。
- **複数の言語で吹き替える**：[**吹き替え**（Dubbing）](https://nodaro.ai/docs/nodes/audio/dubbing)や新しいナレーションで話し声を翻訳してから、吹き替え用のモデルで口の動きを合わせ直します。
- **短いクリップは安い**：料金は秒単位なので、短いセリフなら費用はわずかです。オーディオを接続したら、クレジット表示を確認してください。

## API から
API、SDK、MCP から Sync Lipsync v3 か Volcengine Lip Sync を呼び出すときは、出力の長さ（秒）を `audioDurationSec` で渡してください。渡さない場合、実行は 5 分の段階の料金で請求され、返還もありません。Sync Lipsync v3 では 20,000 クレジット、Volcengine Lip Sync では 6,000 クレジットです。エディターでは、オーディオの長さが自動で測られます。[単体のノードを実行する](https://nodaro.ai/docs/developers/api/nodes)を参照してください。

## Frequently asked questions

### リップシンクノードには何が必要ですか？

話し声の入ったオーディオトラックと、モデルに応じてポートレート画像か動画のどちらかが必要です。ポートレート用のモデルは、新しいトーキングヘッド動画を作ります。Sync Lipsync v3 や Volcengine Lip Sync などの吹き替え用のモデルは、既存の動画の口の動きを新しいオーディオに合わせ直します。

### リップシンクでは、どのモデルを選べばよいですか？

ポートレートで口の形が最もきれいなのは Kling Avatar Pro です。InfiniTalk では解像度を調整できます。OmniHuman 1.5 はモーションプロンプトに従い、人物、ペット、アニメを動かせます。既存の動画を吹き替えるなら、Volcengine Lip Sync が新しい世代のモデルの中で最も安く、複数の話者に対応する唯一のモデルです。

### リップシンクには何クレジットかかりますか？

ほとんどのモデルは、オーディオの秒数に応じて料金がかかり、15 秒、30 秒、1 分、2 分、5 分の長さの段階に切り上げられます。たとえば、Kling Avatar は 15 秒で 300 クレジット、Volcengine Lip Sync は 1 分で 1,200 クレジットです。InfiniTalk は、1 回の実行ごとの定額料金です。

### オーディオはどのくらいの長さまで使えますか？

ほとんどのモデルで最大 5 分です。InfiniTalk は 15 秒、OmniHuman 1.5 は 60 秒までで、これらのモデルではそれより長いオーディオはトリミングされます。

### テキストからトーキングヘッドを作るにはどうすればよいですか？

「テキストから音声」ノードを「オーディオ」入力に、ポートレートを「ポートレート」入力に接続します。すると、音声トラックに合わせて口が動きます。
