# 音声から動画

> Wan 2.2 で、音声トラックに合わせて動く動画を生成します。音声、ポートレート、プロンプトを接続すると、30 クレジットから話す動画が得られます。

Source: https://nodaro.ai/ja/docs/nodes/video/speech-to-video

**音声から動画**（Speech to Video）ノードは、音声トラックに合わせて動く動画を生成します。使うのは、Wan 2.2 の、音声から動画を作るモデルです。音声と、必要に応じてポートレートとシーンを説明するプロンプトを接続すると、ノードは音声に合わせて話す動画を返します。

- Found in: Video › Animate & Perform
- Output: video
- API type: `speech-to-video`

## 使いどころ
- ナレーションに合わせて進む、動画のプレゼンテーションを作ります。
- ポッドキャストやナレーションから、動きのあるコンテンツを作ります。
- キャラクターのボイストラックから、話すキャラクターを動かします。

既存のポートレートやクリップに話させるには、[**リップシンク**（Lip Sync）](https://nodaro.ai/docs/nodes/video/lip-sync)を使います。こちらは、選べるモデルも多くなります。

## クイックスタート
### ノードを追加する
キャンバス上で Tab を押し、**動画 › アニメーションと演技 › 音声から動画**を選びます。

### 音声とポートレートを接続する
明瞭な音声のオーディオノードを、**オーディオ**に接続します。たとえば、[**テキストから音声**（Text to Speech）](https://nodaro.ai/docs/nodes/audio/text-to-speech)です。ポートレートを**ポートレート**に接続します。

### シーンを説明する
設定パネルで**プロンプト**を書きます。たとえば「a presenter speaking in a bright studio」のように書きます。次に、**解像度**を選びます。

### 実行する
**実行**をクリックします。動画がノード上に表示されます。

Workflow: ポートレート、ナレーション、ライティングのピッカーをもとに、話す動画を生成します。

- 画像アップロード → 音声から動画 (ポートレート)
- テキストから音声 → 音声から動画 (オーディオ)
- ライティング → 音声から動画 (撮影技法)

## 入力
| 入力 | 接続できるノード | 説明 |
| --- | --- | --- |
| **オーディオ** | オーディオノード | 動画を動かす音声です。必須です。 |
| **ポートレート** | 画像ノード | 話し手のリファレンス画像です。任意です。 |
| **プロンプト** | テキスト系ノードとピッカー | シーンの説明です。設定パネルに入力することもできます。 |
| **撮影技法** | **ライティング**（Lighting）、**レンズ**（Lens）、**カメラモーション**（Camera Motion）などのルック系・カメラ系ピッカー | 各ピッカーの言い回しが、プロンプトに追加されます。 |

出力の**動画**は、生成された動画の URL です。

## 設定
| 設定 | 説明 |
| --- | --- |
| **解像度** | **480p**、**580p**、**720p** のいずれかです。それぞれの料金は、リストに表示されます。 |
| **プロンプト** | 音声の再生中に見せるシーンです。 |
| **ネガティブプロンプト** | 動画から除きたいものです。 |
| **前後のテキスト** | プロンプトの前後に必ず追加されるテキストです。[プロンプトの前後のテキスト](https://nodaro.ai/docs/concepts/prompt-pre-post-text)を参照してください。 |

細かく制御するには、**詳細設定を表示**をクリックします。欄を空にしておくと、モデルのデフォルト値が使われます。

| 設定 | 説明 |
| --- | --- |
| **シード（任意）** | 実行を再現できるようにする固定の数値です。空欄の場合はランダムです。 |
| **フレーム数（16〜81）** | 生成するフレームの数です。 |
| **フレームレート（8〜24）** | 1 秒あたりのフレーム数です。 |
| **推論ステップ数（1〜50）** | ステップ数を増やすと細部が増えますが、時間がかかります。 |
| **ガイダンススケール（0〜20）** | 動画がプロンプトにどれだけ忠実に従うかです。高いほど忠実になり、低いほどバリエーションが増えます。 |
| **シフト（0〜20）** | 結果を微調整するための、モデルのパラメーターです。 |

## クレジット
料金は解像度によって決まり、480p で 30 クレジット、580p で 50 クレジット、720p で 60 クレジットです。

## ヒント
- **きれいな音声を使う**：明瞭で、きちんと録音された声が、最良の結果につながります。
- **シーンを説明する**：オーディオと一緒にプロンプトを渡すと、映像をより細かく制御できます。
- **プレビューは安く済ませる**：手早いプレビューには 480p を、最終的な動画には 720p を使います。
- **詳細設定は最後に変える**：まずはデフォルトで始め、細部を増やしたい場合は、**推論ステップ数**を上げます。

## Frequently asked questions

### 「音声から動画」ノードには何が必要ですか？

必須なのは、音声のオーディオトラックです。ポートレート画像と、シーンを説明するプロンプトもあると、モデルがより多くの手がかりを得られます。

### 「音声から動画」ノードには何クレジットかかりますか？

解像度によって異なります。1 回の実行につき、480p は 30 クレジット、580p は 50 クレジット、720p は 60 クレジットです。

### 「音声から動画」と「リップシンク」の違いは何ですか？

「音声から動画」は、プロンプトと任意のポートレートをもとに、音声に合わせた新しい動画を生成します。「リップシンク」は、既存のポートレートや動画にオーディオを話させるノードで、リップシンクのモデルを選べます。

### 最初にどの設定を変えればよいですか？

まずはデフォルトのまま始め、必要な場合にだけ調整してください。推論ステップ数を増やすと細部が増えますが、時間がかかります。ガイダンススケールを高くすると、プロンプトにより忠実になりますが、バリエーションは少なくなります。
