動画
音声から動画
Wan 2.2 で、音声トラックに合わせて動く動画を生成します。音声、ポートレート、プロンプトを接続すると、30 クレジットから話す動画が得られます。
音声から動画(Speech to Video)ノードは、音声トラックに合わせて動く動画を生成します。使うのは、Wan 2.2 の、音声から動画を作るモデルです。音声と、必要に応じてポートレートとシーンを説明するプロンプトを接続すると、ノードは音声に合わせて話す動画を返します。
使いどころ
- ナレーションに合わせて進む、動画のプレゼンテーションを作ります。
- ポッドキャストやナレーションから、動きのあるコンテンツを作ります。
- キャラクターのボイストラックから、話すキャラクターを動かします。
既存のポートレートやクリップに話させるには、リップシンク(Lip Sync)を使います。こちらは、選べるモデルも多くなります。
クイックスタート
ノードを追加する
キャンバス上で Tab を押し、動画 › アニメーションと演技 › 音声から動画を選びます。
音声とポートレートを接続する
明瞭な音声のオーディオノードを、オーディオに接続します。たとえば、テキストから音声(Text to Speech)です。ポートレートをポートレートに接続します。
シーンを説明する
設定パネルでプロンプトを書きます。たとえば「a presenter speaking in a bright studio」のように書きます。次に、解像度を選びます。
実行する
実行をクリックします。動画がノード上に表示されます。
入力
| 入力 | 接続できるノード | 説明 |
|---|---|---|
| オーディオ | オーディオノード | 動画を動かす音声です。必須です。 |
| ポートレート | 画像ノード | 話し手のリファレンス画像です。任意です。 |
| プロンプト | テキスト系ノードとピッカー | シーンの説明です。設定パネルに入力することもできます。 |
| 撮影技法 | ライティング(Lighting)、レンズ(Lens)、カメラモーション(Camera Motion)などのルック系・カメラ系ピッカー | 各ピッカーの言い回しが、プロンプトに追加されます。 |
出力の動画は、生成された動画の URL です。
設定
| 設定 | 説明 |
|---|---|
| 解像度 | 480p、580p、720p のいずれかです。それぞれの料金は、リストに表示されます。 |
| プロンプト | 音声の再生中に見せるシーンです。 |
| ネガティブプロンプト | 動画から除きたいものです。 |
| 前後のテキスト | プロンプトの前後に必ず追加されるテキストです。プロンプトの前後のテキストを参照してください。 |
細かく制御するには、詳細設定を表示をクリックします。欄を空にしておくと、モデルのデフォルト値が使われます。
| 設定 | 説明 |
|---|---|
| シード(任意) | 実行を再現できるようにする固定の数値です。空欄の場合はランダムです。 |
| フレーム数(16〜81) | 生成するフレームの数です。 |
| フレームレート(8〜24) | 1 秒あたりのフレーム数です。 |
| 推論ステップ数(1〜50) | ステップ数を増やすと細部が増えますが、時間がかかります。 |
| ガイダンススケール(0〜20) | 動画がプロンプトにどれだけ忠実に従うかです。高いほど忠実になり、低いほどバリエーションが増えます。 |
| シフト(0〜20) | 結果を微調整するための、モデルのパラメーターです。 |
クレジット
料金は解像度によって決まり、480p で 30 クレジット、580p で 50 クレジット、720p で 60 クレジットです。
ヒント
- きれいな音声を使う:明瞭で、きちんと録音された声が、最良の結果につながります。
- シーンを説明する:オーディオと一緒にプロンプトを渡すと、映像をより細かく制御できます。
- プレビューは安く済ませる:手早いプレビューには 480p を、最終的な動画には 720p を使います。
- 詳細設定は最後に変える:まずはデフォルトで始め、細部を増やしたい場合は、推論ステップ数を上げます。
よくある質問
関連ページ
リップシンク
ポートレートにオーディオの内容を話させたり、既存の動画の口の動きを新しい音声に合わせ直して吹き替えたりできます。Kling Avatar、OmniHuman、Seedance などに対応しています。
AI アバター
HeyGen で話すアバター動画を作ります。アバターを選ぶか自分の画像を動かし、スクリプトとボイス、または録音したナレーションを渡します。
テキストから音声
ElevenLabs v3、Turbo v2.5、Multilingual v2 で、テキストを自然な音声にします。ボイスを選び、オーディオタグで感情を加え、最大 46 の言語で読み上げます。
カメラモーション
AI 動画モデルに、カメラの動き方を指示します。ドリー・イン、オービット・レフト、クレーン・アップなど 66 種類のカメラモーションから 1 つを選ぶと、Nodaro が検証済みの表現を追加します。
最終更新