Nodaro ドキュメント
ドキュメントノードリファレンスモデルAI エージェント(MCP)開発者向けセルフホスティングリサーチ
動画

音声から動画

Wan 2.2 で、音声トラックに合わせて動く動画を生成します。音声、ポートレート、プロンプトを接続すると、30 クレジットから話す動画が得られます。

音声から動画(Speech to Video)ノードは、音声トラックに合わせて動く動画を生成します。使うのは、Wan 2.2 の、音声から動画を作るモデルです。音声と、必要に応じてポートレートとシーンを説明するプロンプトを接続すると、ノードは音声に合わせて話す動画を返します。

使いどころ

  • ナレーションに合わせて進む、動画のプレゼンテーションを作ります。
  • ポッドキャストやナレーションから、動きのあるコンテンツを作ります。
  • キャラクターのボイストラックから、話すキャラクターを動かします。

既存のポートレートやクリップに話させるには、リップシンク(Lip Sync)を使います。こちらは、選べるモデルも多くなります。

クイックスタート

ノードを追加する

キャンバス上で Tab を押し、動画 › アニメーションと演技 › 音声から動画を選びます。

音声とポートレートを接続する

明瞭な音声のオーディオノードを、オーディオに接続します。たとえば、テキストから音声(Text to Speech)です。ポートレートをポートレートに接続します。

シーンを説明する

設定パネルでプロンプトを書きます。たとえば「a presenter speaking in a bright studio」のように書きます。次に、解像度を選びます。

実行する

実行をクリックします。動画がノード上に表示されます。

ポートレートオーディオ撮影技法画像アップロードプレゼンターのポートレートテキストから音声ナレーションライティング柔らかなスタジオ光音声から動画720p
ポートレート、ナレーション、ライティングのピッカーをもとに、話す動画を生成します。

入力

入力接続できるノード説明
オーディオオーディオノード動画を動かす音声です。必須です。
ポートレート画像ノード話し手のリファレンス画像です。任意です。
プロンプトテキスト系ノードとピッカーシーンの説明です。設定パネルに入力することもできます。
撮影技法ライティング(Lighting)、レンズ(Lens)、カメラモーション(Camera Motion)などのルック系・カメラ系ピッカー各ピッカーの言い回しが、プロンプトに追加されます。

出力の動画は、生成された動画の URL です。

設定

設定説明
解像度480p、580p、720p のいずれかです。それぞれの料金は、リストに表示されます。
プロンプト音声の再生中に見せるシーンです。
ネガティブプロンプト動画から除きたいものです。
前後のテキストプロンプトの前後に必ず追加されるテキストです。プロンプトの前後のテキストを参照してください。

細かく制御するには、詳細設定を表示をクリックします。欄を空にしておくと、モデルのデフォルト値が使われます。

設定説明
シード(任意)実行を再現できるようにする固定の数値です。空欄の場合はランダムです。
フレーム数(16〜81)生成するフレームの数です。
フレームレート(8〜24)1 秒あたりのフレーム数です。
推論ステップ数(1〜50)ステップ数を増やすと細部が増えますが、時間がかかります。
ガイダンススケール(0〜20)動画がプロンプトにどれだけ忠実に従うかです。高いほど忠実になり、低いほどバリエーションが増えます。
シフト(0〜20)結果を微調整するための、モデルのパラメーターです。

クレジット

料金は解像度によって決まり、480p で 30 クレジット、580p で 50 クレジット、720p で 60 クレジットです。

ヒント

  • きれいな音声を使う:明瞭で、きちんと録音された声が、最良の結果につながります。
  • シーンを説明する:オーディオと一緒にプロンプトを渡すと、映像をより細かく制御できます。
  • プレビューは安く済ませる:手早いプレビューには 480p を、最終的な動画には 720p を使います。
  • 詳細設定は最後に変える:まずはデフォルトで始め、細部を増やしたい場合は、推論ステップ数を上げます。

よくある質問

最終更新

目次