# ナレーション付き動画を合成

> 各音声テイクを対応する動画クリップに合わせ、ブロックをつないで 1 本のナレーション付き MP4 にします。短い音声は中央に配置され、長い音声ではクリップがスローになり、音声が切れることはありません。

Source: https://nodaro.ai/ja/docs/nodes/video/assemble-narrated-video

**ナレーション付き動画を合成**（Assemble Narrated Video）ノードは、ナレーション付き動画の仕上げのステップです。無音のクリップと音声テイクの組を順番どおりに受け取り、それぞれの音声をクリップに合わせてから、合わせたブロックをつないで 1 本の MP4 にします。このノードでは音声が主導します。どの音声テイクも最後まで再生され、映像に合わせて切られることはありません。

- Found in: Video › Cut & Assemble
- Output: video
- API type: `assemble-narrated-video`

## 使いどころ
- 台本のビートごとに無音のクリップ 1 本と音声テイク 1 つを用意して、ナレーション付きの解説動画を作ります。
- 台本の音声を映像とは別に収録する、製品のウォークスルー動画を作ります。
- 別々に作ったクリップと音声テイクを、タイムラインを手作業で編集せずに合わせます。

## 各ブロックの合わせ方
- **音声がクリップより短いか、同じ長さの場合**：クリップはそのまま再生されます。音声はブロックの中央に配置されて前後に無音が入り、音量を下げたクリップ自体のオーディオの上にミックスされます。
- **音声がクリップより長い場合**：クリップは、**最大スロー倍率**を上限として、音声の長さまでスローになります。それでも音声のほうが長い場合は、残りの音声の間、クリップの最後のフレームが静止して表示されるので、音声は必ず映像の上で最後まで流れます。
- **ブロックに音声がない場合**：ブロックは、元のオーディオのまま変更されずに使われます。
- **クリップにオーディオがない場合**：音声テイクがあれば、その音声だけが再生されます。音声テイクもなければ、ブロックに無音のトラックが付けられるので、最後の結合が失敗することはありません。

## クイックスタート
### ノードを追加する
キャンバス上で Tab を押し、**動画 › カットと結合 › ナレーション付き動画を合成**を選びます。

### クリップを接続する
動画クリップを、再生する順番で**クリップ**入力に接続します。クリップ 1 本ごとに、1 つのブロックができます。

### 音声テイクを接続する
音声テイクを、同じ順番で**音声**入力に接続します。1 つ目の音声テイクは 1 本目のクリップと、2 つ目の音声テイクは 2 本目のクリップと組になり、以降も同様です。

### 実行する
ノードの**実行**をクリックします。ナレーション付きの動画がノード上に表示されます。

Workflow: 台本の各ビートが無音のクリップと音声テイクになり、ナレーション付き動画を合成が、それぞれの音声をクリップに合わせてブロックを順番につなぎます。

- リスト → 動画生成 (プロンプト)
- リスト → テキストから音声 (プロンプト)
- 動画生成 → ナレーション付き動画を合成 (クリップ)
- テキストから音声 → ナレーション付き動画を合成 (音声)

## 入力
| 入力 | 接続できるノード | 説明 |
| --- | --- | --- |
| **クリップ** | **動画生成**（Generate Video）や**動画アップロード**（Upload Video）などの動画ノード | 順番に並んだ動画クリップで、ブロックごとに 1 本です。1〜60 本を接続します。 |
| **音声** | **テキストから音声**（Text to Speech）や**オーディオアップロード**（Upload Audio）などのオーディオノード | 順番に並んだ音声テイクで、ブロックごとに 1 つです。位置によってクリップと組になります。 |

組み合わせのルールは次のとおりです。

- **音声テイクがクリップより少なくてもかまいません**：音声テイクのない末尾のクリップは、変更されずにそのまま使われます。
- **音声テイクがクリップより多い場合は拒否されます**：実行が始まる前に、「N voice clips but only M video clips — connect at most one voice clip per video clip」というメッセージが表示されます。余分な音声テイクが黙って捨てられることはありません。

出力の**動画**は、すべてのブロックを順番につないだ 1 本の動画です。

## 設定
| 設定 | 説明 |
| --- | --- |
| **音声の音量（%）** | ミックス内の音声の音量で、0〜200 です。デフォルトは 100 です。 |
| **クリップのオーディオ音量（%）** | 音声の下に流れる、クリップ自体のオーディオの音量で、0〜200 です。デフォルトは 40 です。 |
| **最大スロー倍率** | 長い音声に合わせて、クリップをどこまでスローにできるかを 1〜2 倍で指定します。デフォルトは 1.5 倍です。この倍率を超える分は、代わりに最後のフレームが静止して表示されます。 |
| **各クリップの先頭をトリム（フレーム数、最初のクリップを除く）** | 最初のクリップを除くすべてのクリップの先頭から削除するフレーム数で、0〜120 です。デフォルトは 0 です。 |
| **各クリップの末尾をトリム（フレーム数、最後のクリップを除く）** | 最後のクリップを除くすべてのクリップの末尾から削除するフレーム数で、0〜120 です。デフォルトは 0 です。 |

これらのトリムは、[**動画を結合**（Combine Videos）](https://nodaro.ai/docs/nodes/video/combine-videos)のフレームのトリムと同じように働きます。削除されるのはブロック間のつなぎ目のフレームだけで、最初のブロックの先頭と最後のブロックの末尾がトリムされることはありません。

## クレジット
ナレーション付き動画を合成の料金は、動画の長さではなく、ブロック数によって実行ごとに決まります。基本料金に、6 ブロックごとに 1 段階ずつ加算されます。このノードは AI モデルを使わずに動画をローカルで処理し、実行前に料金を表示します。

## ヒント
- **クリップには話し声を入れない**：ナレーションはすべて音声トラックが担います。スローになったクリップで口が動いていると、その口の動きが本来の言葉と合わなくなります。
- **ボイスを 1 つに統一する**：すべてのブロックで同じボイスを使うと、ナレーターの声に一貫性が出ます。
- **単純なカットではトリムを 0 のままにする**：**各クリップの先頭をトリム**と**各クリップの末尾をトリム**は、クリップ同士が連続していて、つなぎ目を整える必要がある場合にだけ設定します。
- **背景の音は小さく保つ**：**クリップのオーディオ音量（%）**のデフォルト値 40 なら、クリップ自体のオーディオが音声とぶつかりません。

## API からの利用
MCP の `assemble_narrated_video` ツールと `POST /v1/assemble-narrated-video` は、1〜60 個のブロックのリストを受け取ります。各ブロックは動画 1 本と任意のオーディオトラック 1 つからなり、上記の音量、スロー、トリムの設定も一緒に指定できます。`video-explainer` コンテンツレシピは、このノードを使って台本から完成した動画までを作ります。[MCP ツール](https://nodaro.ai/docs/mcp/tools)と[コンテンツレシピ](https://nodaro.ai/docs/mcp/recipes)を参照してください。

## Frequently asked questions

### 音声テイクがクリップより長い場合はどうなりますか？

クリップが音声に合わせてスローになります。スローにできるのは「最大スロー倍率」までで、デフォルトは 1.5 倍です。それでも音声のほうが長い場合は、音声が終わるまでクリップの最後のフレームが静止して表示されます。

### 音声のないブロックを作れますか？

はい。音声テイクをクリップより少なく接続すると、末尾の余ったクリップは、元のオーディオのまま変更されずに使われます。

### 「voice clips but only video clips」というメッセージで実行が拒否されるのはなぜですか？

動画クリップより多くの音声テイクを接続しています。各クリップに対応できる音声テイクは 1 つまでなので、余分な音声テイクを削除するか、クリップを追加してください。

### 1 回の実行で合成できるブロックはいくつですか？

1〜60 ブロックです。各ブロックは、動画クリップ 1 本と、任意の音声テイク 1 つで構成されます。

### クリップに話し声を入れるべきですか？

いいえ。ナレーションは音声トラックが担うため、クリップには話し声を入れないでください。スローになったクリップで口が動いていると、その口の動きが本来の言葉と合わなくなります。
