AI アバター
HeyGen で話すアバター動画を作ります。アバターを選ぶか自分の画像を動かし、スクリプトとボイス、または録音したナレーションを渡します。
AI アバター(AI Avatar)ノードは、HeyGen で話すアバター動画を作ります。話し手には HeyGen のアバタールックか自分の画像を選び、話す内容には、選んだボイスで読み上げるスクリプトか、録音したナレーションを選びます。ノードは、アバターが話す動画を最大 4K で返します。
使いどころ
- すべての動画に同じプレゼンターが登場する、製品デモや解説動画。
- リストの受信者ごとにスクリプトを 1 つずつ用意した、パーソナライズされたビデオメッセージの大量作成。
- 複数の言語で話すスポークスパーソン動画。スクリプトを変更し、その言語に合ったボイスを選びます。
- 別のノードが書いたスクリプトから作る、ニュース風やトーキングヘッドの動画。
アバタールックを使い、スクリプトのない映画のようなシーンを作るには、シネマティックアバター(Cinematic Avatar)を使います。任意の顔にオーディオトラックを話させるには、リップシンク(Lip Sync)を使います。
クイックスタート
ノードを追加する
キャンバス上で Tab を押し、動画 › アニメーションと演技 › AI アバターを選びます。
話し手を選ぶ
ノードカードのアバターから始めるで、おすすめのルックをクリックするか、カタログを検索するか、すべて表示をクリックしてカタログ全体を開きます。代わりに自分のポートレートを動かすには、代わりに画像を使用をクリックし、画像をアップロードするか、URL を貼り付けるか、画像ノードを接続します。
ボイスとスクリプトを設定する
カード上のボイスをクリックして、ボイスを選びます。各ボイスはプレビューで試聴できます。スクリプトをカードに入力するか、テキストノードをスクリプト入力に接続します。カードには、文字数と推定の長さが表示されます。
実行する
ステータスバーにノードの準備ができたことが表示されたら、実行をクリックします。動画がノードに表示されます。
話し手と話し方
ソースは、映像の取得元を決めます。
| ソース | 渡すもの | 備考 |
|---|---|---|
| アバター(デフォルト) | カタログから選んだ HeyGen のアバタールック | Avatar IV または Avatar V エンジンで動かします。 |
| 画像 | 自分の画像。画像入力に接続するか、URL として貼り付けるか、アップロードします | アバターの作成やトレーニングは不要です。画像モードは独自のエンジンを使い、Avatar IV と同じように課金されます。 |
音声モードは、声の取得元を決めます。
| 音声モード | 渡すもの | 声 |
|---|---|---|
| テキスト(TTS)(デフォルト) | 最大 5,000 文字のスクリプトと、ボイスの選択画面で選んだボイス | 選んだボイスと速度による、HeyGen のテキスト読み上げです。 |
| 接続したオーディオ | オーディオ入力に接続したオーディオノード | 録音そのままで、テキスト読み上げは使いません。10 分(600 秒)を超えるオーディオはトリミングされ、結果にその旨が表示されます。 |
どちらのソースも両方の音声モードに対応しており、ボイス、背景、字幕、モーションの設定も共通です。
ノードカード
カード自体が設定の手順を案内するので、最初の実行で設定パネルが必要になることはほとんどありません。
| 状態 | カードの表示 |
|---|---|
| 空 | アバターから始める:おすすめのルックの列、カタログ全体を対象にした検索ボックス、すべて表示、代わりに画像を使用が表示されます。画像モードでは、画像から始めるにアップロード領域が表示され、アバターを選択で元に戻れます。 |
| 設定済み | エンジンのバッジと、アバターを変更または画像を置き換えが付いたポートレート。プレビューボタン付きのボイス。その場で編集でき、文字数と推定の長さが表示されるスクリプト。接続されたスクリプトは、接続元のノード名とともに読み取り専用で表示されます。音声モードが「接続したオーディオ」の場合は、代わりにオーディオの接続が表示されます。 |
| 生成済み | 動画です。実行すると、以前のバージョンに加えて新しいバージョンが作られます。新規実行は結果を非表示にし、最初からやり直せるように設定を再び表示します。「実行」をクリックするまで何も実行されず、「新規実行」をもう一度クリックすると結果が戻ります。 |
| 失敗 | ステータスバーに、エラーが赤で表示されます。以前のバージョンは表示されたままで、失敗の内容を示すバナーが付きます。 |
下部のステータスバーには、ノードを実行できるかどうか、足りないもの(たとえば「実行するにはボイスが必要です」)、どのエンジンと解像度でレンダリングされるかが常に表示されます。テキストモードには、スクリプトとボイスが必要です。「接続したオーディオ」には、オーディオの接続が必要です。アバターモードにはアバターが、画像モードには画像が必要です。接続された入力は、まだ何も出力していなくても、条件を満たしているものとみなされます。
アバターを選ぶ
すべて表示をクリックすると、アバターを選択ウィンドウが開きます。このウィンドウは、ルック単位ではなく、プレゼンター単位で整理されています。
- 検索:名前、ルック、シーンで検索します。Ctrl+K で検索ボックスにフォーカスします。
- ライブラリ:左側にあります。すべてのアバター、HeyGen アカウントに独自のルックがある場合の自分のルック、最近使用したものです。性別とシーンで絞り込めます。Avatar V フィルターをオンにすると、Avatar V のルックを持つプレゼンターだけが表示されます。
- カード:1 枚に 1 人のプレゼンターが、ルックの数とともに表示されます。さらに 24 件を読み込むで、次のページを表示します。
- 詳細列:選んだルックの拡大表示、そのプレゼンターのほかのルック、エンジン、向き、デフォルトのボイス、ボイスをプレビュー、このアバターを使用が表示されます。
ルックを選ぶと、ボイスをまだ選んでいない場合はそのルックのデフォルトのボイスが設定され、ルックの向きに合ったアスペクト比も設定されます。HeyGen がまだ作成中のルックには処理中…と表示され、準備ができるまで選べません。
カタログには数千のルックがあり、バックグラウンドで読み込まれます。目的のルックが表示されたら、すぐに選べます。
設定
| 設定 | 説明 |
|---|---|
| ソース | アバターまたは画像です。話し手と話し方を参照してください。 |
| 音声モード | テキスト(TTS)または接続したオーディオです。 |
| アバター | アバターモードで使う、HeyGen のアバタールックです。選択画面では、性別、ストックまたはカスタムのルック、Avatar V への対応で絞り込めます。 |
| 元画像 | 画像モードで動かす画像です。画像入力に接続するか、URL を貼り付けるか、アップロードします。 |
| ボイス | テキストモードでスクリプトを読み上げるボイスです。言語、アクセント、性別のフィルターとプレビューがあります。 |
| スクリプト | テキストモードでアバターが話す内容です。最大 5,000 文字です。 |
| 話す速度 | 話す速さで、0.5〜1.5 です。デフォルトは 1.0 です。 |
| エンジン | HeyGen Avatar IV(デフォルト)、またはプレミアムエンジンの HeyGen Avatar V です。アバターモードのみ。ルックが Avatar V に対応していない場合、パネルに警告が表示され、ノードは Avatar IV を使います。 |
| 解像度 | 720p(デフォルト)、1080p、4K のいずれかです。 |
| アスペクト比 | 16:9(デフォルト)または 9:16 です。 |
| 字幕を生成(SRT) | 動画と一緒に、字幕ファイルを作ります。 |
詳細設定
さらに細かく調整するには、詳細設定を表示をクリックします。
| 設定 | 説明 |
|---|---|
| ピッチと音量 | ボイスを調整します。ピッチは -50〜+50 です。テキストモードのみ。 |
| ロケール(任意) | ボイスの言語ロケールです。たとえば en-US です。テキストモードのみ。 |
| TTS エンジン | HeyGen のデフォルト、ElevenLabs、Fish のいずれかです。ElevenLabs ではモデル(v3(推奨)、Multilingual v2、Turbo v2.5、Flash v2.5)を選び、安定性、類似度、スタイル、スピーカーブーストを調整します。Fish では、安定性と類似度を調整します。テキストモードのみ。 |
| 背景 | アバターの後ろの背景を、なし、色、画像から選びます。 |
| 背景を削除 | アバター自体の背景を削除します。 |
| 字幕を動画に焼き込む | 字幕を映像に焼き込みます。字幕の生成もオンになります。 |
| 出力形式 | MP4 または WebM です。 |
| フィット | 塗りつぶしまたは全体を表示です。 |
| モーションプロンプト(任意)と表現力 | アバターの動きを説明し、表現力を低(デフォルト)、中、高から選びます。Avatar IV と画像モードで使えます。 |
クレジット
料金は、エンジン、解像度、動画の実際の長さによって決まります。Avatar V は Avatar IV より高く、解像度が高いほど料金も高くなります。画像モードは、Avatar IV と同じように課金されます。字幕に追加料金はかかりません。エディターでは、実行前に料金が表示されます。
- まず確保し、その後に実際の料金を請求:クレジットは、実行の開始時に確保されます。動画ができあがると、実際の長さの分だけを支払い、残りは返還されます。
- テキストモード:スクリプトの長さと話す速度から、確保する量を決めます。話す速度が遅いと動画が長くなるため、確保する量が少し多くなります。
- 接続したオーディオ:クリップを測定した長さから、確保する量を決めます。上限は 10 分です。
HeyGen が設定されていない場合
HeyGen のキーがないセルフホスティング環境では、アバターとボイスの選択画面が空になり、HeyGen のキーを追加するか Nodaro Cloud に接続するよう求める通知が表示されます。この状態で実行すると、heygen_not_configured エラーで失敗します。ほかの場所で作られたワークフローでは、そのアバターとボイスは引き続き表示されます。Nodaro Cloud への接続を参照してください。
ヒント
- 下書きは安く作る:まず Avatar IV の 720p で作り、最終版で 1080p や Avatar V に切り替えます。
- 先にボイスを試聴する:長いスクリプトをボイスに任せる前に、聞いて確かめます。
- 正確なテンポには「接続したオーディオ」を使う:録音や生成したナレーション(たとえば テキストから音声(Text to Speech)で作ったもの)を使うと、タイミングと声を完全にコントロールできます。
- SNS には縦型を使う:9:16 は TikTok、Instagram Reels、YouTube Shorts に適しています。
よくある質問
関連ページ
シネマティックアバター
リップシンク
テキストから音声
字幕を追加
最終更新