オーディオ
強制アライメント
内容がわかっている文字起こしの各単語をオーディオに合わせ、単語ごとの開始と終了の時間をデータとして取得します。カラオケ風のハイライト、タイミングに合わせたグラフィック、字幕に使えます。
強制アライメント(Forced Alignment)ノードは、内容がわかっている文字起こしの各単語が、オーディオのどこで話されているかを特定します。録音と、その中で話されている正確なテキストを渡すと、各単語の開始時間と終了時間を返します。結果はオーディオではなくデータです。カラオケ風のハイライトや、単語に反応するグラフィックに使ったり、生成した音声のペースを確認したりするのに使います。
使いどころ
- 手元にある台本から、キャプションや字幕のための正確な単語のタイミングを取得します。
- オーディオに合わせて単語がハイライトされる、カラオケ風の表示を作ります。
- アニメーションやモーショングラフィックスのタイミングを、特定の単語に合わせます。
- 動画のコンポジションで、映像の要素を話し声に同期させます。
- テキストから音声(Text to Speech)の出力のタイミングが、想定したペースどおりかを確認します。
文字起こしがない場合は、代わりに文字起こし(Transcribe)を使ってください。ElevenLabs STT と Incredibly Fast Whisper を使う場合、そのノードの文字起こし出力には、すでに単語のタイミングが含まれています。
クイックスタート
ノードを追加する
キャンバス上で Tab を押し、オーディオ › 文字起こし › 強制アライメントを選びます。
オーディオを接続する
オーディオノードを、オーディオ入力に接続します。
文字起こしを渡す
設定パネルを開き、話されている正確なテキストを文字起こしに貼り付けます。または、テキストノードを文字起こし入力に接続します。
実行する
ノードの実行をクリックします。単語のタイミングが、データ出力に表示されます。
入力と出力
| 入力 | 接続できるノード | 説明 |
|---|---|---|
| オーディオ | オーディオアップロード(Upload Audio)、リファレンスオーディオ(Reference Audio)、テキストから音声などのオーディオノード | アライメントする録音です。 |
| 文字起こし | テキスト(Text)などのテキストノード | 話されているテキストで、文字起こしの欄の代わりに使われます。 |
出力のデータは、単語と、その開始時間と終了時間のリストです。オーディオではなくデータなので、テキストやデータを受け取るノードに接続します。
設定
| 設定 | 説明 |
|---|---|
| 文字起こし | オーディオで話されている全文を、飾りのない単語だけで書きます。話し声とよく一致している必要があります。 |
| 前後のテキスト | 文字起こしの前後に必ず追加されるテキストです。ワークフローをアプリとして使う人には表示されません。プロンプトの前後のテキストを参照してください。 |
結果の読み方
データ出力は、次のような形式です。
[
{ "word": "Hello", "start": 0.0, "end": 0.35 },
{ "word": "world", "start": 0.38, "end": 0.72 }
]| フィールド | 意味 |
|---|---|
word | アライメントされた単語です。 |
start | 単語が始まる時間で、単位は秒です。 |
end | 単語が終わる時間で、単位は秒です。 |
モデル
| モデル | 開発元 | モード | クレジット | 詳細 |
|---|---|---|---|---|
| ElevenLabs Forced Alignment | ElevenLabs | 強制アライメント | 30 | 既存の文字起こしをオーディオに合わせ、単語単位のタイムスタンプを付けます。 |
ヒント
- 文字起こしを話し声に合わせる:テキストとオーディオに違いがあると、タイミングが不正確になります。
- 文字起こしを整える:実際に話されている場合を除き、フィラーワード、言い直し、
[music]などのメモは削除します。 - プレーンテキストを使う:タイムスタンプ、話者ラベル、書式は入れません。話されているとおりの言葉だけを書きます。
- 録音全体をカバーする:文字起こしが一部分だけの場合、アライメントされるのはその部分だけです。
- ノイズの多いオーディオは先にクリーンにする:録音を音声抽出(Voice Extractor)に通すと、タイミングがより正確になります。
- 聞き取りにくい話し声では精度が下がる:とても速い話し方、強いなまり、話者の声の重なりがあると、精度が下がることがあります。
API から
MCP ツールは forced_alignment です。MCP ツールを参照してください。
よくある質問
関連ページ
文字起こし
ElevenLabs STT または Whisper で、オーディオや動画の音声をテキストにします。字幕用の単語のタイミング、話者のラベル、音楽や笑い声のタグも取得できます。
テキストから音声
ElevenLabs v3、Turbo v2.5、Multilingual v2 で、テキストを自然な音声にします。ボイスを選び、オーディオタグで感情を加え、最大 46 の言語で読み上げます。
音声抽出
録音から背景ノイズ、音楽、その他の音を取り除き、声だけを残します。文字起こし、リップシンク、吹き替え、声の変換の前に、オーディオをクリーンにします。
字幕を追加
動画を文字起こしして字幕を焼き込みます。シンプルな静的字幕か、単語ごとに動く 5 種類のアニメーションスタイルから選べ、フォント、縁取り、位置、1 行の単語数も調整できます。
ElevenLabs Forced Alignment
ElevenLabs Forced Alignment は、Nodaro で使える ElevenLabs のオーディオモデルです。対応するモードは強制アライメントです。1 回の実行は 30 クレジットからです。
最終更新