Nodaro ドキュメント
ドキュメントノードリファレンスモデルAI エージェント(MCP)開発者向けセルフホスティングリサーチ
オーディオ

強制アライメント

内容がわかっている文字起こしの各単語をオーディオに合わせ、単語ごとの開始と終了の時間をデータとして取得します。カラオケ風のハイライト、タイミングに合わせたグラフィック、字幕に使えます。

強制アライメント(Forced Alignment)ノードは、内容がわかっている文字起こしの各単語が、オーディオのどこで話されているかを特定します。録音と、その中で話されている正確なテキストを渡すと、各単語の開始時間と終了時間を返します。結果はオーディオではなくデータです。カラオケ風のハイライトや、単語に反応するグラフィックに使ったり、生成した音声のペースを確認したりするのに使います。

使いどころ

  • 手元にある台本から、キャプションや字幕のための正確な単語のタイミングを取得します。
  • オーディオに合わせて単語がハイライトされる、カラオケ風の表示を作ります。
  • アニメーションやモーショングラフィックスのタイミングを、特定の単語に合わせます。
  • 動画のコンポジションで、映像の要素を話し声に同期させます。
  • テキストから音声(Text to Speech)の出力のタイミングが、想定したペースどおりかを確認します。

文字起こしがない場合は、代わりに文字起こし(Transcribe)を使ってください。ElevenLabs STT と Incredibly Fast Whisper を使う場合、そのノードの文字起こし出力には、すでに単語のタイミングが含まれています。

クイックスタート

ノードを追加する

キャンバス上で Tab を押し、オーディオ › 文字起こし › 強制アライメントを選びます。

オーディオを接続する

オーディオノードを、オーディオ入力に接続します。

文字起こしを渡す

設定パネルを開き、話されている正確なテキストを文字起こしに貼り付けます。または、テキストノードを文字起こし入力に接続します。

実行する

ノードの実行をクリックします。単語のタイミングが、データ出力に表示されます。

プロンプトオーディオ文字起こしテキスト台本テキストから音声強制アライメント
同じ台本をテキストから音声ノードで読み上げてから、その音声に対して単語ごとにタイミングを合わせます。

入力と出力

入力接続できるノード説明
オーディオオーディオアップロード(Upload Audio)、リファレンスオーディオ(Reference Audio)、テキストから音声などのオーディオノードアライメントする録音です。
文字起こしテキスト(Text)などのテキストノード話されているテキストで、文字起こしの欄の代わりに使われます。

出力のデータは、単語と、その開始時間と終了時間のリストです。オーディオではなくデータなので、テキストやデータを受け取るノードに接続します。

設定

設定説明
文字起こしオーディオで話されている全文を、飾りのない単語だけで書きます。話し声とよく一致している必要があります。
前後のテキスト文字起こしの前後に必ず追加されるテキストです。ワークフローをアプリとして使う人には表示されません。プロンプトの前後のテキストを参照してください。

結果の読み方

データ出力は、次のような形式です。

[
  { "word": "Hello", "start": 0.0, "end": 0.35 },
  { "word": "world", "start": 0.38, "end": 0.72 }
]
フィールド意味
wordアライメントされた単語です。
start単語が始まる時間で、単位は秒です。
end単語が終わる時間で、単位は秒です。

モデル

モデル開発元モードクレジット詳細
ElevenLabs Forced AlignmentElevenLabs強制アライメント30既存の文字起こしをオーディオに合わせ、単語単位のタイムスタンプを付けます。

ヒント

  • 文字起こしを話し声に合わせる:テキストとオーディオに違いがあると、タイミングが不正確になります。
  • 文字起こしを整える:実際に話されている場合を除き、フィラーワード、言い直し、[music] などのメモは削除します。
  • プレーンテキストを使う:タイムスタンプ、話者ラベル、書式は入れません。話されているとおりの言葉だけを書きます。
  • 録音全体をカバーする:文字起こしが一部分だけの場合、アライメントされるのはその部分だけです。
  • ノイズの多いオーディオは先にクリーンにする:録音を音声抽出(Voice Extractor)に通すと、タイミングがより正確になります。
  • 聞き取りにくい話し声では精度が下がる:とても速い話し方、強いなまり、話者の声の重なりがあると、精度が下がることがあります。

API から

MCP ツールは forced_alignment です。MCP ツールを参照してください。

よくある質問

最終更新

目次