Docs do Nodaro
DocumentaçãoReferência de nósModelosAgentes de IA (MCP)DesenvolvedoresSelf-hostingPesquisa
Áudio

Alinhamento forçado

Marque no áudio o tempo de cada palavra de uma transcrição conhecida e receba o início e o fim de cada uma como dados, para karaokê, gráficos e legendas.

O nó Alinhamento forçado (Forced Alignment) marca no áudio o tempo de cada palavra de uma transcrição conhecida. Você fornece a gravação e o texto exato falado nela, e o nó retorna o tempo de início e de fim de cada palavra. O resultado é de dados, não de áudio: use-o para destaques no estilo karaokê, gráficos que reagem às palavras ou para conferir o ritmo de uma fala gerada.

Quando usar

  • Obter os tempos exatos de cada palavra para legendas, a partir de um roteiro que você já tem.
  • Criar um destaque de palavras no estilo karaokê que acompanha o áudio.
  • Sincronizar animações ou motion graphics com palavras específicas.
  • Sincronizar elementos visuais com a fala em uma composição de vídeo.
  • Conferir o timing do resultado de Texto para fala (Text to Speech) em relação ao ritmo que você espera.

Quando você não tem uma transcrição, use Transcrever (Transcribe). A saída Transcrição dele já traz os tempos de cada palavra com o ElevenLabs STT e o Incredibly Fast Whisper.

Início rápido

Adicione o nó

Pressione Tab no canvas e escolha Áudio › Transcrição › Alinhamento forçado.

Conecte o áudio

Conecte um nó de áudio à entrada Áudio.

Forneça a transcrição

Abra o painel de configurações e cole o texto exato falado em Transcrição, ou conecte um nó de texto à entrada Transcrição.

Execute

Clique em Executar no nó. Os tempos das palavras aparecem na saída Dados.

promptáudiotranscriçãoTextoO roteiroTexto para falaAlinhamento forçado
O mesmo roteiro é falado pelo Texto para fala e depois alinhado à fala, palavra por palavra.

Entradas e saída

EntradaAceitaO que faz
ÁudioNós de áudio, como Enviar áudio (Upload Audio), Áudio de referência (Reference Audio) e Texto para falaA gravação a alinhar.
TranscriçãoNós de texto, como Texto (Text)O texto falado, no lugar do campo Transcrição.

A saída, Dados, é uma lista de palavras com os tempos de início e de fim. Ela é de dados, não de áudio, então se conecta a nós que recebem texto ou dados.

Configurações

ConfiguraçãoO que faz
TranscriçãoO texto completo falado no áudio, só com as palavras. Ele precisa corresponder de perto à fala.
Texto antes e depoisTexto sempre adicionado antes e depois da transcrição. Fica oculto para quem usa o seu workflow como app. Veja Texto antes e depois do prompt.

Leia o resultado

A saída Dados tem esta forma:

[
  { "word": "Hello", "start": 0.0, "end": 0.35 },
  { "word": "world", "start": 0.38, "end": 0.72 }
]
CampoO que significa
wordA palavra alinhada.
startQuando a palavra começa, em segundos.
endQuando a palavra termina, em segundos.

Modelos

ModeloDesenvolvedorModosCréditosDetalhes
ElevenLabs Forced AlignmentElevenLabsAlinhamento forçado33Alinha uma transcrição existente ao áudio, com marcações de tempo por palavra.

Dicas

  • Faça a transcrição corresponder à fala. Diferenças entre o texto e o áudio deixam os tempos pouco confiáveis.
  • Limpe a transcrição. Remova muletas de linguagem, começos em falso e notas como [music], a menos que sejam realmente falados.
  • Use texto simples. Deixe de fora marcações de tempo, rótulos de falante e formatação. Escreva só as palavras, como são faladas.
  • Cubra a gravação inteira. Uma transcrição parcial só alinha a parte que ela cobre.
  • Limpe antes o áudio com ruído. Passe a gravação pelo Extrator de voz (Voice Extractor) para ter tempos mais precisos.
  • Espere menos precisão em falas difíceis. Fala muito rápida, sotaques fortes e falantes sobrepostos podem reduzir a precisão.

Pela API

A ferramenta MCP é forced_alignment. Veja as ferramentas MCP.

Perguntas frequentes

Última atualização

Nesta página