Alinhamento forçado
Marque no áudio o tempo de cada palavra de uma transcrição conhecida e receba o início e o fim de cada uma como dados, para karaokê, gráficos e legendas.
O nó Alinhamento forçado (Forced Alignment) marca no áudio o tempo de cada palavra de uma transcrição conhecida. Você fornece a gravação e o texto exato falado nela, e o nó retorna o tempo de início e de fim de cada palavra. O resultado é de dados, não de áudio: use-o para destaques no estilo karaokê, gráficos que reagem às palavras ou para conferir o ritmo de uma fala gerada.
Quando usar
- Obter os tempos exatos de cada palavra para legendas, a partir de um roteiro que você já tem.
- Criar um destaque de palavras no estilo karaokê que acompanha o áudio.
- Sincronizar animações ou motion graphics com palavras específicas.
- Sincronizar elementos visuais com a fala em uma composição de vídeo.
- Conferir o timing do resultado de Texto para fala (Text to Speech) em relação ao ritmo que você espera.
Quando você não tem uma transcrição, use Transcrever (Transcribe). A saída Transcrição dele já traz os tempos de cada palavra com o ElevenLabs STT e o Incredibly Fast Whisper.
Início rápido
Adicione o nó
Pressione Tab no canvas e escolha Áudio › Transcrição › Alinhamento forçado.
Conecte o áudio
Conecte um nó de áudio à entrada Áudio.
Forneça a transcrição
Abra o painel de configurações e cole o texto exato falado em Transcrição, ou conecte um nó de texto à entrada Transcrição.
Execute
Clique em Executar no nó. Os tempos das palavras aparecem na saída Dados.
Entradas e saída
| Entrada | Aceita | O que faz |
|---|---|---|
| Áudio | Nós de áudio, como Enviar áudio (Upload Audio), Áudio de referência (Reference Audio) e Texto para fala | A gravação a alinhar. |
| Transcrição | Nós de texto, como Texto (Text) | O texto falado, no lugar do campo Transcrição. |
A saída, Dados, é uma lista de palavras com os tempos de início e de fim. Ela é de dados, não de áudio, então se conecta a nós que recebem texto ou dados.
Configurações
| Configuração | O que faz |
|---|---|
| Transcrição | O texto completo falado no áudio, só com as palavras. Ele precisa corresponder de perto à fala. |
| Texto antes e depois | Texto sempre adicionado antes e depois da transcrição. Fica oculto para quem usa o seu workflow como app. Veja Texto antes e depois do prompt. |
Leia o resultado
A saída Dados tem esta forma:
[
{ "word": "Hello", "start": 0.0, "end": 0.35 },
{ "word": "world", "start": 0.38, "end": 0.72 }
]| Campo | O que significa |
|---|---|
word | A palavra alinhada. |
start | Quando a palavra começa, em segundos. |
end | Quando a palavra termina, em segundos. |
Modelos
| Modelo | Desenvolvedor | Modos | Créditos | Detalhes |
|---|---|---|---|---|
| ElevenLabs Forced Alignment | ElevenLabs | Alinhamento forçado | 33 | Alinha uma transcrição existente ao áudio, com marcações de tempo por palavra. |
Dicas
- Faça a transcrição corresponder à fala. Diferenças entre o texto e o áudio deixam os tempos pouco confiáveis.
- Limpe a transcrição. Remova muletas de linguagem, começos em falso e notas como
[music], a menos que sejam realmente falados. - Use texto simples. Deixe de fora marcações de tempo, rótulos de falante e formatação. Escreva só as palavras, como são faladas.
- Cubra a gravação inteira. Uma transcrição parcial só alinha a parte que ela cobre.
- Limpe antes o áudio com ruído. Passe a gravação pelo Extrator de voz (Voice Extractor) para ter tempos mais precisos.
- Espere menos precisão em falas difíceis. Fala muito rápida, sotaques fortes e falantes sobrepostos podem reduzir a precisão.
Pela API
A ferramenta MCP é forced_alignment. Veja as ferramentas MCP.
Perguntas frequentes
Páginas relacionadas
Transcrever
Texto para fala
Extrator de voz
Adicionar legendas
ElevenLabs Forced Alignment
Última atualização
Transcrever
Transcreva a fala de um áudio ou vídeo com o ElevenLabs STT ou o Whisper: o tempo de cada palavra para legendas, os falantes e tags de música e risadas.
Nós de configurações de geração
Cada nó de configuração guarda um valor. Provedor e Proporção ajustam imagem e vídeo; Duração e Movimento, os clipes; quatro alimentam o Gerar roteiro.