# Alinhamento forçado

> Marque no áudio o tempo de cada palavra de uma transcrição conhecida e receba o início e o fim de cada uma como dados, para karaokê, gráficos e legendas.

Source: https://nodaro.ai/pt-BR/docs/nodes/audio/forced-alignment

O nó **Alinhamento forçado** (Forced Alignment) marca no áudio o tempo de cada palavra de uma transcrição conhecida. Você fornece a gravação e o texto exato falado nela, e o nó retorna o tempo de início e de fim de cada palavra. O resultado é de dados, não de áudio: use-o para destaques no estilo karaokê, gráficos que reagem às palavras ou para conferir o ritmo de uma fala gerada.

- Found in: Audio › Transcribe
- Output: data
- API type: `forced-alignment`

## Quando usar
- Obter os tempos exatos de cada palavra para legendas, a partir de um roteiro que você já tem.
- Criar um destaque de palavras no estilo karaokê que acompanha o áudio.
- Sincronizar animações ou motion graphics com palavras específicas.
- Sincronizar elementos visuais com a fala em uma composição de vídeo.
- Conferir o timing do resultado de [**Texto para fala** (Text to Speech)](https://nodaro.ai/docs/nodes/audio/text-to-speech) em relação ao ritmo que você espera.

Quando você não tem uma transcrição, use [**Transcrever** (Transcribe)](https://nodaro.ai/docs/nodes/audio/transcribe). A saída Transcrição dele já traz os tempos de cada palavra com o ElevenLabs STT e o Incredibly Fast Whisper.

## Início rápido
### Adicione o nó
Pressione Tab no canvas e escolha **Áudio › Transcrição › Alinhamento forçado**.

### Conecte o áudio
Conecte um nó de áudio à entrada **Áudio**.

### Forneça a transcrição
Abra o painel de configurações e cole o texto exato falado em **Transcrição**, ou conecte um nó de texto à entrada **Transcrição**.

### Execute
Clique em **Executar** no nó. Os tempos das palavras aparecem na saída **Dados**.

Workflow: O mesmo roteiro é falado pelo Texto para fala e depois alinhado à fala, palavra por palavra.

- Texto → Texto para fala (prompt)
- Texto para fala → Alinhamento forçado (áudio)
- Texto → Alinhamento forçado (transcrição)

## Entradas e saída
| Entrada | Aceita | O que faz |
| --- | --- | --- |
| **Áudio** | Nós de áudio, como **Enviar áudio** (Upload Audio), **Áudio de referência** (Reference Audio) e Texto para fala | A gravação a alinhar. |
| **Transcrição** | Nós de texto, como **Texto** (Text) | O texto falado, no lugar do campo Transcrição. |

A saída, **Dados**, é uma lista de palavras com os tempos de início e de fim. Ela é de dados, não de áudio, então se conecta a nós que recebem texto ou dados.

## Configurações
| Configuração | O que faz |
| --- | --- |
| **Transcrição** | O texto completo falado no áudio, só com as palavras. Ele precisa corresponder de perto à fala. |
| **Texto antes e depois** | Texto sempre adicionado antes e depois da transcrição. Fica oculto para quem usa o seu workflow como app. Veja [Texto antes e depois do prompt](https://nodaro.ai/docs/concepts/prompt-pre-post-text). |

## Leia o resultado
A saída **Dados** tem esta forma:

```json
[
{ "word": "Hello", "start": 0.0, "end": 0.35 },
{ "word": "world", "start": 0.38, "end": 0.72 }
]
```

| Campo | O que significa |
| --- | --- |
| `word` | A palavra alinhada. |
| `start` | Quando a palavra começa, em segundos. |
| `end` | Quando a palavra termina, em segundos. |

## Modelos
| Model | Maker | Modes | Credits | Details |
| --- | --- | --- | --- | --- |
| [ElevenLabs Forced Alignment](https://nodaro.ai/docs/models/audio/elevenlabs-forced-alignment) | ElevenLabs | Forced alignment | 33 | Align an existing transcript to audio with word-level timestamps. |

## Dicas
- **Faça a transcrição corresponder à fala.** Diferenças entre o texto e o áudio deixam os tempos pouco confiáveis.
- **Limpe a transcrição.** Remova muletas de linguagem, começos em falso e notas como `[music]`, a menos que sejam realmente falados.
- **Use texto simples.** Deixe de fora marcações de tempo, rótulos de falante e formatação. Escreva só as palavras, como são faladas.
- **Cubra a gravação inteira.** Uma transcrição parcial só alinha a parte que ela cobre.
- **Limpe antes o áudio com ruído.** Passe a gravação pelo [**Extrator de voz** (Voice Extractor)](https://nodaro.ai/docs/nodes/audio/voice-extractor) para ter tempos mais precisos.
- **Espere menos precisão em falas difíceis.** Fala muito rápida, sotaques fortes e falantes sobrepostos podem reduzir a precisão.

## Pela API
A ferramenta MCP é `forced_alignment`. Veja as [ferramentas MCP](https://nodaro.ai/docs/mcp/tools).

## Frequently asked questions

### Qual é a diferença entre “Alinhamento forçado” e “Transcrever”?

“Transcrever” descobre o que foi dito e quando. “Alinhamento forçado” já sabe o que foi dito, pela sua transcrição, e encontra exatamente quando cada palavra é falada. Use-o quando você tiver o roteiro exato.

### A transcrição precisa corresponder exatamente ao áudio?

O máximo possível. Palavras que não são faladas, ou palavras faladas que faltam na transcrição, deixam os tempos pouco confiáveis. Remova notas, rótulos e muletas de linguagem que não estão no áudio.

### Em que unidade estão as marcações de tempo?

Em segundos. Cada palavra tem um início e um fim, por exemplo uma palavra de 0,38 a 0,72 segundo.

### O nó “Alinhamento forçado” retorna áudio?

Não. A saída dele é de dados: uma lista de palavras com os respectivos tempos. Ela se conecta a nós que recebem texto ou dados, não a entradas de áudio.
