# Sincronização labial

> Faça um retrato falar uma faixa de áudio ou duble um vídeo ressincronizando os lábios com uma nova fala, com Kling Avatar, OmniHuman, Seedance e outros.

Source: https://nodaro.ai/pt-BR/docs/nodes/video/lip-sync

O nó **Sincronização labial** (Lip Sync) faz um rosto falar uma faixa de áudio. Dê a ele um retrato e uma faixa de voz, e ele faz um vídeo de cabeça falante. Dê a ele um vídeo e um novo áudio, e ele ressincroniza os lábios do vídeo com a nova fala, o que dubla o clipe. Você escolhe o modelo, e o nó mostra as entradas de que esse modelo precisa.

- Found in: Video › Animate & Perform
- Output: video
- Credits: 121–22.000 créditos
- Models: 11
- API type: `lip-sync`

## Quando usar
- Uma cabeça falante a partir de uma única foto, por exemplo um personagem gerado por IA com uma narração.
- Um vídeo de porta-voz para uma demonstração de produto.
- Uma versão dublada de um vídeo: a fala traduzida, ressincronizada com os lábios de quem fala.
- Uma atuação dirigida por um prompt, como cantar em um microfone, com o OmniHuman 1.5.

Para um vídeo de avatar completo a partir de um roteiro, com vozes e legendas incluídas, use o [**Avatar de IA** (AI Avatar)](https://nodaro.ai/docs/nodes/video/ai-avatar).

## Início rápido
### Adicionar o nó
Pressione Tab no canvas e escolha **Vídeo › Animação e atuação › Sincronização labial**.

### Escolher o modelo
Abra o painel de configurações e escolha um modelo em **Provedor**. O nó então mostra as entradas de que esse modelo precisa: **Retrato**, **Vídeo de origem** ou as duas.

### Conectar o rosto e a voz
Conecte uma imagem a **Retrato** ou um vídeo a **Vídeo de origem**, e um nó de áudio a **Áudio**, por exemplo o [**Texto para fala** (Text to Speech)](https://nodaro.ai/docs/nodes/audio/text-to-speech).

### Executar
Clique em **Executar**. O vídeo com os lábios sincronizados aparece no nó.

Workflow: Um retrato e uma fala gerada viram um vídeo de cabeça falante.

- Texto → Texto para fala
- Gerar imagem → Sincronização labial (retrato)
- Texto para fala → Sincronização labial (áudio)

## Retrato ou vídeo
| O que você conecta | O que o nó faz | Modelos |
| --- | --- | --- |
| Um **Retrato** e **Áudio** | Um novo vídeo de cabeça falante a partir de uma imagem fixa. | Kling Avatar, Kling Avatar Pro, InfiniTalk, OmniHuman 1.5, Seedance 2, Seedance 2 Fast, Seedance 2 Mini, Seedance 2.5, SadTalker |
| Um **Vídeo de origem** e **Áudio** | O mesmo vídeo, com os lábios ressincronizados com o novo áudio. | Volcengine Lip Sync, Sync Lipsync v3, Lipsync 2 Pro, HeyGen Lipsync Precision, LatentSync, Video-Retalking |
| Um dos dois, e **Áudio** | O Wav2Lip aceita um retrato ou um vídeo. | Wav2Lip |

## Entradas
| Entrada | Aceita | O que faz |
| --- | --- | --- |
| **Áudio** | Nós de áudio | A fala ou a narração. Obrigatória em todos os modelos. |
| **Retrato** | Nós de imagem | Uma foto nítida de um rosto, para os modelos de retrato. |
| **Vídeo de origem** | Nós de vídeo | O clipe a dublar, para os modelos de dublagem. |

A saída, **Vídeo**, é a URL do vídeo com os lábios sincronizados. Quando vários nós estão conectados, o cartão do nó permite escolher qual imagem, qual vídeo e qual áudio usar.

## Configurações
| Configuração | O que faz |
| --- | --- |
| **Provedor** | O modelo de sincronização labial. O padrão é o **Kling Avatar**. |
| **Resolução** | No Kling Avatar, no Kling Avatar Pro, no InfiniTalk e nos modelos Seedance: 480p ou 720p, com 720p como padrão. O Seedance 2 também oferece 1080p. O OmniHuman 1.5 oferece 720p ou 1080p, com 1080p como padrão. |
| **Prompt de movimento (opcional)** | Nos mesmos modelos: movimentos da cabeça e das expressões, por exemplo “slight head nods” ou “expressive eyebrows”. No OmniHuman 1.5, ele dirige a atuação inteira. |
| **Texto antes e depois** | Texto sempre adicionado antes e depois do prompt de movimento. Veja [Texto antes e depois do prompt](https://nodaro.ai/docs/concepts/prompt-pre-post-text). |

### Configurações de modelos específicos
| Modelo | Configurações |
| --- | --- |
| **OmniHuman 1.5** | O **Prompt de movimento** dirige a atuação, por exemplo “sing confidently into a microphone”. O **Modo rápido** troca um pouco de qualidade por velocidade. A **Seed** torna um resultado repetível; -1 significa aleatória. Ele anima pessoas, animais de estimação e anime em qualquer proporção. |
| **HeyGen Lipsync Precision** | **Duração dinâmica** (ativada) ajusta a duração da saída ao novo áudio. **Remover faixa de música** (desativada) tira a música de fundo do vídeo de origem. **Aprimoramento de fala** (desativado) melhora a clareza da fala. |
| **Lipsync 2 Pro** | O **Modo de sincronização** define o que acontece quando o áudio e o vídeo têm durações diferentes: **Loop** (o padrão), **Ida e volta**, **Cortar**, **Silêncio** ou **Remapear**. A **Temperatura**, de 0 a 1, define quão expressiva é a sincronização labial; o padrão é 0,5. A **Detecção do falante ativo** sincroniza quem estiver falando. |
| **Sync Lipsync v3** | **Modo de sincronização**, com **Cortar** como padrão, e **Detecção do falante ativo**, que você deve ativar em um vídeo com mais de uma pessoa. O modelo controla a própria expressividade. |
| **Volcengine Lip Sync** | **Modo**: **Leve**, para um só falante de frente, mais rápido, ou **Básico**, para cenas complexas com vários falantes. **Separar vocais (reduzir ruído)** tira o ruído do áudio. **Detecção de cenas + identificação de falantes** (só no Básico) encontra os cortes de cena e quem fala. **Repetir o vídeo em loop se o áudio for mais longo** (só no Leve, ativado por padrão) e **Loop reverso (ida e volta)** tratam o áudio que passa do fim do vídeo. **Início do template (segundos)** define em que ponto do vídeo os lábios começam a acompanhar o áudio. A saída tem a duração do áudio: um vídeo mais longo é cortado, e um mais curto é repetido em loop. |

Os modelos Seedance fazem sincronização labial nativa, no nível dos fonemas, em mais de 8 idiomas. Eles funcionam como o [**Gerar vídeo** (Generate Video)](https://nodaro.ai/docs/nodes/video/generate-video), com o áudio enviado como áudio de referência.

## Modelos
| Model | Maker | Modes | Credits | Details |
| --- | --- | --- | --- | --- |
| [minimax-h3](https://nodaro.ai/docs/models/video/minimax-h3) | MiniMax | Image to video, Text to video | a partir de 253 | MiniMax Hailuo 3 — premium multimodal tier: first/last frame + image/video/audio references, native audio, 2K (default) or 768P output, 4-15s per-second pricing. |
| [Kling Avatar Standard](https://nodaro.ai/docs/models/video/kling-avatar-standard) | Kuaishou | Lip sync | 308 | Lip-sync a still portrait to driving audio. Standard quality. |
| [Kling Avatar Pro](https://nodaro.ai/docs/models/video/kling-avatar-pro) | Kuaishou | Lip sync | 616 | Premium lip-sync — better mouth shape and timing. |
| [Seedance 2](https://nodaro.ai/docs/models/video/seedance-2) | Bytedance | Image to video, Text to video | a partir de 253 | Seedance 2 — premium tier with native audio. Per-second pricing by resolution. |
| [Seedance 2 Fast](https://nodaro.ai/docs/models/video/seedance-2-fast) | Bytedance | Image to video, Text to video | a partir de 198 | Cheaper / quicker Seedance 2 tier. |
| [Seedance 2 Mini](https://nodaro.ai/docs/models/video/seedance-2-mini) | Bytedance | Image to video, Text to video | a partir de 132 | Budget Seedance 2 tier — 480p/720p only, per-second pricing by resolution. |
| [Seedance 2.5](https://nodaro.ai/docs/models/video/seedance-2-5) | Bytedance | Image to video, Text to video | a partir de 374 | Seedance 2.5 — up to 30s in one shot, native audio, wide multimodal references. 480p/720p/1080p. |
| [OmniHuman 1.5](https://nodaro.ai/docs/models/video/omnihuman-1-5) | Bytedance | Lip sync | a partir de 1.122 | Premium prompt-directed talking avatar from a still image + audio. 720p / 1080p, up to 60s. People, pets, anime. |
| [InfiniTalk](https://nodaro.ai/docs/models/video/infinitalk) | InfiniTalk | Lip sync | a partir de 121 | Audio-driven talking-head from a still image. 480p / 720p. |
| [Sync Lipsync v3](https://nodaro.ai/docs/models/video/sync-lipsync-v3) | Sync | Lip sync | a partir de 1.100 | Dub existing footage — re-syncs lips to a new audio track. Video input, billed per second. |
| [Volcengine Lip Sync](https://nodaro.ai/docs/models/video/volcengine-lip-sync) | Volcengine | Lip sync | a partir de 330 | Video-to-video AI dubbing — re-syncs lips to a new vocal track. Multi-speaker (scene detection + speaker ID) in basic mode. Video input, billed per second. |

A lista **Provedor** também oferece o HeyGen Lipsync Precision e o Lipsync 2 Pro para dublagem. Ela traz ainda o LatentSync, o melhor para canto, o Wav2Lip, o mais rápido e mais barato, o Video-Retalking, com aprimoramento de rosto embutido, e o SadTalker. O Hailuo 3 (minimax-h3) está disponível pela API, e não na lista **Provedor**.

## Duração do áudio
| Modelo | Áudio mais longo |
| --- | --- |
| Kling Avatar, Kling Avatar Pro | 5 minutos |
| Volcengine Lip Sync | 5 minutos |
| HeyGen Lipsync Precision, Lipsync 2 Pro, Sync Lipsync v3 | 5 minutos, como limite de reserva |
| OmniHuman 1.5 | 60 segundos |
| InfiniTalk | 15 segundos |
| Seedance 2 Fast | 15,2 segundos por clipe |
| Seedance 2.5 | 30 segundos por clipe |

No Kling Avatar, no InfiniTalk, no OmniHuman 1.5 e no Volcengine Lip Sync, um áudio mais longo que o limite é cortado antes da execução. No HeyGen Lipsync Precision, no Lipsync 2 Pro e no Sync Lipsync v3, 5 minutos é o limite de reserva de créditos, e não um corte: clipes mais longos reservam a faixa de 5 minutos. Execuções longas no Kling Avatar e no Volcengine Lip Sync podem levar dezenas de minutos, e o editor espera por até cerca de uma hora.

## Créditos
A maioria dos modelos cobra por segundo, arredondando para cima até a próxima faixa de duração. O chip de créditos no nó é atualizado quando o áudio é conectado, porque o nó mede a duração dele. Quando a duração é desconhecida, a faixa de 5 minutos é reservada. Os créditos além do custo real são reembolsados quando o vídeo fica pronto.

| Modelo | 15 s | 30 s | 1 min | 2 min | 5 min |
| --- | ---: | ---: | ---: | ---: | ---: |
| Kling Avatar (720p) | 330 | 660 | 1.320 | 2.640 | 6.600 |
| Kling Avatar Pro (1080p) | 660 | 1.320 | 2.640 | 5.280 | 13.200 |
| OmniHuman 1.5 | 1.122 | 2.233 | 4.455 | — | — |
| Volcengine Lip Sync | 330 | 660 | 1.320 | 2.640 | 6.600 |
| HeyGen Lipsync Precision | 561 | 1.111 | 2.211 | 4.411 | 11.011 |
| Lipsync 2 Pro | 693 | 1.375 | 2.750 | 5.500 | 13.739 |
| Sync Lipsync v3 | 1.100 | 2.200 | 4.400 | 8.800 | 22.000 |

- O **OmniHuman 1.5** aceita no máximo 60 segundos de áudio, então só valem as faixas de 15 segundos, 30 segundos e 1 minuto. A resolução dele não muda o preço.
- O **InfiniTalk** tem um preço fixo por execução: 121 créditos em 480p e 462 em 720p.
- **Os modelos Seedance** são cobrados por segundo, do mesmo jeito que no [Gerar vídeo](https://nodaro.ai/docs/nodes/video/generate-video).

## Dicas
- **Use um retrato nítido e de frente.** A qualidade do rosto importa mais que a resolução: uma foto nítida em 720p funciona melhor que uma foto 4K borrada.
- **Limpe o áudio antes.** Fala sem música nem ruído sincroniza melhor. Use o [**Extrator de voz** (Voice Extractor)](https://nodaro.ai/docs/nodes/audio/voice-extractor) para isolar a voz.
- **Adicione pequenos movimentos.** Um prompt de movimento como “slight head nods” aumenta o realismo.
- **Duble em vários idiomas.** Traduza a fala com o [**Dublagem** (Dubbing)](https://nodaro.ai/docs/nodes/audio/dubbing) ou com uma nova narração e depois ressincronize os lábios com um modelo de dublagem.
- **Clipes curtos são baratos.** Com o preço por segundo, uma fala curta custa pouco; acompanhe o chip de créditos depois de conectar o áudio.

## Pela API
Quando você chamar o Sync Lipsync v3 ou o Volcengine Lip Sync pela API, pelo SDK ou pelo MCP, passe `audioDurationSec`, a duração da saída em segundos. Sem esse campo, a execução é cobrada na faixa de 5 minutos, sem reembolso: 22.000 créditos no Sync Lipsync v3 e 6.600 no Volcengine Lip Sync. O editor mede o áudio para você. Veja [Executar um único nó](https://nodaro.ai/docs/developers/api/nodes).

## Frequently asked questions

### Do que o nó “Sincronização labial” precisa?

De uma faixa de áudio com fala e, conforme o modelo, de um retrato ou de um vídeo. Os modelos de retrato fazem um novo vídeo de cabeça falante. Os modelos de dublagem, como o Sync Lipsync v3 e o Volcengine Lip Sync, ressincronizam os lábios de um vídeo existente com um novo áudio.

### Qual modelo de sincronização labial devo escolher?

O Kling Avatar Pro dá o melhor formato de boca para um retrato. O InfiniTalk oferece controle de resolução. O OmniHuman 1.5 segue um prompt de movimento e anima pessoas, animais de estimação e anime. Para dublar um vídeo existente, o Volcengine Lip Sync é a opção moderna mais barata e a única que lida com vários falantes.

### Quantos créditos o “Sincronização labial” custa?

A maioria dos modelos cobra por segundo de áudio, arredondado para cima até uma faixa de duração de 15 segundos, 30 segundos, 1, 2 ou 5 minutos. Por exemplo, o Kling Avatar custa 330 créditos por 15 segundos, e o Volcengine Lip Sync, 1.320 créditos por um minuto. O InfiniTalk tem um preço fixo por execução.

### Qual pode ser a duração do áudio?

Até 5 minutos na maioria dos modelos. O InfiniTalk aceita 15 segundos e o OmniHuman 1.5, 60 segundos; nesses modelos, um áudio mais longo é cortado.

### Como faço uma cabeça falante a partir de texto?

Conecte um nó “Texto para fala” à entrada “Áudio” e um retrato à entrada “Retrato”. A faixa de voz então conduz os lábios.
