Sincronização labial
Faça um retrato falar uma faixa de áudio ou duble um vídeo ressincronizando os lábios com uma nova fala, com Kling Avatar, OmniHuman, Seedance e outros.
O nó Sincronização labial (Lip Sync) faz um rosto falar uma faixa de áudio. Dê a ele um retrato e uma faixa de voz, e ele faz um vídeo de cabeça falante. Dê a ele um vídeo e um novo áudio, e ele ressincroniza os lábios do vídeo com a nova fala, o que dubla o clipe. Você escolhe o modelo, e o nó mostra as entradas de que esse modelo precisa.
Quando usar
- Uma cabeça falante a partir de uma única foto, por exemplo um personagem gerado por IA com uma narração.
- Um vídeo de porta-voz para uma demonstração de produto.
- Uma versão dublada de um vídeo: a fala traduzida, ressincronizada com os lábios de quem fala.
- Uma atuação dirigida por um prompt, como cantar em um microfone, com o OmniHuman 1.5.
Para um vídeo de avatar completo a partir de um roteiro, com vozes e legendas incluídas, use o Avatar de IA (AI Avatar).
Início rápido
Adicionar o nó
Pressione Tab no canvas e escolha Vídeo › Animação e atuação › Sincronização labial.
Escolher o modelo
Abra o painel de configurações e escolha um modelo em Provedor. O nó então mostra as entradas de que esse modelo precisa: Retrato, Vídeo de origem ou as duas.
Conectar o rosto e a voz
Conecte uma imagem a Retrato ou um vídeo a Vídeo de origem, e um nó de áudio a Áudio, por exemplo o Texto para fala (Text to Speech).
Executar
Clique em Executar. O vídeo com os lábios sincronizados aparece no nó.
Retrato ou vídeo
| O que você conecta | O que o nó faz | Modelos |
|---|---|---|
| Um Retrato e Áudio | Um novo vídeo de cabeça falante a partir de uma imagem fixa. | Kling Avatar, Kling Avatar Pro, InfiniTalk, OmniHuman 1.5, Seedance 2, Seedance 2 Fast, Seedance 2 Mini, Seedance 2.5, SadTalker |
| Um Vídeo de origem e Áudio | O mesmo vídeo, com os lábios ressincronizados com o novo áudio. | Volcengine Lip Sync, Sync Lipsync v3, Lipsync 2 Pro, HeyGen Lipsync Precision, LatentSync, Video-Retalking |
| Um dos dois, e Áudio | O Wav2Lip aceita um retrato ou um vídeo. | Wav2Lip |
Entradas
| Entrada | Aceita | O que faz |
|---|---|---|
| Áudio | Nós de áudio | A fala ou a narração. Obrigatória em todos os modelos. |
| Retrato | Nós de imagem | Uma foto nítida de um rosto, para os modelos de retrato. |
| Vídeo de origem | Nós de vídeo | O clipe a dublar, para os modelos de dublagem. |
A saída, Vídeo, é a URL do vídeo com os lábios sincronizados. Quando vários nós estão conectados, o cartão do nó permite escolher qual imagem, qual vídeo e qual áudio usar.
Configurações
| Configuração | O que faz |
|---|---|
| Provedor | O modelo de sincronização labial. O padrão é o Kling Avatar. |
| Resolução | No Kling Avatar, no Kling Avatar Pro, no InfiniTalk e nos modelos Seedance: 480p ou 720p, com 720p como padrão. O Seedance 2 também oferece 1080p. O OmniHuman 1.5 oferece 720p ou 1080p, com 1080p como padrão. |
| Prompt de movimento (opcional) | Nos mesmos modelos: movimentos da cabeça e das expressões, por exemplo “slight head nods” ou “expressive eyebrows”. No OmniHuman 1.5, ele dirige a atuação inteira. |
| Texto antes e depois | Texto sempre adicionado antes e depois do prompt de movimento. Veja Texto antes e depois do prompt. |
Configurações de modelos específicos
| Modelo | Configurações |
|---|---|
| OmniHuman 1.5 | O Prompt de movimento dirige a atuação, por exemplo “sing confidently into a microphone”. O Modo rápido troca um pouco de qualidade por velocidade. A Seed torna um resultado repetível; -1 significa aleatória. Ele anima pessoas, animais de estimação e anime em qualquer proporção. |
| HeyGen Lipsync Precision | Duração dinâmica (ativada) ajusta a duração da saída ao novo áudio. Remover faixa de música (desativada) tira a música de fundo do vídeo de origem. Aprimoramento de fala (desativado) melhora a clareza da fala. |
| Lipsync 2 Pro | O Modo de sincronização define o que acontece quando o áudio e o vídeo têm durações diferentes: Loop (o padrão), Ida e volta, Cortar, Silêncio ou Remapear. A Temperatura, de 0 a 1, define quão expressiva é a sincronização labial; o padrão é 0,5. A Detecção do falante ativo sincroniza quem estiver falando. |
| Sync Lipsync v3 | Modo de sincronização, com Cortar como padrão, e Detecção do falante ativo, que você deve ativar em um vídeo com mais de uma pessoa. O modelo controla a própria expressividade. |
| Volcengine Lip Sync | Modo: Leve, para um só falante de frente, mais rápido, ou Básico, para cenas complexas com vários falantes. Separar vocais (reduzir ruído) tira o ruído do áudio. Detecção de cenas + identificação de falantes (só no Básico) encontra os cortes de cena e quem fala. Repetir o vídeo em loop se o áudio for mais longo (só no Leve, ativado por padrão) e Loop reverso (ida e volta) tratam o áudio que passa do fim do vídeo. Início do template (segundos) define em que ponto do vídeo os lábios começam a acompanhar o áudio. A saída tem a duração do áudio: um vídeo mais longo é cortado, e um mais curto é repetido em loop. |
Os modelos Seedance fazem sincronização labial nativa, no nível dos fonemas, em mais de 8 idiomas. Eles funcionam como o Gerar vídeo (Generate Video), com o áudio enviado como áudio de referência.
Modelos
| Modelo | Desenvolvedor | Modos | Créditos | Detalhes |
|---|---|---|---|---|
| minimax-h3 | MiniMax | Imagem para vídeo, Texto para vídeo | a partir de 253 | MiniMax Hailuo 3 — nível multimodal premium: quadro inicial e final mais referências de imagem, vídeo e áudio, áudio nativo, saída em 2K (padrão) ou 768P e preço por segundo, de 4 a 15 s. |
| Kling Avatar Standard | Kuaishou | Sincronização labial | 308 | Sincroniza os lábios de um retrato estático com um áudio guia. Qualidade padrão. |
| Kling Avatar Pro | Kuaishou | Sincronização labial | 616 | Sincronização labial premium — formato da boca e tempo mais precisos. |
| Seedance 2 | Bytedance | Imagem para vídeo, Texto para vídeo | a partir de 253 | Seedance 2 — nível premium com áudio nativo. Preço por segundo conforme a resolução. |
| Seedance 2 Fast | Bytedance | Imagem para vídeo, Texto para vídeo | a partir de 198 | Nível mais barato e mais rápido do Seedance 2. |
| Seedance 2 Mini | Bytedance | Imagem para vídeo, Texto para vídeo | a partir de 132 | Nível econômico do Seedance 2 — só 480p/720p, preço por segundo conforme a resolução. |
| Seedance 2.5 | Bytedance | Imagem para vídeo, Texto para vídeo | a partir de 374 | Seedance 2.5 — até 30 s em uma única tomada, áudio nativo e amplas referências multimodais. 480p/720p/1080p. |
| OmniHuman 1.5 | Bytedance | Sincronização labial | a partir de 1.122 | Avatar falante premium dirigido por prompt, a partir de uma imagem fixa e um áudio. 720p / 1080p, até 60 s. Pessoas, pets e anime. |
| InfiniTalk | InfiniTalk | Sincronização labial | a partir de 121 | Cabeça falante guiada por áudio, a partir de uma imagem fixa. 480p / 720p. |
| Sync Lipsync v3 | Sync | Sincronização labial | a partir de 1.100 | Dubla um vídeo existente — sincroniza de novo os lábios com uma nova faixa de áudio. Entrada de vídeo, cobrança por segundo. |
| Volcengine Lip Sync | Volcengine | Sincronização labial | a partir de 330 | Dublagem de vídeo para vídeo com IA — sincroniza de novo os lábios com uma nova faixa de voz. Vários falantes (detecção de cenas e identificação de falantes) no modo básico. Entrada de vídeo, cobrança por segundo. |
A lista Provedor também oferece o HeyGen Lipsync Precision e o Lipsync 2 Pro para dublagem. Ela traz ainda o LatentSync, o melhor para canto, o Wav2Lip, o mais rápido e mais barato, o Video-Retalking, com aprimoramento de rosto embutido, e o SadTalker. O Hailuo 3 (minimax-h3) está disponível pela API, e não na lista Provedor.
Duração do áudio
| Modelo | Áudio mais longo |
|---|---|
| Kling Avatar, Kling Avatar Pro | 5 minutos |
| Volcengine Lip Sync | 5 minutos |
| HeyGen Lipsync Precision, Lipsync 2 Pro, Sync Lipsync v3 | 5 minutos, como limite de reserva |
| OmniHuman 1.5 | 60 segundos |
| InfiniTalk | 15 segundos |
| Seedance 2 Fast | 15,2 segundos por clipe |
| Seedance 2.5 | 30 segundos por clipe |
No Kling Avatar, no InfiniTalk, no OmniHuman 1.5 e no Volcengine Lip Sync, um áudio mais longo que o limite é cortado antes da execução. No HeyGen Lipsync Precision, no Lipsync 2 Pro e no Sync Lipsync v3, 5 minutos é o limite de reserva de créditos, e não um corte: clipes mais longos reservam a faixa de 5 minutos. Execuções longas no Kling Avatar e no Volcengine Lip Sync podem levar dezenas de minutos, e o editor espera por até cerca de uma hora.
Créditos
A maioria dos modelos cobra por segundo, arredondando para cima até a próxima faixa de duração. O chip de créditos no nó é atualizado quando o áudio é conectado, porque o nó mede a duração dele. Quando a duração é desconhecida, a faixa de 5 minutos é reservada. Os créditos além do custo real são reembolsados quando o vídeo fica pronto.
| Modelo | 15 s | 30 s | 1 min | 2 min | 5 min |
|---|---|---|---|---|---|
| Kling Avatar (720p) | 330 | 660 | 1.320 | 2.640 | 6.600 |
| Kling Avatar Pro (1080p) | 660 | 1.320 | 2.640 | 5.280 | 13.200 |
| OmniHuman 1.5 | 1.122 | 2.233 | 4.455 | — | — |
| Volcengine Lip Sync | 330 | 660 | 1.320 | 2.640 | 6.600 |
| HeyGen Lipsync Precision | 561 | 1.111 | 2.211 | 4.411 | 11.011 |
| Lipsync 2 Pro | 693 | 1.375 | 2.750 | 5.500 | 13.739 |
| Sync Lipsync v3 | 1.100 | 2.200 | 4.400 | 8.800 | 22.000 |
- O OmniHuman 1.5 aceita no máximo 60 segundos de áudio, então só valem as faixas de 15 segundos, 30 segundos e 1 minuto. A resolução dele não muda o preço.
- O InfiniTalk tem um preço fixo por execução: 121 créditos em 480p e 462 em 720p.
- Os modelos Seedance são cobrados por segundo, do mesmo jeito que no Gerar vídeo.
Dicas
- Use um retrato nítido e de frente. A qualidade do rosto importa mais que a resolução: uma foto nítida em 720p funciona melhor que uma foto 4K borrada.
- Limpe o áudio antes. Fala sem música nem ruído sincroniza melhor. Use o Extrator de voz (Voice Extractor) para isolar a voz.
- Adicione pequenos movimentos. Um prompt de movimento como “slight head nods” aumenta o realismo.
- Duble em vários idiomas. Traduza a fala com o Dublagem (Dubbing) ou com uma nova narração e depois ressincronize os lábios com um modelo de dublagem.
- Clipes curtos são baratos. Com o preço por segundo, uma fala curta custa pouco; acompanhe o chip de créditos depois de conectar o áudio.
Pela API
Quando você chamar o Sync Lipsync v3 ou o Volcengine Lip Sync pela API, pelo SDK ou pelo MCP, passe audioDurationSec, a duração da saída em segundos. Sem esse campo, a execução é cobrada na faixa de 5 minutos, sem reembolso: 22.000 créditos no Sync Lipsync v3 e 6.600 no Volcengine Lip Sync. O editor mede o áudio para você. Veja Executar um único nó.
Perguntas frequentes
Páginas relacionadas
Avatar de IA
Texto para fala
Dublagem
Extrator de voz
Modelos de vídeo
Última atualização
Avatar cinematográfico
Crie, a partir de um prompt, um clipe cinematográfico curto com 1 a 3 visuais de avatar do HeyGen. Sem texto nem voz: o prompt dirige cena, ação e câmera.
Fala para vídeo
Gere um vídeo guiado por uma faixa de fala com o Wan 2.2. Conecte o áudio da fala, um retrato e um prompt e receba um vídeo falado a partir de 33 créditos.