Docs do Nodaro
DocumentaçãoReferência de nósModelosAgentes de IA (MCP)DesenvolvedoresSelf-hostingPesquisa
Vídeo

Sincronização labial

Faça um retrato falar uma faixa de áudio ou duble um vídeo ressincronizando os lábios com uma nova fala, com Kling Avatar, OmniHuman, Seedance e outros.

O nó Sincronização labial (Lip Sync) faz um rosto falar uma faixa de áudio. Dê a ele um retrato e uma faixa de voz, e ele faz um vídeo de cabeça falante. Dê a ele um vídeo e um novo áudio, e ele ressincroniza os lábios do vídeo com a nova fala, o que dubla o clipe. Você escolhe o modelo, e o nó mostra as entradas de que esse modelo precisa.

Quando usar

  • Uma cabeça falante a partir de uma única foto, por exemplo um personagem gerado por IA com uma narração.
  • Um vídeo de porta-voz para uma demonstração de produto.
  • Uma versão dublada de um vídeo: a fala traduzida, ressincronizada com os lábios de quem fala.
  • Uma atuação dirigida por um prompt, como cantar em um microfone, com o OmniHuman 1.5.

Para um vídeo de avatar completo a partir de um roteiro, com vozes e legendas incluídas, use o Avatar de IA (AI Avatar).

Início rápido

Adicionar o nó

Pressione Tab no canvas e escolha Vídeo › Animação e atuação › Sincronização labial.

Escolher o modelo

Abra o painel de configurações e escolha um modelo em Provedor. O nó então mostra as entradas de que esse modelo precisa: Retrato, Vídeo de origem ou as duas.

Conectar o rosto e a voz

Conecte uma imagem a Retrato ou um vídeo a Vídeo de origem, e um nó de áudio a Áudio, por exemplo o Texto para fala (Text to Speech).

Executar

Clique em Executar. O vídeo com os lábios sincronizados aparece no nó.

retratoáudioGerar imagemRetrato de frenteTextoA fala a dizerTexto para falaElevenLabs v3Sincronização labialKling Avatar Pro
Um retrato e uma fala gerada viram um vídeo de cabeça falante.

Retrato ou vídeo

O que você conectaO que o nó fazModelos
Um Retrato e ÁudioUm novo vídeo de cabeça falante a partir de uma imagem fixa.Kling Avatar, Kling Avatar Pro, InfiniTalk, OmniHuman 1.5, Seedance 2, Seedance 2 Fast, Seedance 2 Mini, Seedance 2.5, SadTalker
Um Vídeo de origem e ÁudioO mesmo vídeo, com os lábios ressincronizados com o novo áudio.Volcengine Lip Sync, Sync Lipsync v3, Lipsync 2 Pro, HeyGen Lipsync Precision, LatentSync, Video-Retalking
Um dos dois, e ÁudioO Wav2Lip aceita um retrato ou um vídeo.Wav2Lip

Entradas

EntradaAceitaO que faz
ÁudioNós de áudioA fala ou a narração. Obrigatória em todos os modelos.
RetratoNós de imagemUma foto nítida de um rosto, para os modelos de retrato.
Vídeo de origemNós de vídeoO clipe a dublar, para os modelos de dublagem.

A saída, Vídeo, é a URL do vídeo com os lábios sincronizados. Quando vários nós estão conectados, o cartão do nó permite escolher qual imagem, qual vídeo e qual áudio usar.

Configurações

ConfiguraçãoO que faz
ProvedorO modelo de sincronização labial. O padrão é o Kling Avatar.
ResoluçãoNo Kling Avatar, no Kling Avatar Pro, no InfiniTalk e nos modelos Seedance: 480p ou 720p, com 720p como padrão. O Seedance 2 também oferece 1080p. O OmniHuman 1.5 oferece 720p ou 1080p, com 1080p como padrão.
Prompt de movimento (opcional)Nos mesmos modelos: movimentos da cabeça e das expressões, por exemplo “slight head nods” ou “expressive eyebrows”. No OmniHuman 1.5, ele dirige a atuação inteira.
Texto antes e depoisTexto sempre adicionado antes e depois do prompt de movimento. Veja Texto antes e depois do prompt.

Configurações de modelos específicos

ModeloConfigurações
OmniHuman 1.5O Prompt de movimento dirige a atuação, por exemplo “sing confidently into a microphone”. O Modo rápido troca um pouco de qualidade por velocidade. A Seed torna um resultado repetível; -1 significa aleatória. Ele anima pessoas, animais de estimação e anime em qualquer proporção.
HeyGen Lipsync PrecisionDuração dinâmica (ativada) ajusta a duração da saída ao novo áudio. Remover faixa de música (desativada) tira a música de fundo do vídeo de origem. Aprimoramento de fala (desativado) melhora a clareza da fala.
Lipsync 2 ProO Modo de sincronização define o que acontece quando o áudio e o vídeo têm durações diferentes: Loop (o padrão), Ida e volta, Cortar, Silêncio ou Remapear. A Temperatura, de 0 a 1, define quão expressiva é a sincronização labial; o padrão é 0,5. A Detecção do falante ativo sincroniza quem estiver falando.
Sync Lipsync v3Modo de sincronização, com Cortar como padrão, e Detecção do falante ativo, que você deve ativar em um vídeo com mais de uma pessoa. O modelo controla a própria expressividade.
Volcengine Lip SyncModo: Leve, para um só falante de frente, mais rápido, ou Básico, para cenas complexas com vários falantes. Separar vocais (reduzir ruído) tira o ruído do áudio. Detecção de cenas + identificação de falantes (só no Básico) encontra os cortes de cena e quem fala. Repetir o vídeo em loop se o áudio for mais longo (só no Leve, ativado por padrão) e Loop reverso (ida e volta) tratam o áudio que passa do fim do vídeo. Início do template (segundos) define em que ponto do vídeo os lábios começam a acompanhar o áudio. A saída tem a duração do áudio: um vídeo mais longo é cortado, e um mais curto é repetido em loop.

Os modelos Seedance fazem sincronização labial nativa, no nível dos fonemas, em mais de 8 idiomas. Eles funcionam como o Gerar vídeo (Generate Video), com o áudio enviado como áudio de referência.

Modelos

ModeloDesenvolvedorModosCréditosDetalhes
minimax-h3MiniMaxImagem para vídeo, Texto para vídeoa partir de 253MiniMax Hailuo 3 — nível multimodal premium: quadro inicial e final mais referências de imagem, vídeo e áudio, áudio nativo, saída em 2K (padrão) ou 768P e preço por segundo, de 4 a 15 s.
Kling Avatar StandardKuaishouSincronização labial308Sincroniza os lábios de um retrato estático com um áudio guia. Qualidade padrão.
Kling Avatar ProKuaishouSincronização labial616Sincronização labial premium — formato da boca e tempo mais precisos.
Seedance 2BytedanceImagem para vídeo, Texto para vídeoa partir de 253Seedance 2 — nível premium com áudio nativo. Preço por segundo conforme a resolução.
Seedance 2 FastBytedanceImagem para vídeo, Texto para vídeoa partir de 198Nível mais barato e mais rápido do Seedance 2.
Seedance 2 MiniBytedanceImagem para vídeo, Texto para vídeoa partir de 132Nível econômico do Seedance 2 — só 480p/720p, preço por segundo conforme a resolução.
Seedance 2.5BytedanceImagem para vídeo, Texto para vídeoa partir de 374Seedance 2.5 — até 30 s em uma única tomada, áudio nativo e amplas referências multimodais. 480p/720p/1080p.
OmniHuman 1.5BytedanceSincronização labiala partir de 1.122Avatar falante premium dirigido por prompt, a partir de uma imagem fixa e um áudio. 720p / 1080p, até 60 s. Pessoas, pets e anime.
InfiniTalkInfiniTalkSincronização labiala partir de 121Cabeça falante guiada por áudio, a partir de uma imagem fixa. 480p / 720p.
Sync Lipsync v3SyncSincronização labiala partir de 1.100Dubla um vídeo existente — sincroniza de novo os lábios com uma nova faixa de áudio. Entrada de vídeo, cobrança por segundo.
Volcengine Lip SyncVolcengineSincronização labiala partir de 330Dublagem de vídeo para vídeo com IA — sincroniza de novo os lábios com uma nova faixa de voz. Vários falantes (detecção de cenas e identificação de falantes) no modo básico. Entrada de vídeo, cobrança por segundo.

A lista Provedor também oferece o HeyGen Lipsync Precision e o Lipsync 2 Pro para dublagem. Ela traz ainda o LatentSync, o melhor para canto, o Wav2Lip, o mais rápido e mais barato, o Video-Retalking, com aprimoramento de rosto embutido, e o SadTalker. O Hailuo 3 (minimax-h3) está disponível pela API, e não na lista Provedor.

Duração do áudio

ModeloÁudio mais longo
Kling Avatar, Kling Avatar Pro5 minutos
Volcengine Lip Sync5 minutos
HeyGen Lipsync Precision, Lipsync 2 Pro, Sync Lipsync v35 minutos, como limite de reserva
OmniHuman 1.560 segundos
InfiniTalk15 segundos
Seedance 2 Fast15,2 segundos por clipe
Seedance 2.530 segundos por clipe

No Kling Avatar, no InfiniTalk, no OmniHuman 1.5 e no Volcengine Lip Sync, um áudio mais longo que o limite é cortado antes da execução. No HeyGen Lipsync Precision, no Lipsync 2 Pro e no Sync Lipsync v3, 5 minutos é o limite de reserva de créditos, e não um corte: clipes mais longos reservam a faixa de 5 minutos. Execuções longas no Kling Avatar e no Volcengine Lip Sync podem levar dezenas de minutos, e o editor espera por até cerca de uma hora.

Créditos

A maioria dos modelos cobra por segundo, arredondando para cima até a próxima faixa de duração. O chip de créditos no nó é atualizado quando o áudio é conectado, porque o nó mede a duração dele. Quando a duração é desconhecida, a faixa de 5 minutos é reservada. Os créditos além do custo real são reembolsados quando o vídeo fica pronto.

Modelo15 s30 s1 min2 min5 min
Kling Avatar (720p)3306601.3202.6406.600
Kling Avatar Pro (1080p)6601.3202.6405.28013.200
OmniHuman 1.51.1222.2334.455——
Volcengine Lip Sync3306601.3202.6406.600
HeyGen Lipsync Precision5611.1112.2114.41111.011
Lipsync 2 Pro6931.3752.7505.50013.739
Sync Lipsync v31.1002.2004.4008.80022.000
  • O OmniHuman 1.5 aceita no máximo 60 segundos de áudio, então só valem as faixas de 15 segundos, 30 segundos e 1 minuto. A resolução dele não muda o preço.
  • O InfiniTalk tem um preço fixo por execução: 121 créditos em 480p e 462 em 720p.
  • Os modelos Seedance são cobrados por segundo, do mesmo jeito que no Gerar vídeo.

Dicas

  • Use um retrato nítido e de frente. A qualidade do rosto importa mais que a resolução: uma foto nítida em 720p funciona melhor que uma foto 4K borrada.
  • Limpe o áudio antes. Fala sem música nem ruído sincroniza melhor. Use o Extrator de voz (Voice Extractor) para isolar a voz.
  • Adicione pequenos movimentos. Um prompt de movimento como “slight head nods” aumenta o realismo.
  • Duble em vários idiomas. Traduza a fala com o Dublagem (Dubbing) ou com uma nova narração e depois ressincronize os lábios com um modelo de dublagem.
  • Clipes curtos são baratos. Com o preço por segundo, uma fala curta custa pouco; acompanhe o chip de créditos depois de conectar o áudio.

Pela API

Quando você chamar o Sync Lipsync v3 ou o Volcengine Lip Sync pela API, pelo SDK ou pelo MCP, passe audioDurationSec, a duração da saída em segundos. Sem esse campo, a execução é cobrada na faixa de 5 minutos, sem reembolso: 22.000 créditos no Sync Lipsync v3 e 6.600 no Volcengine Lip Sync. O editor mede o áudio para você. Veja Executar um único nó.

Perguntas frequentes

Última atualização

Nesta página