Fala para vídeo
Gere um vídeo guiado por uma faixa de fala com o Wan 2.2. Conecte o áudio da fala, um retrato e um prompt e receba um vídeo falado a partir de 33 créditos.
O nó Fala para vídeo (Speech to Video) gera um vídeo guiado por uma faixa de fala. Ele usa o modelo de fala para vídeo Wan 2.2: conecte o áudio da fala e, se quiser, um retrato e um prompt que descreve a cena, e o nó retorna um vídeo falado que acompanha a fala.
Quando usar
- Uma apresentação em vídeo guiada por uma narração.
- Conteúdo animado a partir de um podcast ou de uma narração.
- Um personagem falante animado a partir da faixa de voz dele.
Para fazer um retrato ou um clipe existente falar, com mais modelos para escolher, use o Sincronização labial (Lip Sync).
Início rápido
Adicionar o nó
Pressione Tab no canvas e escolha Vídeo › Animação e atuação › Fala para vídeo.
Conectar a fala e o retrato
Conecte a Áudio um nó de áudio com fala clara, por exemplo o Texto para fala (Text to Speech). Conecte um retrato a Retrato.
Descrever a cena
Escreva o Prompt no painel de configurações, por exemplo “a presenter speaking in a bright studio”, e escolha a Resolução.
Executar
Clique em Executar. O vídeo aparece no nó.
Entradas
| Entrada | Aceita | O que faz |
|---|---|---|
| Áudio | Nós de áudio | A fala que guia o vídeo. Obrigatória. |
| Retrato | Nós de imagem | Uma imagem de referência de quem fala. Opcional. |
| Prompt | Nós de texto e seletores | A descrição da cena. Você também pode digitá-la no painel de configurações. |
| Cinematografia | Seletores de look e de câmera, como Iluminação (Lighting), Lente (Lens) e Movimento de câmera (Camera Motion) | Cada seletor adiciona as palavras dele ao prompt. |
A saída, Vídeo, é a URL do vídeo gerado.
Configurações
| Configuração | O que faz |
|---|---|
| Resolução | 480p, 580p ou 720p. O preço de cada uma aparece na lista. |
| Prompt | A cena a mostrar enquanto a fala toca. |
| Prompt negativo | O que deixar de fora do vídeo. |
| Texto antes e depois | Texto sempre adicionado antes e depois do prompt. Veja Texto antes e depois do prompt. |
Clique em Mostrar configurações avançadas para um controle mais fino. Deixe um campo vazio para usar o padrão do modelo.
| Configuração | O que faz |
|---|---|
| Seed (opcional) | Um número fixo que torna uma execução repetível. Vazio significa aleatório. |
| Número de quadros (16-81) | Quantos quadros gerar. |
| FPS (8-24) | Quadros por segundo. |
| Passos de inferência (1-50) | Mais passos dão mais detalhes, mas demoram mais. |
| Escala de orientação (0-20) | O quanto o vídeo segue o prompt. Mais alta é mais fiel; mais baixa é mais variada. |
| Deslocamento (0-20) | Um parâmetro do modelo para ajustar o resultado com precisão. |
Créditos
O preço depende da resolução: 33 créditos em 480p, 55 em 580p e 66 em 720p.
Dicas
- Use uma fala limpa. Uma voz clara e bem gravada dá o melhor resultado.
- Descreva a cena. Um prompt junto com o áudio dá mais controle sobre a imagem.
- Faça prévias baratas. Use 480p para prévias rápidas e 720p para o vídeo final.
- Mude as configurações avançadas por último. Comece com os padrões e, se precisar de mais detalhes, aumente Passos de inferência.
Perguntas frequentes
Páginas relacionadas
Sincronização labial
Avatar de IA
Texto para fala
Movimento de câmera
Última atualização
Sincronização labial
Faça um retrato falar uma faixa de áudio ou duble um vídeo ressincronizando os lábios com uma nova fala, com Kling Avatar, OmniHuman, Seedance e outros.
Transferir movimento
Faça o personagem de uma imagem fixa repetir os movimentos de um vídeo de referência, como uma dança ou um gesto, com Kling 2.6, Kling 3.0 ou Wan Animate.