Avatar de IA
Crie um vídeo com um avatar falante no HeyGen. Escolha um avatar ou anime a sua própria imagem e dê a ele um texto e uma voz, ou uma narração gravada.
O nó Avatar de IA (AI Avatar) cria um vídeo com um avatar falante no HeyGen. Você escolhe quem fala, um visual de avatar do HeyGen ou a sua própria imagem, e o que ele diz, um texto lido por uma voz escolhida ou uma narração gravada. O nó retorna um vídeo do avatar falando, em até 4K.
Quando usar
- Uma demonstração de produto ou um vídeo explicativo com o mesmo apresentador em todos os vídeos.
- Mensagens de vídeo personalizadas em grande escala, com um texto por destinatário a partir de uma lista.
- Um vídeo com porta-voz em vários idiomas: mude o texto e escolha uma voz no idioma correspondente.
- Um vídeo em estilo de telejornal ou de pessoa falando para a câmera, a partir de um texto que outro nó escreve.
Para uma cena cinematográfica com visuais de avatar e sem texto, use o Avatar cinematográfico (Cinematic Avatar). Para fazer qualquer rosto falar uma faixa de áudio, use a Sincronização labial (Lip Sync).
Início rápido
Adicionar o nó
Pressione Tab no canvas e escolha Vídeo › Animação e atuação › Avatar de IA.
Escolher quem fala
No cartão do nó, em Comece com um avatar, clique em um dos visuais em destaque, pesquise no catálogo ou clique em Ver todos para abrir o catálogo completo. Para animar o seu próprio retrato, clique em Usar uma imagem em vez disso e envie uma imagem, cole uma URL ou conecte um nó de imagem.
Definir a voz e o texto
Clique na voz no cartão para escolher uma, com uma prévia de cada. Escreva o texto no cartão ou conecte um nó de texto à entrada Texto. O cartão mostra o número de caracteres e uma duração estimada.
Executar
Quando a barra de status disser que o nó está pronto, clique em Executar. O vídeo aparece no nó.
Quem fala e como
Origem decide de onde vem a imagem:
| Origem | O que você fornece | Observações |
|---|---|---|
| Avatar (padrão) | Um visual de avatar do HeyGen, escolhido no catálogo | Animado pelo mecanismo Avatar IV ou Avatar V. |
| Imagem | A sua própria imagem: conectada à entrada Imagem, colada como URL ou enviada | Não é preciso criar nem treinar um avatar. O modo de imagem usa um mecanismo próprio, cobrado como o Avatar IV. |
Modo de fala decide de onde vem a voz:
| Modo de fala | O que você fornece | Voz |
|---|---|---|
| Texto (TTS) (padrão) | Um texto de até 5.000 caracteres e uma voz do seletor de vozes | Texto para fala do HeyGen, na voz e na velocidade escolhidas. |
| Áudio conectado | Um nó de áudio conectado à entrada Áudio | Exatamente como foi gravado, sem texto para fala. Um áudio de mais de 10 minutos (600 segundos) é cortado, e o resultado informa isso. |
As duas origens aceitam os dois modos de fala e as mesmas configurações de voz, fundo, legendas e movimento.
O cartão do nó
O próprio cartão guia você pela configuração, então raramente você precisa do painel de configurações para uma primeira execução.
| Estado | O que o cartão mostra |
|---|---|
| Vazio | Comece com um avatar: uma fileira de visuais em destaque, uma caixa de pesquisa em todo o catálogo, Ver todos e Usar uma imagem em vez disso. No modo de imagem, Começar com uma imagem mostra uma área de envio e Escolher avatar para voltar. |
| Configurado | O retrato com o selo do mecanismo e Trocar avatar ou Substituir imagem; a voz com um botão de prévia; e o texto, editável ali mesmo, com a contagem de caracteres e uma duração estimada. Um texto conectado aparece como somente leitura, com o nome do nó de origem. No modo Áudio conectado, o cartão mostra a conexão de áudio no lugar do texto. |
| Gerado | O vídeo. Executar cria outra versão por cima das anteriores. Nova execução oculta os resultados e traz de volta a configuração para você começar do zero; nada é executado até você clicar em Executar, e um segundo clique em Nova execução restaura os resultados. |
| Com falha | O erro em vermelho na barra de status. Uma versão anterior continua visível, com um aviso que informa a falha. |
Uma barra de status na parte de baixo sempre informa se o nó pode ser executado e o que falta, por exemplo “Precisa de uma voz antes de executar”, e qual mecanismo e qual resolução vão renderizar. O modo de texto precisa de um texto e de uma voz. O Áudio conectado precisa de um áudio conectado. O modo de avatar precisa de um avatar, e o modo de imagem precisa de uma imagem. Uma entrada conectada conta mesmo antes de ter produzido algo.
Escolher um avatar
Ver todos abre a janela Escolher avatar, organizada por apresentador, e não por visual:
- Pesquisa por nome, visual ou cena. Ctrl+K leva o foco para a caixa de pesquisa.
- Bibliotecas à esquerda: Todos os avatares, Seus visuais, quando a conta do HeyGen tem visuais próprios, e Usados recentemente. Filtre por Gênero e Cena, e ative o filtro Avatar V para ver só os apresentadores com visuais Avatar V.
- Cartões mostram um apresentador cada, com o número de visuais. Carregar mais 24 mostra a próxima página.
- A coluna de detalhes mostra o visual selecionado em tamanho grande, os outros visuais do apresentador, os mecanismos, a orientação e a voz padrão, Ouvir prévia da voz e Usar este avatar.
Escolher um visual também define a voz padrão dele, quando você ainda não escolheu uma, e a proporção que combina com a orientação do visual. Um visual que o HeyGen ainda está criando mostra Processando… e não pode ser escolhido até ficar pronto.
O catálogo tem milhares de visuais e carrega em segundo plano; você pode escolher assim que vir o que quer.
Configurações
| Configuração | O que faz |
|---|---|
| Origem | Avatar ou Imagem. Veja Quem fala e como. |
| Modo de fala | Texto (TTS) ou Áudio conectado. |
| Avatar | O visual de avatar do HeyGen, no modo de avatar. O seletor filtra por gênero, por visuais Padrão ou Personalizado e pela compatibilidade com o Avatar V. |
| Imagem de origem | A imagem a animar, no modo de imagem: conecte-a à entrada Imagem, cole uma URL ou envie o arquivo. |
| Voz | A voz do texto, no modo de texto, com filtros de idioma, sotaque e gênero e uma prévia. |
| Texto | O que o avatar diz, até 5.000 caracteres, no modo de texto. |
| Velocidade da voz | A velocidade da fala, de 0,5 a 1,5. O padrão é 1,0. |
| Mecanismo | HeyGen Avatar IV (o padrão) ou HeyGen Avatar V, o mecanismo premium. Só no modo de avatar. Se o visual não for compatível com o Avatar V, o painel avisa você e o nó passa a usar o Avatar IV. |
| Resolução | 720p (o padrão), 1080p ou 4K. |
| Proporção | 16:9 (o padrão) ou 9:16. |
| Gerar legendas (SRT) | Cria um arquivo de legendas junto com o vídeo. |
Configurações avançadas
Clique em Mostrar opções avançadas para ter mais controle.
| Configuração | O que faz |
|---|---|
| Tom e Volume | Ajustam a voz. O tom vai de -50 a +50. Só no modo de texto. |
| Localidade (opcional) | Uma localidade de idioma para a voz, por exemplo en-US. Só no modo de texto. |
| Mecanismo de TTS | Padrão do HeyGen, ElevenLabs ou Fish. Com o ElevenLabs, escolha um Modelo (v3 (recomendado), Multilingual v2, Turbo v2.5 ou Flash v2.5) e ajuste Estabilidade, Similaridade, Estilo e Realce do locutor. Com o Fish, ajuste Estabilidade e Similaridade. Só no modo de texto. |
| Fundo | Nenhum, Cor ou Imagem atrás do avatar. |
| Remover fundo | Remove o fundo do próprio avatar. |
| Embutir legendas no vídeo | Grava as legendas na imagem. Também ativa a geração de legendas. |
| Formato de saída | MP4 ou WebM. |
| Ajuste | Preencher ou Ajustar. |
| Prompt de movimento (opcional) e Expressividade | Descreva o movimento do avatar e escolha uma expressividade Baixa (o padrão), Média ou Alta. Disponível com o Avatar IV e no modo de imagem. |
Créditos
O preço depende do mecanismo, da resolução e da duração real do vídeo. O Avatar V custa mais que o Avatar IV, e resoluções mais altas custam mais. O modo de imagem é cobrado como o Avatar IV. As legendas não têm custo extra. O editor mostra o custo antes de você executar.
- Uma reserva e, depois, a cobrança real. Os créditos são reservados quando a execução começa. Quando o vídeo fica pronto, você paga pela duração real dele, e o resto é reembolsado.
- O modo de texto reserva com base no tamanho do texto e na velocidade da voz. Uma voz mais lenta reserva um pouco mais, porque o vídeo vai ficar mais longo.
- O Áudio conectado reserva com base na duração medida do seu clipe, até o limite de 10 minutos.
Quando o HeyGen não está configurado
Em uma instalação self-hosted sem uma chave do HeyGen, os seletores de avatar e de voz ficam vazios e mostram um aviso para adicionar uma chave do HeyGen ou conectar ao Nodaro Cloud. Uma execução então falha com o erro heygen_not_configured. Um workflow criado em outro lugar continua mostrando o avatar e a voz dele. Veja Conectar ao Nodaro Cloud.
Dicas
- Faça rascunhos baratos. Comece com o Avatar IV em 720p e depois passe para 1080p ou para o Avatar V no vídeo final.
- Ouça as vozes antes. Escute a prévia antes de entregar um texto longo a uma voz.
- Use o Áudio conectado para um ritmo exato. Uma narração gravada ou gerada, por exemplo com o Texto para fala (Text to Speech), dá a você controle total do tempo e da voz.
- Use o formato vertical nas redes sociais. O 9:16 é ideal para TikTok, Instagram Reels e YouTube Shorts.
Perguntas frequentes
Páginas relacionadas
Avatar cinematográfico
Sincronização labial
Texto para fala
Adicionar legendas
Última atualização
Gerar roteiro
Escreva com IA um roteiro de vídeo com várias cenas. Cada cena traz descrição, ação, clima, duração, câmera, diálogos e um prompt de imagem pronto.
Avatar cinematográfico
Crie, a partir de um prompt, um clipe cinematográfico curto com 1 a 3 visuais de avatar do HeyGen. Sem texto nem voz: o prompt dirige cena, ação e câmera.