Docs do Nodaro
DocumentaçãoReferência de nósModelosAgentes de IA (MCP)DesenvolvedoresSelf-hostingPesquisa
Áudio

Modificador de voz Pro

Detecte cada falante de uma gravação ou de um vídeo com fala e dê a cada um uma nova voz, mantendo a emoção e o timing originais. Preço por minuto de fala.

Disponível em Nodaro Cloud

O nó Modificador de voz Pro (Voice Changer Pro) dá a cada falante de uma conversa uma nova voz própria. Ele detecta cada falante de uma gravação ou de um vídeo com fala e troca a voz do falante 1 pela sua primeira voz, a do falante 2 pela sua segunda voz, e assim por diante. Cada falante mantém a emoção, o ritmo e o timing originais, então uma cena de diálogo, um podcast ou uma entrevista inteira ganha novas vozes em uma única execução.

O Modificador de voz Pro roda no Nodaro Cloud. Em uma instalação self-hosted, o nó mostra a marca NODARO e é executado pela sua conexão com o Nodaro Cloud, com cobrança na conta do nodaro.ai conectada.

Quando usar

  • Trocar em uma única etapa as vozes de um vídeo de diálogo com vários personagens.
  • Substituir todas as vozes de um podcast ou de uma entrevista por vozes anônimas.
  • Escolher vozes de personagem específicas para uma cena e manter a interpretação original.
  • Transformar uma gravação de rascunho com vários falantes em uma narração bem acabada.
  • Trocar as vozes dos convidados de um painel enquanto o apresentador mantém a própria voz.

Para uma gravação com um só falante, o Modificador de voz (Voice Changer) basta.

Início rápido

Adicione o nó

Pressione Tab no canvas e escolha Áudio › Vozes › Modificador de voz Pro.

Conecte a gravação

Conecte um nó de áudio à entrada Áudio ou um vídeo com fala à entrada Vídeo.

Adicione uma voz por falante

Abra o painel de configurações. Use Adicionar voz uma vez para cada falante, na ordem em que os falantes falam pela primeira vez. Para um falante que deve manter a própria voz, clique em Manter original — não trocar a voz deste falante.

Execute

Clique em Executar no nó. Para um vídeo, o vídeo com as novas vozes aparece na saída Vídeo, e a nova faixa de áudio, na saída Áudio.

vídeovídeoEnviar vídeoEntrevista, 3 falantesModificador de voz ProRachel · Manter original · AriaAdicionar legendas
Uma entrevista com três falantes: o apresentador mantém a própria voz, os dois convidados ganham vozes novas, e o resultado recebe legendas.

Entradas e saídas

EntradaAceitaO que faz
ÁudioNós de áudio, como Enviar áudio (Upload Audio) e Texto para diálogo (Text to Dialogue)A gravação cujos falantes ganham vozes novas. O nó retorna áudio.
VídeoNós de vídeo, como Enviar vídeo (Upload Video) e Gerar vídeo (Generate Video)O vídeo com fala que recebe as novas vozes. O nó retorna o vídeo com as novas vozes.

Quando as duas entradas estão conectadas, o vídeo prevalece e a entrada de áudio é ignorada.

SaídaO que traz
ÁudioO áudio com as novas vozes. Sempre gerado. Para um vídeo, é a nova faixa de áudio.
VídeoO vídeo com as novas vozes. Só é gerado quando um vídeo está conectado.

O arquivo decide o modo, não a entrada. Antes de começar qualquer trabalho, o nó verifica o que o arquivo realmente contém:

  • Um arquivo só de áudio na entrada Vídeo, como uma gravação de voz salva como .mp4 ou .m4a, é executado como áudio. Você recebe o áudio com as novas vozes, a saída Vídeo fica vazia, e nada falha.
  • Um vídeo na entrada Áudio tem o som extraído primeiro e é tratado como áudio.

Como os falantes recebem as vozes

O nó encontra cada falante da gravação e os numera na ordem em que cada um fala pela primeira vez. A sua lista de vozes é associada a essa ordem.

Sua listaFalante 1Falante 2Falante 3Falante 4
Rachel, Manter original, AriaRachelVoz originalAriaVoz original
  • Até 8 vozes. A lista tem de 1 a 8 entradas, e pelo menos uma entrada precisa ser uma voz de verdade.
  • Posições que mantêm a voz original. Uma entrada Manter original deixa a voz desse falante inalterada, enquanto os falantes seguintes continuam ganhando vozes novas.
  • Listas mais curtas. Os falantes que passarem do fim da lista mantêm a voz original.
  • Edite a lista. Mova uma voz com as setas para cima e para baixo, transforme-a, com Manter, em uma posição que mantém a voz original, ou remova-a.

Se você não tiver certeza de quem fala primeiro, passe a gravação pelo Transcrever (Transcribe) com Identificação de falantes ativada e leia os rótulos de falante.

Configurações

ConfiguraçãoO que faz
Adicionar vozAbre o explorador de vozes e adiciona a voz escolhida ao fim da lista. Vozes prontas, da Biblioteca de vozes e as suas próprias vozes funcionam.
Manter original — não trocar a voz deste falanteAdiciona ao fim da lista uma posição que mantém a voz original.
ModeloMultilingual v2 (o padrão) cobre 29 idiomas e é o modelo recomendado pela ElevenLabs, inclusive para inglês. English v2 é só para inglês.
Qualidade da separaçãoRápido — preserva mais a voz (o padrão) ou Qualidade — separação mais precisa.
Preservar a música de fundoAtivado (o padrão) mixa de volta a música e os efeitos sonoros separados sob as novas vozes. Desativado os descarta, para um resultado só com as vozes.
Volume da músicaO nível da música preservada: Igual à origem (o padrão) mantém o nível original, Normalizar nivela o volume, e Manual define o Nível da música de 0 a 200%. Só quando Preservar a música de fundo está ativado.
Efeitos de vozNenhum (o padrão), ou um reverb ou eco nas novas vozes. Veja Efeitos de voz.
Remover ruído de fundoVem desativado por padrão. Remove o ruído do resultado. As vozes já são isoladas automaticamente, então esta opção pode ser desnecessária.

Configurações de cada voz

Abra Configurações de voz abaixo de uma voz para ajustar só aquele falante. Deixe uma configuração sem mexer para usar o padrão do modelo.

ConfiguraçãoO que faz
Mecanismo de conversãoConversão (o padrão) converte a fala e mantém a interpretação original. Releitura (v3) gera uma nova interpretação a partir da transcrição com o ElevenLabs v3 e entende tags de áudio. A interpretação original é substituída, e, em um vídeo, os lábios deixam de corresponder.
EstabilidadeDe 0 a 1 na Conversão. Na Releitura: Mais variável (0), Equilibrado (0,5) ou Mais estável (1,0). Mais alto é mais estável, e mais baixo é mais expressivo.
SemelhançaDe 0 a 1. O quanto o resultado segue o timbre da voz de destino. Só na Conversão.
Exagero de estiloDe 0 a 1. Acima de 0, amplifica a interpretação, com mais latência e menos estabilidade. Só na Conversão.
Reforço do falanteAumenta a semelhança com a voz de destino, com um pouco mais de latência. Só na Conversão.
VolumeIgual à origem (o padrão) acompanha o volume do falante original. Normalizar nivela o volume. Manual define um nível de 0 a 200%.
SeedUm número inteiro de 0 a 4.294.967.295. A mesma origem, as mesmas configurações e a mesma seed trocam a voz deste falante de forma idêntica. Deixe vazio para usar uma seed aleatória.

Como o fundo é mantido

Antes de trocar qualquer voz, o nó sempre divide a gravação em uma faixa de voz e uma faixa de música e efeitos. Preservar a música de fundo não decide se essa divisão acontece. A opção só decide se a faixa de música é mixada de volta sob as novas vozes.

Se a música vazar para as novas vozes, ou se uma voz soar fina, defina Qualidade da separação como Qualidade — separação mais precisa. Mantenha Rápido quando a velocidade importar ou quando as vozes já soarem limpas.

Adicione um ambiente ou um eco às vozes

Efeitos de voz adiciona um efeito a todas as novas vozes juntas, antes de a música ser mixada de volta. O efeito fica só nas vozes, então, com Preservar a música de fundo ativado, a música continua seca sob uma voz com reverb.

  • Espaços de reverb: Sala (ambiente interno), Banheiro, Interior de carro, Salão / saguão, Sala de concertos, Igreja, Caverna, Arena / estádio e Externo (ao ar livre). O Mix wet / dry, de 0 a 100, define quanto do ambiente você ouve.
  • Timbre: Telefone, Megafone / alto-falante, Eco / slapback e Personalizado. Eco e Personalizado usam Atraso (ms), de 20 a 2.000, e Decaimento, de 0 a 1, em que um decaimento maior gera mais repetições.

A página Efeitos de áudio descreve cada predefinição.

Troque as vozes de um vídeo inteiro

Conecte qualquer vídeo com fala à entrada Vídeo. O nó então:

  1. Extrai a faixa de áudio do clipe.
  2. Detecta cada falante na ordem em que cada um fala pela primeira vez.
  3. Troca a voz de cada falante pela voz correspondente.
  4. Coloca as novas vozes de volta no vídeo original e retorna o vídeo e a nova faixa de áudio.

O vídeo precisa de uma faixa de áudio. A maioria dos modelos de texto para vídeo e de imagem para vídeo gera vídeo sem som, e um clipe sem som falha na hora. Use um clipe com fala, ou conecte uma gravação à entrada Áudio.

Créditos

Só as vozes trocadas custam créditos. As posições que mantêm a voz original e os falantes além do fim da sua lista passam de graça.

  • Uma voz com Conversão é cobrada pela duração do stem dela. O stem vai do início do clipe até a última fala desse falante. A tarifa é 44 créditos por minuto, contados por segundo. Cada voz é arredondada para cima, e depois o total da execução, então uma execução pode custar um pouco mais que a tarifa multiplicada pela duração dos stems.
  • Uma voz com Releitura é cobrada a 33 créditos por 1.000 caracteres iniciados do texto que ela fala.
  • Mínimo. Cada voz é cobrada como pelo menos 6 segundos de fala, e cada execução também.
VozesCobrado como
1 voz (Conversão) cuja última fala termina em 26,76 segundos26,76 segundos de stem
1 voz (Conversão) com um stem de 60 segundos1 minuto, 44 créditos
1 voz (Conversão) com um stem de 61 segundos61 segundos de stem
1 voz (Conversão) com um stem de 3 segundos6 segundos de stem, o mínimo
2 vozes (Conversão) com stems de 60 segundos e 1 voz (Releitura) de 1.500 caracteres2 minutos de stem, mais 2 blocos iniciados de 1.000 caracteres

Você paga pelos stems que foram realmente convertidos, e nunca mais do que o valor reservado no início da execução.

Use como app

O Modificador de voz Pro também é um app independente, em voice.nodaro.ai. Cole um link ou envie um vídeo, escolha uma voz para cada falante e receba o vídeo convertido.

Dicas

  • Ordene as vozes com cuidado. A associação é por posição: a primeira voz vai para o primeiro falante a falar.
  • Ajuste cada falante separadamente. Cada voz tem as próprias configurações, então você pode deixar um falante mais estável e manter outro expressivo.
  • Equilibre o volume por falante. Use Volume em cada voz: Igual à origem reproduz o falante original, e Manual define um nível exato.
  • Associe menos vozes do que falantes. Só os falantes da lista mudam; todos depois deles mantêm a própria voz.
  • Mantenha a interpretação. A Conversão converte fala em fala, então a atuação original é preservada. Use Releitura (v3) só quando quiser uma nova interpretação, por exemplo em um projeto só de áudio.

Solução de problemas

Um falante soa robótico. Diminua a Semelhança ou a Estabilidade dessa voz, ou escolha uma voz com timbre mais próximo do falante original.

A música vaza para as vozes. Defina Qualidade da separação como Qualidade — separação mais precisa.

O falante errado recebeu uma voz. Os falantes são numerados por quem fala primeiro. Confira a ordem com o Transcrever e reordene as vozes.

Uma execução self-hosted é recusada com nodaro_connection_required. A instalação não tem conexão com o Nodaro Cloud. Conecte-a com OAuth ou com uma chave de API, como descrito em Conectar ao Nodaro Cloud.

Pela API

POST /v1/voice-changer-pro executa o nó por código, no Nodaro Cloud. orderedVoices associa o falante N à entrada N. Uma entrada é um ID de voz, um objeto com configurações por voz ou null para uma posição que mantém a voz original. O objeto de configurações recebe voiceId, engine ("sts" ou "v3"), stability, similarityBoost, style, useSpeakerBoost, seed, volumeMode e volume. Com engine: "v3", stability aceita só três valores (0, 0,5 e 1), e similarityBoost, style e useSpeakerBoost são ignorados. O campo sourceHasVideo do resultado informa se a execução usou o modo de vídeo ou o modo de áudio.

No Nodaro Cloud, você também pode executar o mesmo mecanismo em três etapas. Assim, você confere os falantes antes de pagar por uma troca de voz e mixa as faixas antes de renderizar:

  1. Análise. POST /v1/voice-changer-pro/analyze separa as vozes da música e detecta os falantes. Retorna os segmentos de tempo, a contagem de palavras e um trecho da transcrição de cada falante, além do idioma detectado. Custa 11 créditos.
  2. Troca de voz em stems. Chame POST /v1/voice-changer-pro com output: "stems" e a análise. Os falantes não são detectados de novo, então você pode trocar as vozes por outras quantas vezes quiser. O resultado é uma faixa seca por voz.
  3. Exportação. POST /v1/voice-changer-pro/export renderiza o vídeo final a partir da sua mixagem. Envie até 16 faixas, cada uma com um gain de 0 a 200, muted e um kind igual a voice ou background, além de um voiceFx opcional. Pelo menos uma faixa precisa estar com som. O fluxo de vídeo é copiado, nunca codificado de novo. Ajustar a mixagem é grátis; a exportação custa 2 créditos.

Os métodos do SDK são client.voices.analyze, client.voices.recast e client.voices.exportMix. Os comandos da CLI são nodaro voice analyze, nodaro voice recast e nodaro voice export. As ferramentas MCP são voice_changer_pro, voice_changer_pro_analyze e voice_changer_pro_export. Veja Voz e mídia.

Perguntas frequentes

Última atualização

Nesta página