Modificador de voz Pro
Detecte cada falante de uma gravação ou de um vídeo com fala e dê a cada um uma nova voz, mantendo a emoção e o timing originais. Preço por minuto de fala.
Disponível em Nodaro Cloud
O nó Modificador de voz Pro (Voice Changer Pro) dá a cada falante de uma conversa uma nova voz própria. Ele detecta cada falante de uma gravação ou de um vídeo com fala e troca a voz do falante 1 pela sua primeira voz, a do falante 2 pela sua segunda voz, e assim por diante. Cada falante mantém a emoção, o ritmo e o timing originais, então uma cena de diálogo, um podcast ou uma entrevista inteira ganha novas vozes em uma única execução.
O Modificador de voz Pro roda no Nodaro Cloud. Em uma instalação self-hosted, o nó mostra a marca NODARO e é executado pela sua conexão com o Nodaro Cloud, com cobrança na conta do nodaro.ai conectada.
Quando usar
- Trocar em uma única etapa as vozes de um vídeo de diálogo com vários personagens.
- Substituir todas as vozes de um podcast ou de uma entrevista por vozes anônimas.
- Escolher vozes de personagem específicas para uma cena e manter a interpretação original.
- Transformar uma gravação de rascunho com vários falantes em uma narração bem acabada.
- Trocar as vozes dos convidados de um painel enquanto o apresentador mantém a própria voz.
Para uma gravação com um só falante, o Modificador de voz (Voice Changer) basta.
Início rápido
Adicione o nó
Pressione Tab no canvas e escolha Áudio › Vozes › Modificador de voz Pro.
Conecte a gravação
Conecte um nó de áudio à entrada Áudio ou um vídeo com fala à entrada Vídeo.
Adicione uma voz por falante
Abra o painel de configurações. Use Adicionar voz uma vez para cada falante, na ordem em que os falantes falam pela primeira vez. Para um falante que deve manter a própria voz, clique em Manter original — não trocar a voz deste falante.
Execute
Clique em Executar no nó. Para um vídeo, o vídeo com as novas vozes aparece na saída Vídeo, e a nova faixa de áudio, na saída Áudio.
Entradas e saídas
| Entrada | Aceita | O que faz |
|---|---|---|
| Áudio | Nós de áudio, como Enviar áudio (Upload Audio) e Texto para diálogo (Text to Dialogue) | A gravação cujos falantes ganham vozes novas. O nó retorna áudio. |
| Vídeo | Nós de vídeo, como Enviar vídeo (Upload Video) e Gerar vídeo (Generate Video) | O vídeo com fala que recebe as novas vozes. O nó retorna o vídeo com as novas vozes. |
Quando as duas entradas estão conectadas, o vídeo prevalece e a entrada de áudio é ignorada.
| Saída | O que traz |
|---|---|
| Áudio | O áudio com as novas vozes. Sempre gerado. Para um vídeo, é a nova faixa de áudio. |
| Vídeo | O vídeo com as novas vozes. Só é gerado quando um vídeo está conectado. |
O arquivo decide o modo, não a entrada. Antes de começar qualquer trabalho, o nó verifica o que o arquivo realmente contém:
- Um arquivo só de áudio na entrada Vídeo, como uma gravação de voz salva como
.mp4ou.m4a, é executado como áudio. Você recebe o áudio com as novas vozes, a saída Vídeo fica vazia, e nada falha. - Um vídeo na entrada Áudio tem o som extraído primeiro e é tratado como áudio.
Como os falantes recebem as vozes
O nó encontra cada falante da gravação e os numera na ordem em que cada um fala pela primeira vez. A sua lista de vozes é associada a essa ordem.
| Sua lista | Falante 1 | Falante 2 | Falante 3 | Falante 4 |
|---|---|---|---|---|
| Rachel, Manter original, Aria | Rachel | Voz original | Aria | Voz original |
- Até 8 vozes. A lista tem de 1 a 8 entradas, e pelo menos uma entrada precisa ser uma voz de verdade.
- Posições que mantêm a voz original. Uma entrada Manter original deixa a voz desse falante inalterada, enquanto os falantes seguintes continuam ganhando vozes novas.
- Listas mais curtas. Os falantes que passarem do fim da lista mantêm a voz original.
- Edite a lista. Mova uma voz com as setas para cima e para baixo, transforme-a, com Manter, em uma posição que mantém a voz original, ou remova-a.
Se você não tiver certeza de quem fala primeiro, passe a gravação pelo Transcrever (Transcribe) com Identificação de falantes ativada e leia os rótulos de falante.
Configurações
| Configuração | O que faz |
|---|---|
| Adicionar voz | Abre o explorador de vozes e adiciona a voz escolhida ao fim da lista. Vozes prontas, da Biblioteca de vozes e as suas próprias vozes funcionam. |
| Manter original — não trocar a voz deste falante | Adiciona ao fim da lista uma posição que mantém a voz original. |
| Modelo | Multilingual v2 (o padrão) cobre 29 idiomas e é o modelo recomendado pela ElevenLabs, inclusive para inglês. English v2 é só para inglês. |
| Qualidade da separação | Rápido — preserva mais a voz (o padrão) ou Qualidade — separação mais precisa. |
| Preservar a música de fundo | Ativado (o padrão) mixa de volta a música e os efeitos sonoros separados sob as novas vozes. Desativado os descarta, para um resultado só com as vozes. |
| Volume da música | O nível da música preservada: Igual à origem (o padrão) mantém o nível original, Normalizar nivela o volume, e Manual define o Nível da música de 0 a 200%. Só quando Preservar a música de fundo está ativado. |
| Efeitos de voz | Nenhum (o padrão), ou um reverb ou eco nas novas vozes. Veja Efeitos de voz. |
| Remover ruído de fundo | Vem desativado por padrão. Remove o ruído do resultado. As vozes já são isoladas automaticamente, então esta opção pode ser desnecessária. |
Configurações de cada voz
Abra Configurações de voz abaixo de uma voz para ajustar só aquele falante. Deixe uma configuração sem mexer para usar o padrão do modelo.
| Configuração | O que faz |
|---|---|
| Mecanismo de conversão | Conversão (o padrão) converte a fala e mantém a interpretação original. Releitura (v3) gera uma nova interpretação a partir da transcrição com o ElevenLabs v3 e entende tags de áudio. A interpretação original é substituída, e, em um vídeo, os lábios deixam de corresponder. |
| Estabilidade | De 0 a 1 na Conversão. Na Releitura: Mais variável (0), Equilibrado (0,5) ou Mais estável (1,0). Mais alto é mais estável, e mais baixo é mais expressivo. |
| Semelhança | De 0 a 1. O quanto o resultado segue o timbre da voz de destino. Só na Conversão. |
| Exagero de estilo | De 0 a 1. Acima de 0, amplifica a interpretação, com mais latência e menos estabilidade. Só na Conversão. |
| Reforço do falante | Aumenta a semelhança com a voz de destino, com um pouco mais de latência. Só na Conversão. |
| Volume | Igual à origem (o padrão) acompanha o volume do falante original. Normalizar nivela o volume. Manual define um nível de 0 a 200%. |
| Seed | Um número inteiro de 0 a 4.294.967.295. A mesma origem, as mesmas configurações e a mesma seed trocam a voz deste falante de forma idêntica. Deixe vazio para usar uma seed aleatória. |
Como o fundo é mantido
Antes de trocar qualquer voz, o nó sempre divide a gravação em uma faixa de voz e uma faixa de música e efeitos. Preservar a música de fundo não decide se essa divisão acontece. A opção só decide se a faixa de música é mixada de volta sob as novas vozes.
Se a música vazar para as novas vozes, ou se uma voz soar fina, defina Qualidade da separação como Qualidade — separação mais precisa. Mantenha Rápido quando a velocidade importar ou quando as vozes já soarem limpas.
Adicione um ambiente ou um eco às vozes
Efeitos de voz adiciona um efeito a todas as novas vozes juntas, antes de a música ser mixada de volta. O efeito fica só nas vozes, então, com Preservar a música de fundo ativado, a música continua seca sob uma voz com reverb.
- Espaços de reverb: Sala (ambiente interno), Banheiro, Interior de carro, Salão / saguão, Sala de concertos, Igreja, Caverna, Arena / estádio e Externo (ao ar livre). O Mix wet / dry, de 0 a 100, define quanto do ambiente você ouve.
- Timbre: Telefone, Megafone / alto-falante, Eco / slapback e Personalizado. Eco e Personalizado usam Atraso (ms), de 20 a 2.000, e Decaimento, de 0 a 1, em que um decaimento maior gera mais repetições.
A página Efeitos de áudio descreve cada predefinição.
Troque as vozes de um vídeo inteiro
Conecte qualquer vídeo com fala à entrada Vídeo. O nó então:
- Extrai a faixa de áudio do clipe.
- Detecta cada falante na ordem em que cada um fala pela primeira vez.
- Troca a voz de cada falante pela voz correspondente.
- Coloca as novas vozes de volta no vídeo original e retorna o vídeo e a nova faixa de áudio.
O vídeo precisa de uma faixa de áudio. A maioria dos modelos de texto para vídeo e de imagem para vídeo gera vídeo sem som, e um clipe sem som falha na hora. Use um clipe com fala, ou conecte uma gravação à entrada Áudio.
Créditos
Só as vozes trocadas custam créditos. As posições que mantêm a voz original e os falantes além do fim da sua lista passam de graça.
- Uma voz com Conversão é cobrada pela duração do stem dela. O stem vai do início do clipe até a última fala desse falante. A tarifa é 44 créditos por minuto, contados por segundo. Cada voz é arredondada para cima, e depois o total da execução, então uma execução pode custar um pouco mais que a tarifa multiplicada pela duração dos stems.
- Uma voz com Releitura é cobrada a 33 créditos por 1.000 caracteres iniciados do texto que ela fala.
- Mínimo. Cada voz é cobrada como pelo menos 6 segundos de fala, e cada execução também.
| Vozes | Cobrado como |
|---|---|
| 1 voz (Conversão) cuja última fala termina em 26,76 segundos | 26,76 segundos de stem |
| 1 voz (Conversão) com um stem de 60 segundos | 1 minuto, 44 créditos |
| 1 voz (Conversão) com um stem de 61 segundos | 61 segundos de stem |
| 1 voz (Conversão) com um stem de 3 segundos | 6 segundos de stem, o mínimo |
| 2 vozes (Conversão) com stems de 60 segundos e 1 voz (Releitura) de 1.500 caracteres | 2 minutos de stem, mais 2 blocos iniciados de 1.000 caracteres |
Você paga pelos stems que foram realmente convertidos, e nunca mais do que o valor reservado no início da execução.
Use como app
O Modificador de voz Pro também é um app independente, em voice.nodaro.ai. Cole um link ou envie um vídeo, escolha uma voz para cada falante e receba o vídeo convertido.
Dicas
- Ordene as vozes com cuidado. A associação é por posição: a primeira voz vai para o primeiro falante a falar.
- Ajuste cada falante separadamente. Cada voz tem as próprias configurações, então você pode deixar um falante mais estável e manter outro expressivo.
- Equilibre o volume por falante. Use Volume em cada voz: Igual à origem reproduz o falante original, e Manual define um nível exato.
- Associe menos vozes do que falantes. Só os falantes da lista mudam; todos depois deles mantêm a própria voz.
- Mantenha a interpretação. A Conversão converte fala em fala, então a atuação original é preservada. Use Releitura (v3) só quando quiser uma nova interpretação, por exemplo em um projeto só de áudio.
Solução de problemas
Um falante soa robótico. Diminua a Semelhança ou a Estabilidade dessa voz, ou escolha uma voz com timbre mais próximo do falante original.
A música vaza para as vozes. Defina Qualidade da separação como Qualidade — separação mais precisa.
O falante errado recebeu uma voz. Os falantes são numerados por quem fala primeiro. Confira a ordem com o Transcrever e reordene as vozes.
Uma execução self-hosted é recusada com nodaro_connection_required. A instalação não tem conexão com o Nodaro Cloud. Conecte-a com OAuth ou com uma chave de API, como descrito em Conectar ao Nodaro Cloud.
Pela API
POST /v1/voice-changer-pro executa o nó por código, no Nodaro Cloud. orderedVoices associa o falante N à entrada N. Uma entrada é um ID de voz, um objeto com configurações por voz ou null para uma posição que mantém a voz original. O objeto de configurações recebe voiceId, engine ("sts" ou "v3"), stability, similarityBoost, style, useSpeakerBoost, seed, volumeMode e volume. Com engine: "v3", stability aceita só três valores (0, 0,5 e 1), e similarityBoost, style e useSpeakerBoost são ignorados. O campo sourceHasVideo do resultado informa se a execução usou o modo de vídeo ou o modo de áudio.
No Nodaro Cloud, você também pode executar o mesmo mecanismo em três etapas. Assim, você confere os falantes antes de pagar por uma troca de voz e mixa as faixas antes de renderizar:
- Análise.
POST /v1/voice-changer-pro/analyzesepara as vozes da música e detecta os falantes. Retorna os segmentos de tempo, a contagem de palavras e um trecho da transcrição de cada falante, além do idioma detectado. Custa 11 créditos. - Troca de voz em stems. Chame
POST /v1/voice-changer-procomoutput: "stems"e a análise. Os falantes não são detectados de novo, então você pode trocar as vozes por outras quantas vezes quiser. O resultado é uma faixa seca por voz. - Exportação.
POST /v1/voice-changer-pro/exportrenderiza o vídeo final a partir da sua mixagem. Envie até 16 faixas, cada uma com umgainde 0 a 200,mutede umkindigual avoiceoubackground, além de umvoiceFxopcional. Pelo menos uma faixa precisa estar com som. O fluxo de vídeo é copiado, nunca codificado de novo. Ajustar a mixagem é grátis; a exportação custa 2 créditos.
Os métodos do SDK são client.voices.analyze, client.voices.recast e client.voices.exportMix. Os comandos da CLI são nodaro voice analyze, nodaro voice recast e nodaro voice export. As ferramentas MCP são voice_changer_pro, voice_changer_pro_analyze e voice_changer_pro_export. Veja Voz e mídia.
Perguntas frequentes
Páginas relacionadas
Modificador de voz
Transcrever
Dublagem
Efeitos de áudio
Conectar ao Nodaro Cloud
Última atualização
Modificador de voz
Troque a voz de uma gravação ou de um vídeo com fala por outra voz e mantenha a emoção, o ritmo e o timing originais. Fala para fala com o ElevenLabs.
Design de voz
Crie uma nova voz a partir de uma descrição, com controle de modelo, volume, orientação e seed. Receba uma prévia em áudio e um ID de voz reutilizável.