# Modificador de voz Pro

> Detecte cada falante de uma gravação ou de um vídeo com fala e dê a cada um uma nova voz, mantendo a emoção e o timing originais. Preço por minuto de fala.

Source: https://nodaro.ai/pt-BR/docs/nodes/audio/voice-changer-pro

O nó **Modificador de voz Pro** (Voice Changer Pro) dá a cada falante de uma conversa uma nova voz própria. Ele detecta cada falante de uma gravação ou de um vídeo com fala e troca a voz do falante 1 pela sua primeira voz, a do falante 2 pela sua segunda voz, e assim por diante. Cada falante mantém a emoção, o ritmo e o timing originais, então uma cena de diálogo, um podcast ou uma entrevista inteira ganha novas vozes em uma única execução.

O Modificador de voz Pro roda no Nodaro Cloud. Em uma instalação self-hosted, o nó mostra a marca **NODARO** e é executado pela sua [conexão com o Nodaro Cloud](https://nodaro.ai/docs/self-hosting/cloud-connect), com cobrança na conta do nodaro.ai conectada.

- Found in: Audio › Voices
- Output: audio
- API type: `voice-changer-pro`

## Quando usar
- Trocar em uma única etapa as vozes de um vídeo de diálogo com vários personagens.
- Substituir todas as vozes de um podcast ou de uma entrevista por vozes anônimas.
- Escolher vozes de personagem específicas para uma cena e manter a interpretação original.
- Transformar uma gravação de rascunho com vários falantes em uma narração bem acabada.
- Trocar as vozes dos convidados de um painel enquanto o apresentador mantém a própria voz.

Para uma gravação com um só falante, o [**Modificador de voz** (Voice Changer)](https://nodaro.ai/docs/nodes/audio/voice-changer) basta.

## Início rápido
### Adicione o nó
Pressione Tab no canvas e escolha **Áudio › Vozes › Modificador de voz Pro**.

### Conecte a gravação
Conecte um nó de áudio à entrada **Áudio** ou um vídeo com fala à entrada **Vídeo**.

### Adicione uma voz por falante
Abra o painel de configurações. Use **Adicionar voz** uma vez para cada falante, na ordem em que os falantes falam pela primeira vez. Para um falante que deve manter a própria voz, clique em **Manter original — não trocar a voz deste falante**.

### Execute
Clique em **Executar** no nó. Para um vídeo, o vídeo com as novas vozes aparece na saída **Vídeo**, e a nova faixa de áudio, na saída **Áudio**.

Workflow: Uma entrevista com três falantes: o apresentador mantém a própria voz, os dois convidados ganham vozes novas, e o resultado recebe legendas.

- Enviar vídeo → Modificador de voz Pro (vídeo)
- Modificador de voz Pro → Adicionar legendas (vídeo)

## Entradas e saídas
| Entrada | Aceita | O que faz |
| --- | --- | --- |
| **Áudio** | Nós de áudio, como **Enviar áudio** (Upload Audio) e **Texto para diálogo** (Text to Dialogue) | A gravação cujos falantes ganham vozes novas. O nó retorna áudio. |
| **Vídeo** | Nós de vídeo, como **Enviar vídeo** (Upload Video) e **Gerar vídeo** (Generate Video) | O vídeo com fala que recebe as novas vozes. O nó retorna o vídeo com as novas vozes. |

Quando as duas entradas estão conectadas, o vídeo prevalece e a entrada de áudio é ignorada.

| Saída | O que traz |
| --- | --- |
| **Áudio** | O áudio com as novas vozes. Sempre gerado. Para um vídeo, é a nova faixa de áudio. |
| **Vídeo** | O vídeo com as novas vozes. Só é gerado quando um vídeo está conectado. |

**O arquivo decide o modo, não a entrada.** Antes de começar qualquer trabalho, o nó verifica o que o arquivo realmente contém:

- Um arquivo só de áudio na entrada **Vídeo**, como uma gravação de voz salva como `.mp4` ou `.m4a`, é executado como áudio. Você recebe o áudio com as novas vozes, a saída **Vídeo** fica vazia, e nada falha.
- Um vídeo na entrada **Áudio** tem o som extraído primeiro e é tratado como áudio.

## Como os falantes recebem as vozes
O nó encontra cada falante da gravação e os numera na ordem em que cada um fala pela primeira vez. A sua lista de vozes é associada a essa ordem.

| Sua lista | Falante 1 | Falante 2 | Falante 3 | Falante 4 |
| --- | --- | --- | --- | --- |
| Rachel, Manter original, Aria | Rachel | Voz original | Aria | Voz original |

- **Até 8 vozes.** A lista tem de 1 a 8 entradas, e pelo menos uma entrada precisa ser uma voz de verdade.
- **Posições que mantêm a voz original.** Uma entrada **Manter original** deixa a voz desse falante inalterada, enquanto os falantes seguintes continuam ganhando vozes novas.
- **Listas mais curtas.** Os falantes que passarem do fim da lista mantêm a voz original.
- **Edite a lista.** Mova uma voz com as setas para cima e para baixo, transforme-a, com **Manter**, em uma posição que mantém a voz original, ou remova-a.

Se você não tiver certeza de quem fala primeiro, passe a gravação pelo [**Transcrever** (Transcribe)](https://nodaro.ai/docs/nodes/audio/transcribe) com **Identificação de falantes** ativada e leia os rótulos de falante.

## Configurações
| Configuração | O que faz |
| --- | --- |
| **Adicionar voz** | Abre o explorador de vozes e adiciona a voz escolhida ao fim da lista. Vozes prontas, da Biblioteca de vozes e as suas próprias vozes funcionam. |
| **Manter original — não trocar a voz deste falante** | Adiciona ao fim da lista uma posição que mantém a voz original. |
| **Modelo** | **Multilingual v2** (o padrão) cobre 29 idiomas e é o modelo recomendado pela ElevenLabs, inclusive para inglês. **English v2** é só para inglês. |
| **Qualidade da separação** | **Rápido — preserva mais a voz** (o padrão) ou **Qualidade — separação mais precisa**. |
| **Preservar a música de fundo** | **Ativado** (o padrão) mixa de volta a música e os efeitos sonoros separados sob as novas vozes. **Desativado** os descarta, para um resultado só com as vozes. |
| **Volume da música** | O nível da música preservada: **Igual à origem** (o padrão) mantém o nível original, **Normalizar** nivela o volume, e **Manual** define o **Nível da música** de 0 a 200%. Só quando Preservar a música de fundo está ativado. |
| **Efeitos de voz** | **Nenhum** (o padrão), ou um reverb ou eco nas novas vozes. Veja [Efeitos de voz](#add-a-room-or-an-echo-to-the-voices). |
| **Remover ruído de fundo** | Vem desativado por padrão. Remove o ruído do resultado. As vozes já são isoladas automaticamente, então esta opção pode ser desnecessária. |

### Configurações de cada voz
Abra **Configurações de voz** abaixo de uma voz para ajustar só aquele falante. Deixe uma configuração sem mexer para usar o padrão do modelo.

| Configuração | O que faz |
| --- | --- |
| **Mecanismo de conversão** | **Conversão** (o padrão) converte a fala e mantém a interpretação original. **Releitura (v3)** gera uma nova interpretação a partir da transcrição com o ElevenLabs v3 e entende tags de áudio. A interpretação original é substituída, e, em um vídeo, os lábios deixam de corresponder. |
| **Estabilidade** | De 0 a 1 na Conversão. Na Releitura: **Mais variável (0)**, **Equilibrado (0,5)** ou **Mais estável (1,0)**. Mais alto é mais estável, e mais baixo é mais expressivo. |
| **Semelhança** | De 0 a 1. O quanto o resultado segue o timbre da voz de destino. Só na Conversão. |
| **Exagero de estilo** | De 0 a 1. Acima de 0, amplifica a interpretação, com mais latência e menos estabilidade. Só na Conversão. |
| **Reforço do falante** | Aumenta a semelhança com a voz de destino, com um pouco mais de latência. Só na Conversão. |
| **Volume** | **Igual à origem** (o padrão) acompanha o volume do falante original. **Normalizar** nivela o volume. **Manual** define um nível de 0 a 200%. |
| **Seed** | Um número inteiro de 0 a 4.294.967.295. A mesma origem, as mesmas configurações e a mesma seed trocam a voz deste falante de forma idêntica. Deixe vazio para usar uma seed aleatória. |

## Como o fundo é mantido
Antes de trocar qualquer voz, o nó sempre divide a gravação em uma faixa de voz e uma faixa de música e efeitos. **Preservar a música de fundo** não decide se essa divisão acontece. A opção só decide se a faixa de música é mixada de volta sob as novas vozes.

Se a música vazar para as novas vozes, ou se uma voz soar fina, defina **Qualidade da separação** como **Qualidade — separação mais precisa**. Mantenha **Rápido** quando a velocidade importar ou quando as vozes já soarem limpas.

## Adicione um ambiente ou um eco às vozes
**Efeitos de voz** adiciona um efeito a todas as novas vozes juntas, antes de a música ser mixada de volta. O efeito fica só nas vozes, então, com **Preservar a música de fundo** ativado, a música continua seca sob uma voz com reverb.

- **Espaços de reverb:** Sala (ambiente interno), Banheiro, Interior de carro, Salão / saguão, Sala de concertos, Igreja, Caverna, Arena / estádio e Externo (ao ar livre). O **Mix wet / dry**, de 0 a 100, define quanto do ambiente você ouve.
- **Timbre:** Telefone, Megafone / alto-falante, Eco / slapback e Personalizado. Eco e Personalizado usam **Atraso (ms)**, de 20 a 2.000, e **Decaimento**, de 0 a 1, em que um decaimento maior gera mais repetições.

A página [Efeitos de áudio](https://nodaro.ai/docs/nodes/audio/audio-fx) descreve cada predefinição.

## Troque as vozes de um vídeo inteiro
Conecte qualquer vídeo com fala à entrada **Vídeo**. O nó então:

1. Extrai a faixa de áudio do clipe.
2. Detecta cada falante na ordem em que cada um fala pela primeira vez.
3. Troca a voz de cada falante pela voz correspondente.
4. Coloca as novas vozes de volta no vídeo original e retorna o vídeo e a nova faixa de áudio.

**O vídeo precisa de uma faixa de áudio.** A maioria dos modelos de texto para vídeo e de imagem para vídeo gera vídeo sem som, e um clipe sem som falha na hora. Use um clipe com fala, ou conecte uma gravação à entrada **Áudio**.

## Créditos
Só as vozes trocadas custam créditos. As posições que mantêm a voz original e os falantes além do fim da sua lista passam de graça.

- **Uma voz com Conversão** é cobrada pela duração do stem dela. O stem vai do início do clipe até a última fala desse falante. A tarifa é 44 créditos por minuto, contados por segundo. Cada voz é arredondada para cima, e depois o total da execução, então uma execução pode custar um pouco mais que a tarifa multiplicada pela duração dos stems.
- **Uma voz com Releitura** é cobrada a 33 créditos por 1.000 caracteres iniciados do texto que ela fala.
- **Mínimo.** Cada voz é cobrada como pelo menos 6 segundos de fala, e cada execução também.

| Vozes | Cobrado como |
| --- | --- |
| 1 voz (Conversão) cuja última fala termina em 26,76 segundos | 26,76 segundos de stem |
| 1 voz (Conversão) com um stem de 60 segundos | 1 minuto, 44 créditos |
| 1 voz (Conversão) com um stem de 61 segundos | 61 segundos de stem |
| 1 voz (Conversão) com um stem de 3 segundos | 6 segundos de stem, o mínimo |
| 2 vozes (Conversão) com stems de 60 segundos e 1 voz (Releitura) de 1.500 caracteres | 2 minutos de stem, mais 2 blocos iniciados de 1.000 caracteres |

Você paga pelos stems que foram realmente convertidos, e nunca mais do que o valor reservado no início da execução.

## Use como app
O Modificador de voz Pro também é um app independente, em [voice.nodaro.ai](https://voice.nodaro.ai). Cole um link ou envie um vídeo, escolha uma voz para cada falante e receba o vídeo convertido.

## Dicas
- **Ordene as vozes com cuidado.** A associação é por posição: a primeira voz vai para o primeiro falante a falar.
- **Ajuste cada falante separadamente.** Cada voz tem as próprias configurações, então você pode deixar um falante mais estável e manter outro expressivo.
- **Equilibre o volume por falante.** Use **Volume** em cada voz: **Igual à origem** reproduz o falante original, e **Manual** define um nível exato.
- **Associe menos vozes do que falantes.** Só os falantes da lista mudam; todos depois deles mantêm a própria voz.
- **Mantenha a interpretação.** A Conversão converte fala em fala, então a atuação original é preservada. Use **Releitura (v3)** só quando quiser uma nova interpretação, por exemplo em um projeto só de áudio.

## Solução de problemas
**Um falante soa robótico.** Diminua a **Semelhança** ou a **Estabilidade** dessa voz, ou escolha uma voz com timbre mais próximo do falante original.

**A música vaza para as vozes.** Defina **Qualidade da separação** como **Qualidade — separação mais precisa**.

**O falante errado recebeu uma voz.** Os falantes são numerados por quem fala primeiro. Confira a ordem com o [Transcrever](https://nodaro.ai/docs/nodes/audio/transcribe) e reordene as vozes.

**Uma execução self-hosted é recusada com `nodaro_connection_required`.** A instalação não tem conexão com o Nodaro Cloud. Conecte-a com OAuth ou com uma chave de API, como descrito em [Conectar ao Nodaro Cloud](https://nodaro.ai/docs/self-hosting/cloud-connect).

## Pela API
`POST /v1/voice-changer-pro` executa o nó por código, no Nodaro Cloud. `orderedVoices` associa o falante N à entrada N. Uma entrada é um ID de voz, um objeto com configurações por voz ou `null` para uma posição que mantém a voz original. O objeto de configurações recebe `voiceId`, `engine` (`"sts"` ou `"v3"`), `stability`, `similarityBoost`, `style`, `useSpeakerBoost`, `seed`, `volumeMode` e `volume`. Com `engine: "v3"`, `stability` aceita só três valores (0, 0,5 e 1), e `similarityBoost`, `style` e `useSpeakerBoost` são ignorados. O campo `sourceHasVideo` do resultado informa se a execução usou o modo de vídeo ou o modo de áudio.

No Nodaro Cloud, você também pode executar o mesmo mecanismo em três etapas. Assim, você confere os falantes antes de pagar por uma troca de voz e mixa as faixas antes de renderizar:

1. **Análise.** `POST /v1/voice-changer-pro/analyze` separa as vozes da música e detecta os falantes. Retorna os segmentos de tempo, a contagem de palavras e um trecho da transcrição de cada falante, além do idioma detectado. Custa 11 créditos.
2. **Troca de voz em stems.** Chame `POST /v1/voice-changer-pro` com `output: "stems"` e a análise. Os falantes não são detectados de novo, então você pode trocar as vozes por outras quantas vezes quiser. O resultado é uma faixa seca por voz.
3. **Exportação.** `POST /v1/voice-changer-pro/export` renderiza o vídeo final a partir da sua mixagem. Envie até 16 faixas, cada uma com um `gain` de 0 a 200, `muted` e um `kind` igual a `voice` ou `background`, além de um `voiceFx` opcional. Pelo menos uma faixa precisa estar com som. O fluxo de vídeo é copiado, nunca codificado de novo. Ajustar a mixagem é grátis; a exportação custa 2 créditos.

Os métodos do SDK são `client.voices.analyze`, `client.voices.recast` e `client.voices.exportMix`. Os comandos da CLI são `nodaro voice analyze`, `nodaro voice recast` e `nodaro voice export`. As ferramentas MCP são `voice_changer_pro`, `voice_changer_pro_analyze` e `voice_changer_pro_export`. Veja [Voz e mídia](https://nodaro.ai/docs/developers/api/voice-and-media).

## Frequently asked questions

### Como o “Modificador de voz Pro” sabe qual voz vai para qual falante?

Ele detecta os falantes na ordem em que cada um fala pela primeira vez. A voz 1 substitui a voz do primeiro falante a falar, a voz 2, a do segundo, e assim por diante. Os falantes que passarem do fim da sua lista mantêm a voz original.

### Posso trocar a voz de só alguns falantes?

Sim. Adicione uma posição “Manter original” para cada falante que deve manter a própria voz. Por exemplo, Rachel, Manter original, Aria troca as vozes dos falantes 1 e 3, e o falante 2 fica inalterado. Os falantes mantidos não custam nada.

### Quantos créditos o “Modificador de voz Pro” custa?

Cada voz trocada custa 44 créditos por minuto do stem dela, contados por segundo. O stem vai do início do clipe até a última fala desse falante. Uma voz com Releitura custa 33 créditos por 1.000 caracteres iniciados, e cada voz e cada execução são cobradas como pelo menos 6 segundos de fala. Cada voz é arredondada para cima, e depois o total da execução, então uma execução pode custar um pouco mais que a tarifa multiplicada pela duração dos stems.

### O “Modificador de voz Pro” mantém a música de fundo?

Sim, por padrão. A música e os efeitos sonoros são separados das vozes primeiro, e “Preservar a música de fundo” os mixa de volta sob as novas vozes. Desative essa opção para ter um resultado só com as vozes.

### Posso usar o “Modificador de voz Pro” em uma instalação self-hosted?

Sim, por meio de uma conexão com o Nodaro Cloud. O nó roda no Nodaro Cloud e é cobrado da conta do nodaro.ai conectada. Sem conexão, o nó mostra um botão “CONECTAR NODARO”.
