# Modificador de voz

> Troque a voz de uma gravação ou de um vídeo com fala por outra voz e mantenha a emoção, o ritmo e o timing originais. Fala para fala com o ElevenLabs.

Source: https://nodaro.ai/pt-BR/docs/nodes/audio/voice-changer

O nó **Modificador de voz** (Voice Changer) troca a voz de uma gravação, ou de um vídeo inteiro com fala, por outra voz. Ele converte fala em fala com o ElevenLabs, então a emoção, o ritmo e o timing originais permanecem, e só a voz muda. Conecte um áudio para receber um áudio de volta, ou conecte um vídeo para receber o mesmo vídeo com a nova voz.

- Found in: Audio › Voices
- Output: audio
- API type: `voice-changer`

## Quando usar
- Trocar em uma única etapa a voz de um vídeo de uma pessoa falando ou com sincronização labial.
- Dar a uma gravação a voz da sua marca ou de um personagem.
- Ocultar a identidade de um falante e manter a fala natural.
- Transformar uma gravação de rascunho em uma narração bem acabada.
- Usar uma única voz de narrador em gravações de pessoas diferentes.

Para uma conversa com vários falantes que precisam, cada um, de uma voz nova, use o [**Modificador de voz Pro** (Voice Changer Pro)](https://nodaro.ai/docs/nodes/audio/voice-changer-pro).

## Início rápido
### Adicione o nó
Pressione Tab no canvas e escolha **Áudio › Vozes › Modificador de voz**.

### Conecte a gravação
Conecte um nó de áudio à entrada **Áudio** ou um nó de vídeo à entrada **Vídeo**.

### Escolha a nova voz
Abra o painel de configurações. Em **Voz**, abra o explorador de vozes e escolha a voz a aplicar.

### Execute
Clique em **Executar** no nó. Para um áudio, a nova gravação aparece na saída **Áudio**. Para um vídeo, o vídeo com a nova voz aparece na saída **Vídeo**, e a nova faixa de voz dele, na saída **Áudio**.

Workflow: Um clipe com fala ganha uma nova voz; o vídeo segue para as legendas, e a nova faixa de voz segue para uma transcrição.

- Enviar vídeo → Modificador de voz (vídeo)
- Modificador de voz → Adicionar legendas (vídeo)
- Modificador de voz → Transcrever (áudio)

## Entradas e saídas
| Entrada | Aceita | O que faz |
| --- | --- | --- |
| **Áudio** | Nós de áudio, como **Enviar áudio** (Upload Audio), **Texto para fala** (Text to Speech) e **Extrator de voz** (Voice Extractor) | A gravação cuja voz é trocada. O nó retorna áudio. |
| **Vídeo** | Nós de vídeo, como **Enviar vídeo** (Upload Video), **Gerar vídeo** (Generate Video) e **Sincronização labial** (Lip Sync) | O vídeo com fala que recebe a nova voz. O nó retorna o vídeo com a nova voz. |

Quando as duas entradas estão conectadas, o vídeo prevalece e a entrada de áudio é ignorada.

| Saída | O que traz |
| --- | --- |
| **Áudio** | O áudio com a nova voz. Sempre gerado. Para um vídeo, é a nova faixa de voz. |
| **Vídeo** | O vídeo com a nova voz. Só é gerado quando um vídeo está conectado. |

**O arquivo decide o modo, não a entrada.** O nó verifica o que o arquivo realmente contém. Um arquivo só de áudio na entrada **Vídeo**, como uma nota de voz salva como `.m4a`, é executado como áudio e retorna áudio. Um vídeo na entrada **Áudio** tem o som extraído e é tratado como áudio.

## Configurações
| Configuração | O que faz |
| --- | --- |
| **Voz** | A voz de destino. Abre o explorador de vozes, com as vozes prontas, as da Biblioteca de vozes e as suas próprias vozes. |
| **Modelo** | **Multilingual v2** (o padrão) cobre 29 idiomas. **English v2** é só para inglês. Os dois custam o mesmo. |
| **Estabilidade** | De 0 a 1. O padrão é 0,5. Valores mais baixos são mais expressivos, e valores mais altos, mais uniformes. |
| **Semelhança** | De 0 a 1. O padrão é 0,75. O quanto o resultado se aproxima do timbre da voz de destino. |
| **Exagero de estilo** | De 0 a 1. O padrão é 0. Leva mais da interpretação da origem para a nova voz, mas aumenta a latência e pode reduzir a estabilidade. |
| **Reforço do falante** | Reforça a semelhança com a voz de destino, com um pouco mais de latência. Vem ativado por padrão. |
| **Seed** | Um número inteiro de 0 a 4.294.967.295. A mesma seed, a mesma entrada e as mesmas configurações geram o mesmo resultado. Deixe vazio para ter um resultado aleatório. |
| **Remover ruído de fundo** | **Desativado** (o padrão) mantém a música e os efeitos sonoros sob a nova voz. **Ativado** os remove, para um resultado limpo, só com a voz. |

## Modelos
| Model | Maker | Modes | Credits | Details |
| --- | --- | --- | --- | --- |
| [ElevenLabs Voice Changer](https://nodaro.ai/docs/models/audio/elevenlabs-voice-changer) | ElevenLabs | Voice changer | 44 | Speech-to-speech: convert one voice to another while preserving prosody. |

Mantenha o **Multilingual v2**, a menos que queira comparar resultados. A ElevenLabs o recomenda até para gravações em inglês, nas quais ele costuma se sair melhor que o English v2, e ele é obrigatório para gravações em outros idiomas.

## Troque a voz de um vídeo inteiro
Conecte qualquer vídeo com fala à entrada **Vídeo**: um clipe gerado, um arquivo enviado ou uma tomada com sincronização labial. O nó então:

1. Extrai a faixa de áudio do clipe.
2. Converte a fala para a voz que você escolheu.
3. Coloca a nova voz de volta no vídeo original e retorna o vídeo e a nova faixa de voz.

Isso substitui uma cadeia de quatro nós: um vídeo, [**Extrair áudio** (Extract Audio)](https://nodaro.ai/docs/nodes/video/extract-audio), uma troca de voz e [**Mesclar vídeo e áudio** (Merge Video & Audio)](https://nodaro.ai/docs/nodes/video/merge-video-audio).

**O vídeo precisa de uma faixa de áudio.** A maioria dos modelos de texto para vídeo e de imagem para vídeo gera vídeo sem som. Só os modelos que geram som, como o VEO 3.1 e o Kling 3.0, dão ao nó uma fala para converter. Conecte um áudio diretamente quando o seu clipe não tiver som.

**Mantenha ou descarte a música.** Com **Remover ruído de fundo** desativado, a música e os efeitos sonoros do clipe ficam sob a nova voz. Ative a opção quando quiser só a voz.

## Dicas
- **Comece pelos padrões.** Estabilidade 0,5 e Semelhança 0,75 servem para a maioria das gravações. Uma semelhança maior se aproxima mais da voz, mas pode soar menos natural.
- **Deixe o Exagero de estilo em 0.** Aumente o valor só quando a nova voz precisar carregar mais no drama do original.
- **Limpe antes a origem.** Gravações ruins levam os próprios problemas para o resultado. Passe antes o áudio com ruído pelo [Extrator de voz](https://nodaro.ai/docs/nodes/audio/voice-extractor).
- **Prefira clipes com bastante fala.** Música alta sob o diálogo pode vazar para a conversão. Ative **Remover ruído de fundo** quando não precisar da música.
- **Espere menos nuance em mudanças grandes.** Quanto mais distantes forem a voz de origem e a voz de destino, por exemplo de uma voz masculina grave para uma voz feminina leve, mais artefatos podem aparecer.

## Solução de problemas
**A execução falha com “This video has no audio track to revoice”.** O clipe não tem som. Use um clipe com fala, ou conecte uma gravação à entrada **Áudio**.

**O resultado soa robótico.** Diminua a **Semelhança** para dar mais liberdade ao modelo, ou escolha uma voz de destino mais próxima do falante original.

## Pela API
`POST /v1/voice-changer` recebe `voiceId` e `audioUrl` ou `videoUrl`, mais, opcionalmente, `model`, `stability`, `similarityBoost`, `style`, `useSpeakerBoost`, `seed` e `removeBackgroundNoise`. O campo `sourceHasVideo` do resultado informa se a execução usou o modo de vídeo ou o modo de áudio. A ferramenta MCP é `voice_changer`. Veja [Voz e mídia](https://nodaro.ai/docs/developers/api/voice-and-media).

## Frequently asked questions

### O “Modificador de voz” mantém a emoção e o timing originais?

Sim. Ele converte fala em fala, então o ritmo, a entonação e a emoção da gravação permanecem, e só a voz muda. Uma boa interpretação original gera um bom resultado.

### Posso trocar a voz de um vídeo diretamente?

Sim. Conecte o vídeo à entrada “Vídeo”. O nó retorna o mesmo vídeo com a nova voz, e a nova faixa de voz na saída “Áudio”. O vídeo precisa ter uma faixa de áudio com fala.

### Qual modelo devo escolher?

Mantenha o Multilingual v2, o padrão. A ElevenLabs o recomenda até para gravações em inglês, e ele é obrigatório para outros idiomas. O English v2 também está disponível, pelo mesmo preço.

### Posso manter a música de fundo sob a nova voz?

Sim. Deixe “Remover ruído de fundo” desativado, que é o padrão, e a música e os efeitos sonoros ficam sob a nova voz. Ative a opção para ter um resultado limpo, só com a voz.

### Qual é a diferença entre “Modificador de voz” e “Modificador de voz Pro”?

O “Modificador de voz” aplica uma só voz à gravação. O “Modificador de voz Pro” detecta cada falante de uma conversa e dá a cada um uma voz própria.
