# Áudio

> Gere fala e diálogos, crie e troque vozes, duble, crie efeitos sonoros, transcreva e limpe ou corte áudio com as ferramentas de áudio do MCP do Nodaro.

Source: https://nodaro.ai/pt-BR/docs/mcp/tools/audio

As **ferramentas de áudio** permitem que um assistente crie e altere sons no Nodaro: fala e diálogos, vozes novas e modificadas, dublagem, efeitos sonoros, transcrições e limpeza. Cada ferramenta, exceto `list_voices`, inicia um job e retorna o ID dele, e o resultado é salvo na sua biblioteca. Todas as ferramentas de áudio precisam da permissão `workflows:execute`.

| Ferramenta | O que faz |
| --- | --- |
| [`generate_speech`](#generate_speech) | Texto para fala com uma voz |
| [`generate_dialogue`](#generate_dialogue) | Uma conversa entre várias vozes, num único arquivo |
| [`list_voices`](#list_voices) | As vozes prontas |
| [`voice_design`](#voice_design) | Uma nova voz a partir de uma descrição |
| [`voice_remix`](#voice_remix) | Fala numa voz que você descreve, sem ID de voz |
| [`voice_changer`](#voice_changer) | Troca a voz de uma gravação ou de um vídeo |
| [`voice_changer_pro`](#voice_changer_pro) | Troca a voz de vários falantes de uma vez |
| [`dubbing`](#dubbing) | Traduz a fala para outro idioma, mantendo as vozes |
| [`text_to_audio`](#text_to_audio) | Efeitos sonoros a partir de uma descrição |
| [`transcribe`](#transcribe) | Fala para texto, com os tempos das palavras |
| [`audio_isolation`](#audio_isolation) | Isola a voz ou o som principal de uma mixagem |
| [`separate_audio`](#separate_audio) | Separa o áudio em vocais e instrumental, ou em stems |
| [`apply_audio_fx`](#apply_audio_fx) | Reverbs e efeitos que situam uma voz num ambiente |
| [`trim_audio`](#trim_audio) | Corta o áudio ou o extrai de um vídeo |
| [`download_youtube_audio`](#download_youtube_audio) | A faixa de áudio de um vídeo do YouTube |

## `generate_speech`
Transforma texto em fala com uma voz do ElevenLabs. Funciona como o nó [**Texto para fala** (Text to Speech)](https://nodaro.ai/docs/nodes/audio/text-to-speech).

**Permissão:** `workflows:execute`. **Créditos:** o preço do modelo, abaixo.

| Model | Maker | Modes | Credits | Details |
| --- | --- | --- | --- | --- |
| [ElevenLabs v3](https://nodaro.ai/docs/models/audio/elevenlabs-v3) | ElevenLabs | Text to speech | 33 | Latest ElevenLabs TTS — supports [audio tags] for emotion / pacing. Direct API. |
| [ElevenLabs Turbo v2.5](https://nodaro.ai/docs/models/audio/elevenlabs-turbo-v2-5) | ElevenLabs | Text to speech | 17 | Fast, cheap ElevenLabs TTS via the direct ElevenLabs API. Good for narration. |
| [ElevenLabs Multilingual v2](https://nodaro.ai/docs/models/audio/elevenlabs-multilingual-v2) | ElevenLabs | Text to speech | 33 | Multi-language ElevenLabs TTS via the direct ElevenLabs API. |

| Parâmetro | Tipo | Observações |
| --- | --- | --- |
| `text` | string | **Obrigatório.** O que dizer, com até 5.000 caracteres. Divida um roteiro mais longo em várias chamadas. |
| `voice_id` | string | O nome de uma voz pronta ou o ID de uma voz que você clonou. Padrão: `Rachel`. Um ID desconhecido falha com `voice_not_found`. |
| `voice_type` | string | `premade`, `custom` ou `library`. |
| `model` | string | `elevenlabs-v3` (padrão), `elevenlabs-turbo` ou `elevenlabs-multilingual`. `elevenlabs`, o ID antigo do `elevenlabs-turbo`, também é aceito. |
| `language_code` | string | O idioma do texto. |
| `stability`, `similarity_boost`, `style` | number | Configurações de locução, de 0 a 1. |
| `speed` | number | De 0,7 a 1,2. |
| `presetId` | string | Uma predefinição de locução, como **Narrador calmo**, **Locução comercial** ou **Audiolivro**, de [`list_node_presets`](https://nodaro.ai/docs/mcp/tools/models-and-credits#list_node_presets). Você ainda passa `text`. |

**Como escolher o modelo.** O ElevenLabs v3 aceita tags de áudio como `[laughs]`, `[whispers]` e `[sighs]` para emoção e ritmo, e é totalmente multilíngue: use-o para qualquer idioma, inclusive hebraico, árabe, chinês, japonês e coreano. O ElevenLabs Turbo é mais barato para narração simples. O ElevenLabs Multilingual v2 é um modelo legado; use-o só para uma voz que comprovadamente funciona apenas no v2.

**Como escolher a voz.** As vozes prontas são Rachel, Aria, Roger, Sarah, Laura, Charlie, George, Callum, River, Liam, Charlotte, Alice, Matilda, Will, Jessica, Eric, Chris, Brian, Daniel, Lily e Bill. Para uma voz feminina calorosa, experimente Rachel; para uma voz feminina jovem, Aria ou Lily; para uma voz masculina grave, Roger ou Brian; para uma voz masculina neutra, George ou Daniel; e para uma voz britânica, Charlie ou Charlotte.

**Retorna:** um ID de job. O cartão toca o áudio quando ele fica pronto.

## `generate_dialogue`
Dá voz a um roteiro com vários falantes num único arquivo de áudio, com alternância natural entre as falas, no ElevenLabs Dialogue v3. Use-a para conversas, entrevistas, trocas no estilo podcast e cenas, em vez de juntar clipes separados de `generate_speech`. Funciona como o nó [**Texto para diálogo** (Text to Dialogue)](https://nodaro.ai/docs/nodes/audio/text-to-dialogue).

**Permissão:** `workflows:execute`. **Créditos:** o preço do [ElevenLabs Dialogue v3](https://nodaro.ai/docs/models/audio/elevenlabs-dialogue-v3), por 1.000 caracteres.

| Parâmetro | Tipo | Observações |
| --- | --- | --- |
| `dialogue` | array | **Obrigatório.** As falas na ordem em que são ditas, de 1 a 200, cada uma `{ text, voice_id }`. Reutilize a mesma voz para o mesmo personagem. As falas podem conter tags de áudio como `[laughs]`. |
| `stability` | number | `0` (mais variada), `0.5` (equilibrada) ou `1` (mais estável). |
| `language_code` | string | Uma indicação de idioma, como `en` ou `he`. Omita-a para detectar o idioma. |
| `seed` | integer | Uma seed fixa, para um resultado repetível. |
| `apply_text_normalization` | string | Escreve por extenso números, datas e abreviações: `auto` (padrão), `on` ou `off`. |

Os limites são 5.000 caracteres no total, com 2.000 ou menos recomendados para a melhor qualidade, e 10 vozes diferentes por chamada. O mesmo roteiro pode misturar nomes de vozes prontas e vozes clonadas.

**Retorna:** um ID de job.

## `list_voices`
Retorna as vozes prontas, com o ID, o nome e os detalhes de gênero, sotaque e descrição, quando houver. `generate_speech`, `voice_changer` e `voice_changer_pro` precisam de um ID de voz.

**Permissão:** `workflows:execute`. **Créditos:** grátis.

Esta ferramenta não tem parâmetros. Ela lê o catálogo e não inicia nenhum job.

## `voice_design`
Cria uma nova voz a partir de uma descrição e retorna uma amostra dela falando o seu roteiro. Use-a para ouvir uma prévia da voz antes de salvá-la. Funciona como o nó [**Design de voz** (Voice Design)](https://nodaro.ai/docs/nodes/audio/voice-design).

**Permissão:** `workflows:execute`. **Créditos:** 55.

| Parâmetro | Tipo | Observações |
| --- | --- | --- |
| `voice_description` | string | **Obrigatório.** A voz: gênero, idade, sotaque, tom e personalidade, com até 1.000 caracteres. Por exemplo “warm female narrator with a soft British accent, low-pitched, calm pacing”. |
| `text` | string | **Obrigatório.** Um roteiro de amostra para a voz falar, de 100 a 1.000 caracteres. |
| `model` | string | `eleven_ttv_v3` (padrão, todos os idiomas) ou o legado `eleven_multilingual_ttv_v2`. |
| `loudness`, `guidance_scale`, `quality`, `seed`, `should_enhance` | | Configurações opcionais de design. `loudness` vai de -1 a 1, e `guidance_scale`, de 0 a 100. |

**Retorna:** um ID de job. O resultado é uma amostra em áudio da voz criada.

## `voice_remix`
Fala um texto numa voz que você descreve em palavras, sem ID de voz. Use-a para uma voz avulsa, que você não precisa guardar. Funciona como o nó [**Remix de voz** (Voice Remix)](https://nodaro.ai/docs/nodes/audio/voice-remix).

**Permissão:** `workflows:execute`. **Créditos:** 44.

| Parâmetro | Tipo | Observações |
| --- | --- | --- |
| `text` | string | **Obrigatório.** O que dizer, com até 5.000 caracteres. |
| `voice_description` | string | **Obrigatório.** A voz, com até 1.000 caracteres, por exemplo “a warm, mid-40s British woman with a calm news-anchor tone”. |

**Retorna:** um ID de job.

## `voice_changer`
Substitui a voz numa faixa de áudio, ou num vídeo inteiro de alguém falando, mantendo a interpretação e o ritmo. Funciona como o nó [**Modificador de voz** (Voice Changer)](https://nodaro.ai/docs/nodes/audio/voice-changer).

**Permissão:** `workflows:execute`. **Créditos:** 44.

| Parâmetro | Tipo | Observações |
| --- | --- | --- |
| `voice_id` | string | **Obrigatório.** A nova voz: o nome de uma voz pronta ou o ID de uma voz que você clonou. |
| `audio_url` ou `audio_asset_id` | string | Uma origem de áudio. |
| `video_url` ou `video_asset_id` | string | Uma origem de vídeo, no lugar do áudio. O vídeo prevalece quando você passa os dois. |
| `remove_background_noise` | boolean | `true` retorna só a voz limpa. `false` mantém a música e os efeitos sonoros sob a nova voz. |
| `stability`, `similarity_boost`, `style` | number | De 0 a 1. `style` exagera a interpretação original; acima de 0, fica mais lento e pode ser menos estável. |

**Retorna:** um ID de job. Para uma origem de vídeo, o cartão mostra uma prévia do novo áudio, e o novo vídeo vai para a sua biblioteca.

## `voice_changer_pro`
Detecta cada falante de um clipe e dá a cada um uma nova voz, mantendo as palavras e o timing. O falante 1 recebe a primeira voz da lista, o falante 2, a segunda, e assim por diante, na ordem em que cada um fala pela primeira vez. Funciona como o nó [**Modificador de voz Pro** (Voice Changer Pro)](https://nodaro.ai/docs/nodes/audio/voice-changer-pro).

**Permissão:** `workflows:execute`. **Créditos:** os mesmos do nó Modificador de voz Pro. **Somente no Nodaro Cloud.**

| Parâmetro | Tipo | Observações |
| --- | --- | --- |
| `ordered_voices` | array | **Obrigatório.** De 1 a 8 itens, um por falante. Um item é um ID de voz, um objeto com as próprias configurações ou `null`, para manter a voz original desse falante. Pelo menos um item não pode ser `null`. |
| `audio_url`, `audio_asset_id`, `video_url` ou `video_asset_id` | string | A origem: uma faixa de áudio ou um vídeo cujas vozes são trocadas. |
| `analysis` | object | A saída de um job anterior de `voice_changer_pro_analyze`. A troca então usa exatamente a lista de falantes à qual você associou as suas vozes, em vez de detectar os falantes de novo. |
| `preserve_background` | boolean | Mixa de volta a música e os efeitos sonoros sob as novas vozes. Padrão: `true`. |
| `music_volume_mode`, `music_volume` | | O nível do fundo: `match` (original), `normalize` ou `manual`, com um volume de 0 a 200. |
| `voice_fx` | object | Um reverb ou efeito nas novas vozes, antes de o fundo voltar: um `preset` como `room`, `hall`, `church`, `telephone` ou `echo`, com `wetDryMix`, `delayMs` e `decay`. |
| `separation_quality` | string | `fast` (padrão) ou `best`. |
| `remove_background_noise` | boolean | Remove primeiro o ruído de fundo, para um resultado limpo, só com a voz. |
| `output` | string | `video` (padrão), um vídeo pronto, ou `stems`, as faixas separadas para a sua própria mixagem com `voice_changer_pro_export`. |
| `model` | string | Uma substituição do modelo de voz. |

Um objeto de item de voz recebe `voiceId` e, opcionalmente, `engine`, `stability`, `similarityBoost`, `style`, `useSpeakerBoost`, `seed`, `volumeMode` e `volume`. O `engine` é `sts` (o padrão, que troca a voz da interpretação original) ou `v3`, que fala a frase de novo a partir da transcrição com o ElevenLabs v3. O mecanismo `v3` aceita tags de áudio e uma estabilidade de 0, de 0,5 ou de 1, e lê a transcrição da `analysis`; sem uma análise, ele usa a própria transcrição.

**Retorna:** um ID de job.

## `voice_changer_pro_analyze`
Detecta os falantes de um clipe sem alterá-los: a primeira etapa do fluxo interativo. A saída do job contém as faixas separadas de voz e de fundo, cada falante com os segmentos de tempo, a primeira aparição, a contagem de palavras e um trecho do texto, além do idioma. Confira essa saída para escolher uma voz para cada falante e para identificar “falantes” que não são pessoas, como aplausos.

**Permissão:** `workflows:execute`. **Somente no Nodaro Cloud.**

| Parâmetro | Tipo | Observações |
| --- | --- | --- |
| `audio_url`, `audio_asset_id`, `video_url` ou `video_asset_id` | string | O clipe de origem. |
| `separation_quality` | string | `fast` (padrão) ou `best`. |
| `suggest_title` | boolean | Também sugere um título a partir da transcrição, como `suggestedTitle`. |

**Retorna:** um ID de job. Passe o `output_data` dele para `voice_changer_pro` como `analysis`.

## `voice_changer_pro_export`
Renderiza um vídeo pronto a partir da sua própria mixagem de faixas: a última etapa do fluxo interativo, depois de `voice_changer_pro` com `output: "stems"`. O vídeo é copiado sem recodificação.

**Permissão:** `workflows:execute`. **Somente no Nodaro Cloud.**

| Parâmetro | Tipo | Observações |
| --- | --- | --- |
| `tracks` | array | **Obrigatório.** De 1 a 16 faixas, cada uma com uma `url`, um `gain` de 0 a 200 (100 não altera nada), `muted` e um `kind`, `voice` (padrão) ou `background`. Pelo menos uma faixa não pode estar silenciada. |
| `video_url` ou `video_asset_id` | string | O vídeo de origem. |
| `voice_fx` | object | Um efeito aplicado só às faixas de voz. |

**Retorna:** um ID de job.

## `dubbing`
Traduz a fala para outro idioma, mantendo a voz e o timing de cada falante. Uma origem de vídeo retorna o vídeo dublado e a faixa de áudio dele. Funciona como o nó [**Dublagem** (Dubbing)](https://nodaro.ai/docs/nodes/audio/dubbing).

**Permissão:** `workflows:execute`. **Créditos:** cobrados por minuto do trecho dublado.

| Parâmetro | Tipo | Observações |
| --- | --- | --- |
| `target_language` | string | **Obrigatório.** Um código de idioma, como `en`, `es`, `fr`, `de`, `ja`, `zh`, `ko` ou `ar`. |
| `audio_url`, `audio_asset_id`, `video_url`, `video_asset_id` ou `source_url` | string | **Exatamente uma origem.** `source_url` é um link público do YouTube, do TikTok ou direto, que é baixado diretamente. |
| `source_language` | string | Uma indicação do idioma de origem. Ele é detectado quando você o omite. |
| `num_speakers` | integer | O número de vozes diferentes, até 20. `0` as detecta. |
| `disable_voice_cloning` | boolean | Usa uma voz nativa parecida em vez da voz original de cada falante. |
| `drop_background_audio` | boolean | Remove o fundo, para origens só com fala. |
| `start_time`, `end_time` | number | Dubla só parte da origem, em segundos. |
| `highest_resolution` | boolean | Mantém a resolução de origem de um vídeo. Mais lento. |
| `use_profanity_filter`, `target_accent`, `watermark` | | Opcionais. `target_accent` orienta as vozes para um sotaque. |

Uma dublagem cobre no máximo 30 minutos. Use `start_time` e `end_time` para uma parte de uma origem mais longa.

**Retorna:** um ID de job.

## `text_to_audio`
Cria um efeito sonoro a partir de uma descrição: foley, ambiência, sons de interface. Não serve para fala nem música. Funciona como o nó [**Texto para áudio** (Text to Audio)](https://nodaro.ai/docs/nodes/audio/text-to-audio).

**Permissão:** `workflows:execute`. **Créditos:** o preço do [ElevenLabs Sound Effects](https://nodaro.ai/docs/models/audio/elevenlabs-sound-effects).

| Parâmetro | Tipo | Observações |
| --- | --- | --- |
| `prompt` | string | O som, por exemplo “thunderstorm with heavy rain”, com até 2.000 caracteres. Obrigatório, a menos que uma predefinição o forneça. |
| `duration` | number | De 0,5 a 30 segundos. Por padrão, o modelo decide. |
| `loop` | boolean | Faz o som se repetir em loop sem emendas. |
| `prompt_influence` | number | O quanto o som segue o prompt, de 0 a 1. |
| `presetId` | string | Uma predefinição como **Ambiente de chuva**, **Transição whoosh** ou **Impacto / estrondo**. |

**Retorna:** um ID de job.

## `transcribe`
Transforma a fala de um arquivo de áudio ou de vídeo em texto com o mecanismo ElevenLabs STT. Os tempos das palavras, em milissegundos, ficam sempre em `output_data.json.words`. Funciona como o nó [**Transcrever** (Transcribe)](https://nodaro.ai/docs/nodes/audio/transcribe).

**Permissão:** `workflows:execute`. **Créditos:** o preço do [ElevenLabs STT](https://nodaro.ai/docs/models/audio/elevenlabs-stt).

| Parâmetro | Tipo | Observações |
| --- | --- | --- |
| `audio_url` ou `audio_asset_id` | string | A origem. O ID pode ser de um job de áudio ou de vídeo. |
| `language` | string | Um código de idioma, como `en`. Detectado quando você o omite. |
| `diarize` | boolean | Identifica cada falante. Padrão: `false`. |
| `tag_audio_events` | boolean | Marca sons como `[laughter]` ou `[music]`. Padrão: `false`. |
| `word_timestamps` | boolean | Mantido por compatibilidade. Os tempos das palavras são retornados de qualquer forma. |

**Retorna:** um ID de job. A transcrição fica na saída do job. Para legendar um vídeo com o texto corrigido, mapeie `json.words` para as `captions` de [`add_captions`](https://nodaro.ai/docs/mcp/tools/video-editing#add_captions), um item por palavra. Os mecanismos Whisper estão disponíveis no nó do canvas, na API REST, no SDK e na CLI, mas não por esta ferramenta.

## `audio_isolation`
Remove a música e o ruído de fundo de uma mixagem e retorna a voz, os vocais ou o instrumento principal como uma única faixa limpa. Funciona como o nó [**Extrator de voz** (Voice Extractor)](https://nodaro.ai/docs/nodes/audio/voice-extractor).

**Permissão:** `workflows:execute`. **Créditos:** o preço do [ElevenLabs Voice Isolation](https://nodaro.ai/docs/models/audio/elevenlabs-voice-isolation), conforme a duração.

| Parâmetro | Tipo | Observações |
| --- | --- | --- |
| `audio_url` ou `audio_asset_id` | string | A origem. O ID pode ser de um job de áudio ou de vídeo. |

**Retorna:** um ID de job.

## `separate_audio`
Separa qualquer áudio em vocais e instrumental, ou em stems completos: bateria, baixo, guitarra, piano e outros. Usa o Demucs e, ao contrário de `suno_separate_stems`, não precisa de uma faixa do Suno. Funciona como o nó [**Separação de áudio** (Audio Separation)](https://nodaro.ai/docs/nodes/audio/audio-separation).

**Permissão:** `workflows:execute`. **Créditos:** de 33 a 88, conforme o modo e a qualidade.

| Parâmetro | Tipo | Observações |
| --- | --- | --- |
| `audio_url` ou `audio_asset_id` | string | A origem. `audio_asset_id` aceita um job de áudio ou um arquivo de áudio enviado, não um vídeo. |
| `mode` | string | `vocal_instrumental` (padrão) ou `stems`. |
| `quality` | string | `auto` (padrão), `fast` ou `best`. |

**Retorna:** um ID de job. Leia a URL de cada stem, como `vocalUrl`, `instrumentalUrl` ou `drumsUrl`, com `get_job`.

## `apply_audio_fx`
Aplica um efeito criativo a uma voz ou a um clipe: um reverb que situa uma voz seca num ambiente, ou um efeito de telefone, megafone ou eco. Funciona como o nó [**Efeitos de áudio** (Audio FX)](https://nodaro.ai/docs/nodes/audio/audio-fx).

**Permissão:** `workflows:execute`. **Créditos:** 22.

| Parâmetro | Tipo | Observações |
| --- | --- | --- |
| `audio_url` ou `audio_asset_id` | string | A origem. O ID pode ser de um job de áudio ou de vídeo. |
| `preset` | string | `room` (padrão), `bathroom`, `car`, `hall`, `concert-hall`, `church`, `cave`, `arena`, `outdoor`, `telephone`, `megaphone`, `echo` ou `custom`. |
| `mix` | number | A quantidade de reverb, de 0 a 100. |

**Retorna:** um ID de job.

## `trim_audio`
Corta o áudio num intervalo de tempo, ou extrai o áudio de um vídeo e o corta. Funciona como o nó [**Cortar áudio** (Trim Audio)](https://nodaro.ai/docs/nodes/audio/trim-audio).

**Permissão:** `workflows:execute`. **Créditos:** 11.

| Parâmetro | Tipo | Observações |
| --- | --- | --- |
| `audio_url`, `audio_asset_id`, `video_url` ou `video_asset_id` | string | Uma origem. Uma origem de vídeo fornece a faixa de áudio dele. |
| `start_time`, `end_time` | number | O intervalo em segundos. Omita os dois para manter a faixa inteira. |
| `audio_format` | string | `mp3` (padrão), `wav` ou `aac`. |

**Retorna:** um ID de job.

## `download_youtube_audio`
Extrai a faixa de áudio de um vídeo do YouTube.

**Permissão:** `workflows:execute`.

| Parâmetro | Tipo | Observações |
| --- | --- | --- |
| `youtube_url` | string | **Obrigatório.** A URL do vídeo do YouTube. |

**Retorna:** um ID de job. O resultado é um arquivo de áudio que você pode passar para outras ferramentas.

## Frequently asked questions

### Qual voz generate_speech usa por padrão?

A Rachel, no modelo ElevenLabs v3. Passe voice_id com o nome de uma voz pronta, como Aria, Roger ou Charlotte, ou com o ID de uma voz que você clonou. list_voices retorna as vozes prontas.

### Como faço uma conversa entre duas vozes?

Use generate_dialogue com uma lista ordenada de falas, cada uma com o texto e a voz. A ferramenta retorna um único arquivo de áudio com alternância natural entre as vozes, que soa melhor do que juntar clipes de fala separados.

### O ElevenLabs v3 fala outros idiomas além do inglês?

Sim. Ele é totalmente multilíngue, inclusive hebraico, árabe, chinês, japonês e coreano, então use-o para qualquer idioma. Ele também entende tags de áudio como [laughs] e [whispers].

### Como obtenho os tempos das palavras para legendas?

Chame transcribe. Os tempos das palavras, em milissegundos, ficam sempre em output_data.json.words do job, que é o formato que add_captions aceita como captions.

### Posso trocar várias vozes num único clipe?

Sim, no Nodaro Cloud, com voice_changer_pro. A ferramenta detecta cada falante e dá a cada um a voz que você listar para ele, na ordem em que cada um fala pela primeira vez, mantendo as palavras e o timing.
