Áudio
Gere fala e diálogos, crie e troque vozes, duble, crie efeitos sonoros, transcreva e limpe ou corte áudio com as ferramentas de áudio do MCP do Nodaro.
As ferramentas de áudio permitem que um assistente crie e altere sons no Nodaro: fala e diálogos, vozes novas e modificadas, dublagem, efeitos sonoros, transcrições e limpeza. Cada ferramenta, exceto list_voices, inicia um job e retorna o ID dele, e o resultado é salvo na sua biblioteca. Todas as ferramentas de áudio precisam da permissão workflows:execute.
| Ferramenta | O que faz |
|---|---|
generate_speech | Texto para fala com uma voz |
generate_dialogue | Uma conversa entre várias vozes, num único arquivo |
list_voices | As vozes prontas |
voice_design | Uma nova voz a partir de uma descrição |
voice_remix | Fala numa voz que você descreve, sem ID de voz |
voice_changer | Troca a voz de uma gravação ou de um vídeo |
voice_changer_pro | Troca a voz de vários falantes de uma vez |
dubbing | Traduz a fala para outro idioma, mantendo as vozes |
text_to_audio | Efeitos sonoros a partir de uma descrição |
transcribe | Fala para texto, com os tempos das palavras |
audio_isolation | Isola a voz ou o som principal de uma mixagem |
separate_audio | Separa o áudio em vocais e instrumental, ou em stems |
apply_audio_fx | Reverbs e efeitos que situam uma voz num ambiente |
trim_audio | Corta o áudio ou o extrai de um vídeo |
download_youtube_audio | A faixa de áudio de um vídeo do YouTube |
generate_speech
Transforma texto em fala com uma voz do ElevenLabs. Funciona como o nó Texto para fala (Text to Speech).
Permissão: workflows:execute. Créditos: o preço do modelo, abaixo.
| Modelo | Desenvolvedor | Modos | Créditos | Detalhes |
|---|---|---|---|---|
| ElevenLabs v3 | ElevenLabs | Texto para fala | 33 | O modelo de texto para fala mais recente da ElevenLabs — aceita tags de áudio entre colchetes para emoção e ritmo. API direta. |
| ElevenLabs Turbo v2.5 | ElevenLabs | Texto para fala | 17 | Texto para fala rápido e barato da ElevenLabs, pela API direta da ElevenLabs. Bom para narração. |
| ElevenLabs Multilingual v2 | ElevenLabs | Texto para fala | 33 | Texto para fala multilíngue da ElevenLabs, pela API direta da ElevenLabs. |
| Parâmetro | Tipo | Observações |
|---|---|---|
text | string | Obrigatório. O que dizer, com até 5.000 caracteres. Divida um roteiro mais longo em várias chamadas. |
voice_id | string | O nome de uma voz pronta ou o ID de uma voz que você clonou. Padrão: Rachel. Um ID desconhecido falha com voice_not_found. |
voice_type | string | premade, custom ou library. |
model | string | elevenlabs-v3 (padrão), elevenlabs-turbo ou elevenlabs-multilingual. elevenlabs, o ID antigo do elevenlabs-turbo, também é aceito. |
language_code | string | O idioma do texto. |
stability, similarity_boost, style | number | Configurações de locução, de 0 a 1. |
speed | number | De 0,7 a 1,2. |
presetId | string | Uma predefinição de locução, como Narrador calmo, Locução comercial ou Audiolivro, de list_node_presets. Você ainda passa text. |
Como escolher o modelo. O ElevenLabs v3 aceita tags de áudio como [laughs], [whispers] e [sighs] para emoção e ritmo, e é totalmente multilíngue: use-o para qualquer idioma, inclusive hebraico, árabe, chinês, japonês e coreano. O ElevenLabs Turbo é mais barato para narração simples. O ElevenLabs Multilingual v2 é um modelo legado; use-o só para uma voz que comprovadamente funciona apenas no v2.
Como escolher a voz. As vozes prontas são Rachel, Aria, Roger, Sarah, Laura, Charlie, George, Callum, River, Liam, Charlotte, Alice, Matilda, Will, Jessica, Eric, Chris, Brian, Daniel, Lily e Bill. Para uma voz feminina calorosa, experimente Rachel; para uma voz feminina jovem, Aria ou Lily; para uma voz masculina grave, Roger ou Brian; para uma voz masculina neutra, George ou Daniel; e para uma voz britânica, Charlie ou Charlotte.
Retorna: um ID de job. O cartão toca o áudio quando ele fica pronto.
generate_dialogue
Dá voz a um roteiro com vários falantes num único arquivo de áudio, com alternância natural entre as falas, no ElevenLabs Dialogue v3. Use-a para conversas, entrevistas, trocas no estilo podcast e cenas, em vez de juntar clipes separados de generate_speech. Funciona como o nó Texto para diálogo (Text to Dialogue).
Permissão: workflows:execute. Créditos: o preço do ElevenLabs Dialogue v3, por 1.000 caracteres.
| Parâmetro | Tipo | Observações |
|---|---|---|
dialogue | array | Obrigatório. As falas na ordem em que são ditas, de 1 a 200, cada uma { text, voice_id }. Reutilize a mesma voz para o mesmo personagem. As falas podem conter tags de áudio como [laughs]. |
stability | number | 0 (mais variada), 0.5 (equilibrada) ou 1 (mais estável). |
language_code | string | Uma indicação de idioma, como en ou he. Omita-a para detectar o idioma. |
seed | integer | Uma seed fixa, para um resultado repetível. |
apply_text_normalization | string | Escreve por extenso números, datas e abreviações: auto (padrão), on ou off. |
Os limites são 5.000 caracteres no total, com 2.000 ou menos recomendados para a melhor qualidade, e 10 vozes diferentes por chamada. O mesmo roteiro pode misturar nomes de vozes prontas e vozes clonadas.
Retorna: um ID de job.
list_voices
Retorna as vozes prontas, com o ID, o nome e os detalhes de gênero, sotaque e descrição, quando houver. generate_speech, voice_changer e voice_changer_pro precisam de um ID de voz.
Permissão: workflows:execute. Créditos: grátis.
Esta ferramenta não tem parâmetros. Ela lê o catálogo e não inicia nenhum job.
voice_design
Cria uma nova voz a partir de uma descrição e retorna uma amostra dela falando o seu roteiro. Use-a para ouvir uma prévia da voz antes de salvá-la. Funciona como o nó Design de voz (Voice Design).
Permissão: workflows:execute. Créditos: 55.
| Parâmetro | Tipo | Observações |
|---|---|---|
voice_description | string | Obrigatório. A voz: gênero, idade, sotaque, tom e personalidade, com até 1.000 caracteres. Por exemplo “warm female narrator with a soft British accent, low-pitched, calm pacing”. |
text | string | Obrigatório. Um roteiro de amostra para a voz falar, de 100 a 1.000 caracteres. |
model | string | eleven_ttv_v3 (padrão, todos os idiomas) ou o legado eleven_multilingual_ttv_v2. |
loudness, guidance_scale, quality, seed, should_enhance | Configurações opcionais de design. loudness vai de -1 a 1, e guidance_scale, de 0 a 100. |
Retorna: um ID de job. O resultado é uma amostra em áudio da voz criada.
voice_remix
Fala um texto numa voz que você descreve em palavras, sem ID de voz. Use-a para uma voz avulsa, que você não precisa guardar. Funciona como o nó Remix de voz (Voice Remix).
Permissão: workflows:execute. Créditos: 44.
| Parâmetro | Tipo | Observações |
|---|---|---|
text | string | Obrigatório. O que dizer, com até 5.000 caracteres. |
voice_description | string | Obrigatório. A voz, com até 1.000 caracteres, por exemplo “a warm, mid-40s British woman with a calm news-anchor tone”. |
Retorna: um ID de job.
voice_changer
Substitui a voz numa faixa de áudio, ou num vídeo inteiro de alguém falando, mantendo a interpretação e o ritmo. Funciona como o nó Modificador de voz (Voice Changer).
Permissão: workflows:execute. Créditos: 44.
| Parâmetro | Tipo | Observações |
|---|---|---|
voice_id | string | Obrigatório. A nova voz: o nome de uma voz pronta ou o ID de uma voz que você clonou. |
audio_url ou audio_asset_id | string | Uma origem de áudio. |
video_url ou video_asset_id | string | Uma origem de vídeo, no lugar do áudio. O vídeo prevalece quando você passa os dois. |
remove_background_noise | boolean | true retorna só a voz limpa. false mantém a música e os efeitos sonoros sob a nova voz. |
stability, similarity_boost, style | number | De 0 a 1. style exagera a interpretação original; acima de 0, fica mais lento e pode ser menos estável. |
Retorna: um ID de job. Para uma origem de vídeo, o cartão mostra uma prévia do novo áudio, e o novo vídeo vai para a sua biblioteca.
voice_changer_pro
Detecta cada falante de um clipe e dá a cada um uma nova voz, mantendo as palavras e o timing. O falante 1 recebe a primeira voz da lista, o falante 2, a segunda, e assim por diante, na ordem em que cada um fala pela primeira vez. Funciona como o nó Modificador de voz Pro (Voice Changer Pro).
Permissão: workflows:execute. Créditos: os mesmos do nó Modificador de voz Pro. Somente no Nodaro Cloud.
| Parâmetro | Tipo | Observações |
|---|---|---|
ordered_voices | array | Obrigatório. De 1 a 8 itens, um por falante. Um item é um ID de voz, um objeto com as próprias configurações ou null, para manter a voz original desse falante. Pelo menos um item não pode ser null. |
audio_url, audio_asset_id, video_url ou video_asset_id | string | A origem: uma faixa de áudio ou um vídeo cujas vozes são trocadas. |
analysis | object | A saída de um job anterior de voice_changer_pro_analyze. A troca então usa exatamente a lista de falantes à qual você associou as suas vozes, em vez de detectar os falantes de novo. |
preserve_background | boolean | Mixa de volta a música e os efeitos sonoros sob as novas vozes. Padrão: true. |
music_volume_mode, music_volume | O nível do fundo: match (original), normalize ou manual, com um volume de 0 a 200. | |
voice_fx | object | Um reverb ou efeito nas novas vozes, antes de o fundo voltar: um preset como room, hall, church, telephone ou echo, com wetDryMix, delayMs e decay. |
separation_quality | string | fast (padrão) ou best. |
remove_background_noise | boolean | Remove primeiro o ruído de fundo, para um resultado limpo, só com a voz. |
output | string | video (padrão), um vídeo pronto, ou stems, as faixas separadas para a sua própria mixagem com voice_changer_pro_export. |
model | string | Uma substituição do modelo de voz. |
Um objeto de item de voz recebe voiceId e, opcionalmente, engine, stability, similarityBoost, style, useSpeakerBoost, seed, volumeMode e volume. O engine é sts (o padrão, que troca a voz da interpretação original) ou v3, que fala a frase de novo a partir da transcrição com o ElevenLabs v3. O mecanismo v3 aceita tags de áudio e uma estabilidade de 0, de 0,5 ou de 1, e lê a transcrição da analysis; sem uma análise, ele usa a própria transcrição.
Retorna: um ID de job.
voice_changer_pro_analyze
Detecta os falantes de um clipe sem alterá-los: a primeira etapa do fluxo interativo. A saída do job contém as faixas separadas de voz e de fundo, cada falante com os segmentos de tempo, a primeira aparição, a contagem de palavras e um trecho do texto, além do idioma. Confira essa saída para escolher uma voz para cada falante e para identificar “falantes” que não são pessoas, como aplausos.
Permissão: workflows:execute. Somente no Nodaro Cloud.
| Parâmetro | Tipo | Observações |
|---|---|---|
audio_url, audio_asset_id, video_url ou video_asset_id | string | O clipe de origem. |
separation_quality | string | fast (padrão) ou best. |
suggest_title | boolean | Também sugere um título a partir da transcrição, como suggestedTitle. |
Retorna: um ID de job. Passe o output_data dele para voice_changer_pro como analysis.
voice_changer_pro_export
Renderiza um vídeo pronto a partir da sua própria mixagem de faixas: a última etapa do fluxo interativo, depois de voice_changer_pro com output: "stems". O vídeo é copiado sem recodificação.
Permissão: workflows:execute. Somente no Nodaro Cloud.
| Parâmetro | Tipo | Observações |
|---|---|---|
tracks | array | Obrigatório. De 1 a 16 faixas, cada uma com uma url, um gain de 0 a 200 (100 não altera nada), muted e um kind, voice (padrão) ou background. Pelo menos uma faixa não pode estar silenciada. |
video_url ou video_asset_id | string | O vídeo de origem. |
voice_fx | object | Um efeito aplicado só às faixas de voz. |
Retorna: um ID de job.
dubbing
Traduz a fala para outro idioma, mantendo a voz e o timing de cada falante. Uma origem de vídeo retorna o vídeo dublado e a faixa de áudio dele. Funciona como o nó Dublagem (Dubbing).
Permissão: workflows:execute. Créditos: cobrados por minuto do trecho dublado.
| Parâmetro | Tipo | Observações |
|---|---|---|
target_language | string | Obrigatório. Um código de idioma, como en, es, fr, de, ja, zh, ko ou ar. |
audio_url, audio_asset_id, video_url, video_asset_id ou source_url | string | Exatamente uma origem. source_url é um link público do YouTube, do TikTok ou direto, que é baixado diretamente. |
source_language | string | Uma indicação do idioma de origem. Ele é detectado quando você o omite. |
num_speakers | integer | O número de vozes diferentes, até 20. 0 as detecta. |
disable_voice_cloning | boolean | Usa uma voz nativa parecida em vez da voz original de cada falante. |
drop_background_audio | boolean | Remove o fundo, para origens só com fala. |
start_time, end_time | number | Dubla só parte da origem, em segundos. |
highest_resolution | boolean | Mantém a resolução de origem de um vídeo. Mais lento. |
use_profanity_filter, target_accent, watermark | Opcionais. target_accent orienta as vozes para um sotaque. |
Uma dublagem cobre no máximo 30 minutos. Use start_time e end_time para uma parte de uma origem mais longa.
Retorna: um ID de job.
text_to_audio
Cria um efeito sonoro a partir de uma descrição: foley, ambiência, sons de interface. Não serve para fala nem música. Funciona como o nó Texto para áudio (Text to Audio).
Permissão: workflows:execute. Créditos: o preço do ElevenLabs Sound Effects.
| Parâmetro | Tipo | Observações |
|---|---|---|
prompt | string | O som, por exemplo “thunderstorm with heavy rain”, com até 2.000 caracteres. Obrigatório, a menos que uma predefinição o forneça. |
duration | number | De 0,5 a 30 segundos. Por padrão, o modelo decide. |
loop | boolean | Faz o som se repetir em loop sem emendas. |
prompt_influence | number | O quanto o som segue o prompt, de 0 a 1. |
presetId | string | Uma predefinição como Ambiente de chuva, Transição whoosh ou Impacto / estrondo. |
Retorna: um ID de job.
transcribe
Transforma a fala de um arquivo de áudio ou de vídeo em texto com o mecanismo ElevenLabs STT. Os tempos das palavras, em milissegundos, ficam sempre em output_data.json.words. Funciona como o nó Transcrever (Transcribe).
Permissão: workflows:execute. Créditos: o preço do ElevenLabs STT.
| Parâmetro | Tipo | Observações |
|---|---|---|
audio_url ou audio_asset_id | string | A origem. O ID pode ser de um job de áudio ou de vídeo. |
language | string | Um código de idioma, como en. Detectado quando você o omite. |
diarize | boolean | Identifica cada falante. Padrão: false. |
tag_audio_events | boolean | Marca sons como [laughter] ou [music]. Padrão: false. |
word_timestamps | boolean | Mantido por compatibilidade. Os tempos das palavras são retornados de qualquer forma. |
Retorna: um ID de job. A transcrição fica na saída do job. Para legendar um vídeo com o texto corrigido, mapeie json.words para as captions de add_captions, um item por palavra. Os mecanismos Whisper estão disponíveis no nó do canvas, na API REST, no SDK e na CLI, mas não por esta ferramenta.
audio_isolation
Remove a música e o ruído de fundo de uma mixagem e retorna a voz, os vocais ou o instrumento principal como uma única faixa limpa. Funciona como o nó Extrator de voz (Voice Extractor).
Permissão: workflows:execute. Créditos: o preço do ElevenLabs Voice Isolation, conforme a duração.
| Parâmetro | Tipo | Observações |
|---|---|---|
audio_url ou audio_asset_id | string | A origem. O ID pode ser de um job de áudio ou de vídeo. |
Retorna: um ID de job.
separate_audio
Separa qualquer áudio em vocais e instrumental, ou em stems completos: bateria, baixo, guitarra, piano e outros. Usa o Demucs e, ao contrário de suno_separate_stems, não precisa de uma faixa do Suno. Funciona como o nó Separação de áudio (Audio Separation).
Permissão: workflows:execute. Créditos: de 33 a 88, conforme o modo e a qualidade.
| Parâmetro | Tipo | Observações |
|---|---|---|
audio_url ou audio_asset_id | string | A origem. audio_asset_id aceita um job de áudio ou um arquivo de áudio enviado, não um vídeo. |
mode | string | vocal_instrumental (padrão) ou stems. |
quality | string | auto (padrão), fast ou best. |
Retorna: um ID de job. Leia a URL de cada stem, como vocalUrl, instrumentalUrl ou drumsUrl, com get_job.
apply_audio_fx
Aplica um efeito criativo a uma voz ou a um clipe: um reverb que situa uma voz seca num ambiente, ou um efeito de telefone, megafone ou eco. Funciona como o nó Efeitos de áudio (Audio FX).
Permissão: workflows:execute. Créditos: 22.
| Parâmetro | Tipo | Observações |
|---|---|---|
audio_url ou audio_asset_id | string | A origem. O ID pode ser de um job de áudio ou de vídeo. |
preset | string | room (padrão), bathroom, car, hall, concert-hall, church, cave, arena, outdoor, telephone, megaphone, echo ou custom. |
mix | number | A quantidade de reverb, de 0 a 100. |
Retorna: um ID de job.
trim_audio
Corta o áudio num intervalo de tempo, ou extrai o áudio de um vídeo e o corta. Funciona como o nó Cortar áudio (Trim Audio).
Permissão: workflows:execute. Créditos: 11.
| Parâmetro | Tipo | Observações |
|---|---|---|
audio_url, audio_asset_id, video_url ou video_asset_id | string | Uma origem. Uma origem de vídeo fornece a faixa de áudio dele. |
start_time, end_time | number | O intervalo em segundos. Omita os dois para manter a faixa inteira. |
audio_format | string | mp3 (padrão), wav ou aac. |
Retorna: um ID de job.
download_youtube_audio
Extrai a faixa de áudio de um vídeo do YouTube.
Permissão: workflows:execute.
| Parâmetro | Tipo | Observações |
|---|---|---|
youtube_url | string | Obrigatório. A URL do vídeo do YouTube. |
Retorna: um ID de job. O resultado é um arquivo de áudio que você pode passar para outras ferramentas.
Perguntas frequentes
Páginas relacionadas
Texto para fala
Modificador de voz Pro
Dublagem
Música
Modelos de áudio
Última atualização
Análise e listas de edição
Analise um vídeo cena a cena, audite a análise, detecte silêncios, sincronize gravações e planeje e renderize listas de decisões de edição com o MCP.
Música
Crie músicas e instrumentais com o Suno e outros modelos e depois estenda, faça covers e mashups, edite, separe e converta tudo com o MCP do Nodaro.