Docs do Nodaro
DocumentaçãoReferência de nósModelosAgentes de IA (MCP)DesenvolvedoresSelf-hostingPesquisa
Referência das ferramentas

Áudio

Gere fala e diálogos, crie e troque vozes, duble, crie efeitos sonoros, transcreva e limpe ou corte áudio com as ferramentas de áudio do MCP do Nodaro.

As ferramentas de áudio permitem que um assistente crie e altere sons no Nodaro: fala e diálogos, vozes novas e modificadas, dublagem, efeitos sonoros, transcrições e limpeza. Cada ferramenta, exceto list_voices, inicia um job e retorna o ID dele, e o resultado é salvo na sua biblioteca. Todas as ferramentas de áudio precisam da permissão workflows:execute.

FerramentaO que faz
generate_speechTexto para fala com uma voz
generate_dialogueUma conversa entre várias vozes, num único arquivo
list_voicesAs vozes prontas
voice_designUma nova voz a partir de uma descrição
voice_remixFala numa voz que você descreve, sem ID de voz
voice_changerTroca a voz de uma gravação ou de um vídeo
voice_changer_proTroca a voz de vários falantes de uma vez
dubbingTraduz a fala para outro idioma, mantendo as vozes
text_to_audioEfeitos sonoros a partir de uma descrição
transcribeFala para texto, com os tempos das palavras
audio_isolationIsola a voz ou o som principal de uma mixagem
separate_audioSepara o áudio em vocais e instrumental, ou em stems
apply_audio_fxReverbs e efeitos que situam uma voz num ambiente
trim_audioCorta o áudio ou o extrai de um vídeo
download_youtube_audioA faixa de áudio de um vídeo do YouTube

generate_speech

Transforma texto em fala com uma voz do ElevenLabs. Funciona como o nó Texto para fala (Text to Speech).

Permissão: workflows:execute. Créditos: o preço do modelo, abaixo.

ModeloDesenvolvedorModosCréditosDetalhes
ElevenLabs v3ElevenLabsTexto para fala33O modelo de texto para fala mais recente da ElevenLabs — aceita tags de áudio entre colchetes para emoção e ritmo. API direta.
ElevenLabs Turbo v2.5ElevenLabsTexto para fala17Texto para fala rápido e barato da ElevenLabs, pela API direta da ElevenLabs. Bom para narração.
ElevenLabs Multilingual v2ElevenLabsTexto para fala33Texto para fala multilíngue da ElevenLabs, pela API direta da ElevenLabs.
ParâmetroTipoObservações
textstringObrigatório. O que dizer, com até 5.000 caracteres. Divida um roteiro mais longo em várias chamadas.
voice_idstringO nome de uma voz pronta ou o ID de uma voz que você clonou. Padrão: Rachel. Um ID desconhecido falha com voice_not_found.
voice_typestringpremade, custom ou library.
modelstringelevenlabs-v3 (padrão), elevenlabs-turbo ou elevenlabs-multilingual. elevenlabs, o ID antigo do elevenlabs-turbo, também é aceito.
language_codestringO idioma do texto.
stability, similarity_boost, stylenumberConfigurações de locução, de 0 a 1.
speednumberDe 0,7 a 1,2.
presetIdstringUma predefinição de locução, como Narrador calmo, Locução comercial ou Audiolivro, de list_node_presets. Você ainda passa text.

Como escolher o modelo. O ElevenLabs v3 aceita tags de áudio como [laughs], [whispers] e [sighs] para emoção e ritmo, e é totalmente multilíngue: use-o para qualquer idioma, inclusive hebraico, árabe, chinês, japonês e coreano. O ElevenLabs Turbo é mais barato para narração simples. O ElevenLabs Multilingual v2 é um modelo legado; use-o só para uma voz que comprovadamente funciona apenas no v2.

Como escolher a voz. As vozes prontas são Rachel, Aria, Roger, Sarah, Laura, Charlie, George, Callum, River, Liam, Charlotte, Alice, Matilda, Will, Jessica, Eric, Chris, Brian, Daniel, Lily e Bill. Para uma voz feminina calorosa, experimente Rachel; para uma voz feminina jovem, Aria ou Lily; para uma voz masculina grave, Roger ou Brian; para uma voz masculina neutra, George ou Daniel; e para uma voz britânica, Charlie ou Charlotte.

Retorna: um ID de job. O cartão toca o áudio quando ele fica pronto.

generate_dialogue

Dá voz a um roteiro com vários falantes num único arquivo de áudio, com alternância natural entre as falas, no ElevenLabs Dialogue v3. Use-a para conversas, entrevistas, trocas no estilo podcast e cenas, em vez de juntar clipes separados de generate_speech. Funciona como o nó Texto para diálogo (Text to Dialogue).

Permissão: workflows:execute. Créditos: o preço do ElevenLabs Dialogue v3, por 1.000 caracteres.

ParâmetroTipoObservações
dialoguearrayObrigatório. As falas na ordem em que são ditas, de 1 a 200, cada uma { text, voice_id }. Reutilize a mesma voz para o mesmo personagem. As falas podem conter tags de áudio como [laughs].
stabilitynumber0 (mais variada), 0.5 (equilibrada) ou 1 (mais estável).
language_codestringUma indicação de idioma, como en ou he. Omita-a para detectar o idioma.
seedintegerUma seed fixa, para um resultado repetível.
apply_text_normalizationstringEscreve por extenso números, datas e abreviações: auto (padrão), on ou off.

Os limites são 5.000 caracteres no total, com 2.000 ou menos recomendados para a melhor qualidade, e 10 vozes diferentes por chamada. O mesmo roteiro pode misturar nomes de vozes prontas e vozes clonadas.

Retorna: um ID de job.

list_voices

Retorna as vozes prontas, com o ID, o nome e os detalhes de gênero, sotaque e descrição, quando houver. generate_speech, voice_changer e voice_changer_pro precisam de um ID de voz.

Permissão: workflows:execute. Créditos: grátis.

Esta ferramenta não tem parâmetros. Ela lê o catálogo e não inicia nenhum job.

voice_design

Cria uma nova voz a partir de uma descrição e retorna uma amostra dela falando o seu roteiro. Use-a para ouvir uma prévia da voz antes de salvá-la. Funciona como o nó Design de voz (Voice Design).

Permissão: workflows:execute. Créditos: 55.

ParâmetroTipoObservações
voice_descriptionstringObrigatório. A voz: gênero, idade, sotaque, tom e personalidade, com até 1.000 caracteres. Por exemplo “warm female narrator with a soft British accent, low-pitched, calm pacing”.
textstringObrigatório. Um roteiro de amostra para a voz falar, de 100 a 1.000 caracteres.
modelstringeleven_ttv_v3 (padrão, todos os idiomas) ou o legado eleven_multilingual_ttv_v2.
loudness, guidance_scale, quality, seed, should_enhanceConfigurações opcionais de design. loudness vai de -1 a 1, e guidance_scale, de 0 a 100.

Retorna: um ID de job. O resultado é uma amostra em áudio da voz criada.

voice_remix

Fala um texto numa voz que você descreve em palavras, sem ID de voz. Use-a para uma voz avulsa, que você não precisa guardar. Funciona como o nó Remix de voz (Voice Remix).

Permissão: workflows:execute. Créditos: 44.

ParâmetroTipoObservações
textstringObrigatório. O que dizer, com até 5.000 caracteres.
voice_descriptionstringObrigatório. A voz, com até 1.000 caracteres, por exemplo “a warm, mid-40s British woman with a calm news-anchor tone”.

Retorna: um ID de job.

voice_changer

Substitui a voz numa faixa de áudio, ou num vídeo inteiro de alguém falando, mantendo a interpretação e o ritmo. Funciona como o nó Modificador de voz (Voice Changer).

Permissão: workflows:execute. Créditos: 44.

ParâmetroTipoObservações
voice_idstringObrigatório. A nova voz: o nome de uma voz pronta ou o ID de uma voz que você clonou.
audio_url ou audio_asset_idstringUma origem de áudio.
video_url ou video_asset_idstringUma origem de vídeo, no lugar do áudio. O vídeo prevalece quando você passa os dois.
remove_background_noisebooleantrue retorna só a voz limpa. false mantém a música e os efeitos sonoros sob a nova voz.
stability, similarity_boost, stylenumberDe 0 a 1. style exagera a interpretação original; acima de 0, fica mais lento e pode ser menos estável.

Retorna: um ID de job. Para uma origem de vídeo, o cartão mostra uma prévia do novo áudio, e o novo vídeo vai para a sua biblioteca.

voice_changer_pro

Detecta cada falante de um clipe e dá a cada um uma nova voz, mantendo as palavras e o timing. O falante 1 recebe a primeira voz da lista, o falante 2, a segunda, e assim por diante, na ordem em que cada um fala pela primeira vez. Funciona como o nó Modificador de voz Pro (Voice Changer Pro).

Permissão: workflows:execute. Créditos: os mesmos do nó Modificador de voz Pro. Somente no Nodaro Cloud.

ParâmetroTipoObservações
ordered_voicesarrayObrigatório. De 1 a 8 itens, um por falante. Um item é um ID de voz, um objeto com as próprias configurações ou null, para manter a voz original desse falante. Pelo menos um item não pode ser null.
audio_url, audio_asset_id, video_url ou video_asset_idstringA origem: uma faixa de áudio ou um vídeo cujas vozes são trocadas.
analysisobjectA saída de um job anterior de voice_changer_pro_analyze. A troca então usa exatamente a lista de falantes à qual você associou as suas vozes, em vez de detectar os falantes de novo.
preserve_backgroundbooleanMixa de volta a música e os efeitos sonoros sob as novas vozes. Padrão: true.
music_volume_mode, music_volumeO nível do fundo: match (original), normalize ou manual, com um volume de 0 a 200.
voice_fxobjectUm reverb ou efeito nas novas vozes, antes de o fundo voltar: um preset como room, hall, church, telephone ou echo, com wetDryMix, delayMs e decay.
separation_qualitystringfast (padrão) ou best.
remove_background_noisebooleanRemove primeiro o ruído de fundo, para um resultado limpo, só com a voz.
outputstringvideo (padrão), um vídeo pronto, ou stems, as faixas separadas para a sua própria mixagem com voice_changer_pro_export.
modelstringUma substituição do modelo de voz.

Um objeto de item de voz recebe voiceId e, opcionalmente, engine, stability, similarityBoost, style, useSpeakerBoost, seed, volumeMode e volume. O engine é sts (o padrão, que troca a voz da interpretação original) ou v3, que fala a frase de novo a partir da transcrição com o ElevenLabs v3. O mecanismo v3 aceita tags de áudio e uma estabilidade de 0, de 0,5 ou de 1, e lê a transcrição da analysis; sem uma análise, ele usa a própria transcrição.

Retorna: um ID de job.

voice_changer_pro_analyze

Detecta os falantes de um clipe sem alterá-los: a primeira etapa do fluxo interativo. A saída do job contém as faixas separadas de voz e de fundo, cada falante com os segmentos de tempo, a primeira aparição, a contagem de palavras e um trecho do texto, além do idioma. Confira essa saída para escolher uma voz para cada falante e para identificar “falantes” que não são pessoas, como aplausos.

Permissão: workflows:execute. Somente no Nodaro Cloud.

ParâmetroTipoObservações
audio_url, audio_asset_id, video_url ou video_asset_idstringO clipe de origem.
separation_qualitystringfast (padrão) ou best.
suggest_titlebooleanTambém sugere um título a partir da transcrição, como suggestedTitle.

Retorna: um ID de job. Passe o output_data dele para voice_changer_pro como analysis.

voice_changer_pro_export

Renderiza um vídeo pronto a partir da sua própria mixagem de faixas: a última etapa do fluxo interativo, depois de voice_changer_pro com output: "stems". O vídeo é copiado sem recodificação.

Permissão: workflows:execute. Somente no Nodaro Cloud.

ParâmetroTipoObservações
tracksarrayObrigatório. De 1 a 16 faixas, cada uma com uma url, um gain de 0 a 200 (100 não altera nada), muted e um kind, voice (padrão) ou background. Pelo menos uma faixa não pode estar silenciada.
video_url ou video_asset_idstringO vídeo de origem.
voice_fxobjectUm efeito aplicado só às faixas de voz.

Retorna: um ID de job.

dubbing

Traduz a fala para outro idioma, mantendo a voz e o timing de cada falante. Uma origem de vídeo retorna o vídeo dublado e a faixa de áudio dele. Funciona como o nó Dublagem (Dubbing).

Permissão: workflows:execute. Créditos: cobrados por minuto do trecho dublado.

ParâmetroTipoObservações
target_languagestringObrigatório. Um código de idioma, como en, es, fr, de, ja, zh, ko ou ar.
audio_url, audio_asset_id, video_url, video_asset_id ou source_urlstringExatamente uma origem. source_url é um link público do YouTube, do TikTok ou direto, que é baixado diretamente.
source_languagestringUma indicação do idioma de origem. Ele é detectado quando você o omite.
num_speakersintegerO número de vozes diferentes, até 20. 0 as detecta.
disable_voice_cloningbooleanUsa uma voz nativa parecida em vez da voz original de cada falante.
drop_background_audiobooleanRemove o fundo, para origens só com fala.
start_time, end_timenumberDubla só parte da origem, em segundos.
highest_resolutionbooleanMantém a resolução de origem de um vídeo. Mais lento.
use_profanity_filter, target_accent, watermarkOpcionais. target_accent orienta as vozes para um sotaque.

Uma dublagem cobre no máximo 30 minutos. Use start_time e end_time para uma parte de uma origem mais longa.

Retorna: um ID de job.

text_to_audio

Cria um efeito sonoro a partir de uma descrição: foley, ambiência, sons de interface. Não serve para fala nem música. Funciona como o nó Texto para áudio (Text to Audio).

Permissão: workflows:execute. Créditos: o preço do ElevenLabs Sound Effects.

ParâmetroTipoObservações
promptstringO som, por exemplo “thunderstorm with heavy rain”, com até 2.000 caracteres. Obrigatório, a menos que uma predefinição o forneça.
durationnumberDe 0,5 a 30 segundos. Por padrão, o modelo decide.
loopbooleanFaz o som se repetir em loop sem emendas.
prompt_influencenumberO quanto o som segue o prompt, de 0 a 1.
presetIdstringUma predefinição como Ambiente de chuva, Transição whoosh ou Impacto / estrondo.

Retorna: um ID de job.

transcribe

Transforma a fala de um arquivo de áudio ou de vídeo em texto com o mecanismo ElevenLabs STT. Os tempos das palavras, em milissegundos, ficam sempre em output_data.json.words. Funciona como o nó Transcrever (Transcribe).

Permissão: workflows:execute. Créditos: o preço do ElevenLabs STT.

ParâmetroTipoObservações
audio_url ou audio_asset_idstringA origem. O ID pode ser de um job de áudio ou de vídeo.
languagestringUm código de idioma, como en. Detectado quando você o omite.
diarizebooleanIdentifica cada falante. Padrão: false.
tag_audio_eventsbooleanMarca sons como [laughter] ou [music]. Padrão: false.
word_timestampsbooleanMantido por compatibilidade. Os tempos das palavras são retornados de qualquer forma.

Retorna: um ID de job. A transcrição fica na saída do job. Para legendar um vídeo com o texto corrigido, mapeie json.words para as captions de add_captions, um item por palavra. Os mecanismos Whisper estão disponíveis no nó do canvas, na API REST, no SDK e na CLI, mas não por esta ferramenta.

audio_isolation

Remove a música e o ruído de fundo de uma mixagem e retorna a voz, os vocais ou o instrumento principal como uma única faixa limpa. Funciona como o nó Extrator de voz (Voice Extractor).

Permissão: workflows:execute. Créditos: o preço do ElevenLabs Voice Isolation, conforme a duração.

ParâmetroTipoObservações
audio_url ou audio_asset_idstringA origem. O ID pode ser de um job de áudio ou de vídeo.

Retorna: um ID de job.

separate_audio

Separa qualquer áudio em vocais e instrumental, ou em stems completos: bateria, baixo, guitarra, piano e outros. Usa o Demucs e, ao contrário de suno_separate_stems, não precisa de uma faixa do Suno. Funciona como o nó Separação de áudio (Audio Separation).

Permissão: workflows:execute. Créditos: de 33 a 88, conforme o modo e a qualidade.

ParâmetroTipoObservações
audio_url ou audio_asset_idstringA origem. audio_asset_id aceita um job de áudio ou um arquivo de áudio enviado, não um vídeo.
modestringvocal_instrumental (padrão) ou stems.
qualitystringauto (padrão), fast ou best.

Retorna: um ID de job. Leia a URL de cada stem, como vocalUrl, instrumentalUrl ou drumsUrl, com get_job.

apply_audio_fx

Aplica um efeito criativo a uma voz ou a um clipe: um reverb que situa uma voz seca num ambiente, ou um efeito de telefone, megafone ou eco. Funciona como o nó Efeitos de áudio (Audio FX).

Permissão: workflows:execute. Créditos: 22.

ParâmetroTipoObservações
audio_url ou audio_asset_idstringA origem. O ID pode ser de um job de áudio ou de vídeo.
presetstringroom (padrão), bathroom, car, hall, concert-hall, church, cave, arena, outdoor, telephone, megaphone, echo ou custom.
mixnumberA quantidade de reverb, de 0 a 100.

Retorna: um ID de job.

trim_audio

Corta o áudio num intervalo de tempo, ou extrai o áudio de um vídeo e o corta. Funciona como o nó Cortar áudio (Trim Audio).

Permissão: workflows:execute. Créditos: 11.

ParâmetroTipoObservações
audio_url, audio_asset_id, video_url ou video_asset_idstringUma origem. Uma origem de vídeo fornece a faixa de áudio dele.
start_time, end_timenumberO intervalo em segundos. Omita os dois para manter a faixa inteira.
audio_formatstringmp3 (padrão), wav ou aac.

Retorna: um ID de job.

download_youtube_audio

Extrai a faixa de áudio de um vídeo do YouTube.

Permissão: workflows:execute.

ParâmetroTipoObservações
youtube_urlstringObrigatório. A URL do vídeo do YouTube.

Retorna: um ID de job. O resultado é um arquivo de áudio que você pode passar para outras ferramentas.

Perguntas frequentes

Última atualização

Nesta página