Docs do Nodaro
DocumentaçãoReferência de nósModelosAgentes de IA (MCP)DesenvolvedoresSelf-hostingPesquisa
Áudio

Texto para fala

Transforme texto em fala natural com o ElevenLabs v3, Turbo v2.5 ou Multilingual v2. Escolha uma voz, dê emoção com tags de áudio e fale em até 46 idiomas.

O nó Texto para fala (Text to Speech) transforma texto em áudio falado com os modelos de voz da ElevenLabs. Você escreve ou conecta o texto e escolhe uma voz e um modelo. O nó retorna um arquivo de áudio que você pode colocar sob um vídeo, sincronizar com os lábios de um rosto ou mixar com música. O modelo padrão, o ElevenLabs v3, fala 46 idiomas e entende tags de áudio como [laughs] e [whispers].

Quando usar

  • Você precisa de uma locução ou de uma narração para um vídeo, um vídeo explicativo ou um anúncio.
  • Você quer que um personagem diga uma fala, por exemplo antes de a Sincronização labial (Lip Sync) animar um retrato.
  • Você quer um áudio no estilo podcast a partir de um roteiro escrito.
  • Você quer o mesmo roteiro em vários idiomas.
  • Você quer uma interpretação expressiva, com emoções, reações e pausas escritas direto no texto.

Para uma conversa entre várias vozes em um só arquivo, use o Texto para diálogo (Text to Dialogue).

Início rápido

Adicione o nó

Pressione Tab no canvas e escolha Áudio › Fala e narração › Texto para fala.

Forneça o texto

Conecte um nó Texto (Text), Prompt ou Gerar roteiro (Generate Script) à entrada Prompt. Para digitar o texto no próprio nó, abra o painel de configurações e defina Origem do texto como Escrever diretamente.

Escolha a voz e o modelo

Em Voz, abra o explorador de vozes, ouça algumas prévias e escolha uma. Em Modelo, mantenha o ElevenLabs v3, a menos que você precise de um texto mais longo ou de um preço menor.

Execute

Clique em Executar no nó. A fala aparece no nó com um player, e todos os resultados anteriores ficam no histórico de resultados dele.

promptáudioáudiovídeoTextoO roteiroTexto para falaElevenLabs v3Efeitos de áudioSala (ambiente interno)Gerar vídeoMesclar vídeo e áudio
Um roteiro vira uma narração, um reverb de sala coloca a voz na cena, e a voz é mesclada a um vídeo.

Entradas

EntradaAceitaO que faz
PromptNós de texto, como Texto, Prompt, Gerar roteiro e Combinar texto (Combine Text)O texto a falar, quando a Origem do texto é Do nó conectado.

A saída, Áudio, é a URL do áudio falado. Ela pode alimentar quantos nós você quiser ao mesmo tempo.

Configurações

ConfiguraçãoO que faz
Origem do textoDo nó conectado (o padrão) fala o texto conectado a Prompt. Escrever diretamente fala o texto que você digita em Texto.
TextoO texto a falar, quando a Origem do texto é Escrever diretamente. Digite [ ou / para inserir uma tag de áudio. Você pode inserir o valor de outro nó escrevendo o rótulo dele entre chaves, como {Script}.
ModeloElevenLabs v3 (o padrão), ElevenLabs Turbo v2.5 ou ElevenLabs Multilingual v2.
VozA voz que fala. Abre o explorador de vozes. A voz padrão é Rachel.
IdiomaDetecção automática (o padrão) ou um idioma da lista do modelo.
EstabilidadeDe 0 a 1. Valores mais baixos soam mais expressivos e variados; valores mais altos soam mais uniformes.
SemelhançaDe 0 a 1. O quanto o resultado se aproxima do timbre da voz. Só no Turbo v2.5 e no Multilingual v2.
Exagero de estiloDe 0 a 1. Reforça o estilo da voz original. Só no Turbo v2.5 e no Multilingual v2.
VelocidadeDe 0.7x a 1.2x. Só no Turbo v2.5 e no Multilingual v2.
Texto antes e depoisTexto sempre adicionado antes e depois do texto a falar. Fica oculto para quem usa o seu workflow como app. Veja Texto antes e depois do prompt.

As configurações de voz seguem a prévia da voz. Quando você não mexe nos controles deslizantes, o nó usa as configurações salvas da própria voz, as mesmas com que a prévia dela foi feita. Assim, o resultado soa como a prévia que você ouviu. Quando você move um controle, só aquele valor muda, e a voz mantém as outras configurações salvas.

O painel de configurações do Texto para fala com Origem do texto, Modelo, Voz, Idioma e o controle deslizante Estabilidade.O painel de configurações do Texto para fala com Origem do texto, Modelo, Voz, Idioma e o controle deslizante Estabilidade.

Modelos

O Texto para fala pode executar os três modelos de fala da ElevenLabs abaixo. Clique em um modelo para ver o preço em créditos.

ModeloDesenvolvedorModosCréditosDetalhes
ElevenLabs v3ElevenLabsTexto para fala33O modelo de texto para fala mais recente da ElevenLabs — aceita tags de áudio entre colchetes para emoção e ritmo. API direta.
ElevenLabs Turbo v2.5ElevenLabsTexto para fala17Texto para fala rápido e barato da ElevenLabs, pela API direta da ElevenLabs. Bom para narração.
ElevenLabs Multilingual v2ElevenLabsTexto para fala33Texto para fala multilíngue da ElevenLabs, pela API direta da ElevenLabs.
ModeloIdiomasTags de áudioCaracteres por execução
ElevenLabs v3 (padrão)46Sim5.000
ElevenLabs Turbo v2.532Não, são removidas antes da fala40.000
ElevenLabs Multilingual v229Não, são removidas antes da fala10.000

Qual modelo escolher

  • ElevenLabs v3 — o padrão. Escolha-o para uma fala expressiva, tags de áudio e o maior número de idiomas.
  • ElevenLabs Turbo v2.5 — mais barato e mais rápido. Escolha-o para narrações simples e textos longos, de até 40.000 caracteres por execução.
  • ElevenLabs Multilingual v2 — fala natural em 29 idiomas, com até 10.000 caracteres por execução.

Para conhecer todos os modelos de áudio do Nodaro, leia Como escolher um modelo.

Escolha uma voz

O explorador de vozes tem três abas:

  • Prontas — as vozes padrão da ElevenLabs.
  • Minhas vozes — as vozes personalizadas que você já tem. Para criar uma nova voz a partir de uma descrição, use o Design de voz (Voice Design).
  • Biblioteca de vozes — a biblioteca compartilhada da ElevenLabs, com busca e filtros de sotaque, idade, idioma, caso de uso e tom.

Cada voz tem uma prévia que você pode ouvir antes de escolhê-la.

Os criadores verificam cada voz da Biblioteca de vozes para modelos específicos. Suponha que o nó execute o Turbo v2.5 ou o Multilingual v2, e você escolha uma voz da biblioteca que não foi verificada para esse modelo. O nó então muda o Modelo para um modelo para o qual a voz foi verificada. O ElevenLabs v3 renderiza qualquer voz, então um nó com o v3 nunca muda de modelo.

Adicione emoção com tags de áudio

O ElevenLabs v3 lê tags de áudio: instruções curtas entre colchetes, colocadas no texto no ponto em que o efeito deve acontecer. Por exemplo: I can't believe it [laughs] that's amazing.

TipoExemplos
Emoções[excited], [sad], [angry]
Reações[laughs], [sighs], [gasps]
Modo de falar[whispers], [shouting]
Ritmo[pause], [long pause]
Tom[cheerfully], [deadpan]
Efeitos sonoros[applause], [thunder]

Os modelos v2 removem as tags de áudio antes de falar, e o texto que sobra pode soar estranho. Para adicionar uma pausa em um modelo v2, use uma tag de pausa, como <break time="1.0s" />.

Ouça a diferença

Os dois takes abaixo usam o ElevenLabs v3 e a voz pronta Rachel. O primeiro lê o texto com duas tags de áudio; o segundo lê as mesmas palavras sem elas.

Texto com tags de áudio
I looked everywhere for it. [whispers] And then I found it, right under the old map. [laughs] It was there the whole time.
Com as duas tags, [whispers] e [laughs].
As mesmas palavras, sem tags.

Idiomas

A Detecção automática funciona bem para a maioria dos textos. Para textos que não estão em inglês, escolher o idioma explicitamente pode melhorar a pronúncia.

  • Multilingual v2 (29 idiomas): inglês, japonês, chinês, alemão, híndi, francês, coreano, português, italiano, espanhol, indonésio, holandês, turco, filipino, polonês, sueco, búlgaro, romeno, árabe, tcheco, grego, finlandês, croata, malaio, eslovaco, dinamarquês, tâmil, ucraniano e russo.
  • Turbo v2.5 (32 idiomas): todos os idiomas do Multilingual v2, mais húngaro, norueguês e vietnamita.
  • v3 (46 idiomas): todos os idiomas do Turbo v2.5, mais hebraico, tailandês, bengali, urdu, persa, sérvio, lituano, letão, estoniano, georgiano, islandês, catalão, africâner e suaíli.

Créditos

O preço depende do modelo, e o ElevenLabs Turbo v2.5 é o mais barato. A tabela em Modelos mostra cada preço, e a página de cada modelo traz os detalhes.

Dicas

  • Mantenha a Estabilidade perto de 0,5. Esse valor equilibra expressividade e consistência. Leve-a para perto de 1 em narrações que precisam soar uniformes.
  • Coloque as tags onde o efeito acontece. Uma tag no meio de uma frase muda a fala naquele ponto.
  • Divida roteiros longos no v3. Acima de 5.000 caracteres, divida o roteiro em vários nós ou mude para o Turbo v2.5.
  • Coloque a voz na cena. Uma voz seca sobre um vídeo pode soar como se tivesse sido gravada em outro lugar. Passe-a pelo Efeitos de áudio (Audio FX) com um reverb como Sala (ambiente interno).
  • Nivele vários clipes. Passe os clipes pelo Ajustar volume (Adjust Volume) com Normalizar, para que toquem no mesmo volume.

Solução de problemas

A execução falha com um erro de voz. A voz não existe mais, por exemplo porque foi removida da Biblioteca de vozes. Escolha outra voz e execute o nó de novo.

O final do texto está faltando. O texto passa do limite do modelo, e o excedente foi cortado. Divida o texto ou mude para o ElevenLabs Turbo v2.5.

Palavras entre colchetes estão faltando ou o texto soa estranho. Você usou tags de áudio com um modelo v2, que as remove. Mude o Modelo para ElevenLabs v3 ou remova as tags.

Pela API

POST /v1/text-to-speech executa o mesmo nó por código. Quando uma requisição omite provider, o Nodaro escolhe pelo tamanho. Um texto de até 5.000 caracteres é executado no ElevenLabs v3, e um texto mais longo, no Turbo v2.5, então um texto longo nunca é cortado no limite do v3. Um provider que você define é sempre usado como está. Pela ferramenta MCP generate_speech, um ID de voz desconhecido é substituído pela voz Rachel, para que o assistente receba áudio mesmo assim. Veja Voz e mídia e as ferramentas MCP.

Perguntas frequentes

Última atualização

Nesta página