Texto para fala
Transforme texto em fala natural com o ElevenLabs v3, Turbo v2.5 ou Multilingual v2. Escolha uma voz, dê emoção com tags de áudio e fale em até 46 idiomas.
O nó Texto para fala (Text to Speech) transforma texto em áudio falado com os modelos de voz da ElevenLabs. Você escreve ou conecta o texto e escolhe uma voz e um modelo. O nó retorna um arquivo de áudio que você pode colocar sob um vídeo, sincronizar com os lábios de um rosto ou mixar com música. O modelo padrão, o ElevenLabs v3, fala 46 idiomas e entende tags de áudio como [laughs] e [whispers].
Quando usar
- Você precisa de uma locução ou de uma narração para um vídeo, um vídeo explicativo ou um anúncio.
- Você quer que um personagem diga uma fala, por exemplo antes de a Sincronização labial (Lip Sync) animar um retrato.
- Você quer um áudio no estilo podcast a partir de um roteiro escrito.
- Você quer o mesmo roteiro em vários idiomas.
- Você quer uma interpretação expressiva, com emoções, reações e pausas escritas direto no texto.
Para uma conversa entre várias vozes em um só arquivo, use o Texto para diálogo (Text to Dialogue).
Início rápido
Adicione o nó
Pressione Tab no canvas e escolha Áudio › Fala e narração › Texto para fala.
Forneça o texto
Conecte um nó Texto (Text), Prompt ou Gerar roteiro (Generate Script) à entrada Prompt. Para digitar o texto no próprio nó, abra o painel de configurações e defina Origem do texto como Escrever diretamente.
Escolha a voz e o modelo
Em Voz, abra o explorador de vozes, ouça algumas prévias e escolha uma. Em Modelo, mantenha o ElevenLabs v3, a menos que você precise de um texto mais longo ou de um preço menor.
Execute
Clique em Executar no nó. A fala aparece no nó com um player, e todos os resultados anteriores ficam no histórico de resultados dele.
Entradas
| Entrada | Aceita | O que faz |
|---|---|---|
| Prompt | Nós de texto, como Texto, Prompt, Gerar roteiro e Combinar texto (Combine Text) | O texto a falar, quando a Origem do texto é Do nó conectado. |
A saída, Áudio, é a URL do áudio falado. Ela pode alimentar quantos nós você quiser ao mesmo tempo.
Configurações
| Configuração | O que faz |
|---|---|
| Origem do texto | Do nó conectado (o padrão) fala o texto conectado a Prompt. Escrever diretamente fala o texto que você digita em Texto. |
| Texto | O texto a falar, quando a Origem do texto é Escrever diretamente. Digite [ ou / para inserir uma tag de áudio. Você pode inserir o valor de outro nó escrevendo o rótulo dele entre chaves, como {Script}. |
| Modelo | ElevenLabs v3 (o padrão), ElevenLabs Turbo v2.5 ou ElevenLabs Multilingual v2. |
| Voz | A voz que fala. Abre o explorador de vozes. A voz padrão é Rachel. |
| Idioma | Detecção automática (o padrão) ou um idioma da lista do modelo. |
| Estabilidade | De 0 a 1. Valores mais baixos soam mais expressivos e variados; valores mais altos soam mais uniformes. |
| Semelhança | De 0 a 1. O quanto o resultado se aproxima do timbre da voz. Só no Turbo v2.5 e no Multilingual v2. |
| Exagero de estilo | De 0 a 1. Reforça o estilo da voz original. Só no Turbo v2.5 e no Multilingual v2. |
| Velocidade | De 0.7x a 1.2x. Só no Turbo v2.5 e no Multilingual v2. |
| Texto antes e depois | Texto sempre adicionado antes e depois do texto a falar. Fica oculto para quem usa o seu workflow como app. Veja Texto antes e depois do prompt. |
As configurações de voz seguem a prévia da voz. Quando você não mexe nos controles deslizantes, o nó usa as configurações salvas da própria voz, as mesmas com que a prévia dela foi feita. Assim, o resultado soa como a prévia que você ouviu. Quando você move um controle, só aquele valor muda, e a voz mantém as outras configurações salvas.


Modelos
O Texto para fala pode executar os três modelos de fala da ElevenLabs abaixo. Clique em um modelo para ver o preço em créditos.
| Modelo | Desenvolvedor | Modos | Créditos | Detalhes |
|---|---|---|---|---|
| ElevenLabs v3 | ElevenLabs | Texto para fala | 33 | O modelo de texto para fala mais recente da ElevenLabs — aceita tags de áudio entre colchetes para emoção e ritmo. API direta. |
| ElevenLabs Turbo v2.5 | ElevenLabs | Texto para fala | 17 | Texto para fala rápido e barato da ElevenLabs, pela API direta da ElevenLabs. Bom para narração. |
| ElevenLabs Multilingual v2 | ElevenLabs | Texto para fala | 33 | Texto para fala multilíngue da ElevenLabs, pela API direta da ElevenLabs. |
| Modelo | Idiomas | Tags de áudio | Caracteres por execução |
|---|---|---|---|
| ElevenLabs v3 (padrão) | 46 | Sim | 5.000 |
| ElevenLabs Turbo v2.5 | 32 | Não, são removidas antes da fala | 40.000 |
| ElevenLabs Multilingual v2 | 29 | Não, são removidas antes da fala | 10.000 |
Qual modelo escolher
- ElevenLabs v3 — o padrão. Escolha-o para uma fala expressiva, tags de áudio e o maior número de idiomas.
- ElevenLabs Turbo v2.5 — mais barato e mais rápido. Escolha-o para narrações simples e textos longos, de até 40.000 caracteres por execução.
- ElevenLabs Multilingual v2 — fala natural em 29 idiomas, com até 10.000 caracteres por execução.
Para conhecer todos os modelos de áudio do Nodaro, leia Como escolher um modelo.
Escolha uma voz
O explorador de vozes tem três abas:
- Prontas — as vozes padrão da ElevenLabs.
- Minhas vozes — as vozes personalizadas que você já tem. Para criar uma nova voz a partir de uma descrição, use o Design de voz (Voice Design).
- Biblioteca de vozes — a biblioteca compartilhada da ElevenLabs, com busca e filtros de sotaque, idade, idioma, caso de uso e tom.
Cada voz tem uma prévia que você pode ouvir antes de escolhê-la.
Os criadores verificam cada voz da Biblioteca de vozes para modelos específicos. Suponha que o nó execute o Turbo v2.5 ou o Multilingual v2, e você escolha uma voz da biblioteca que não foi verificada para esse modelo. O nó então muda o Modelo para um modelo para o qual a voz foi verificada. O ElevenLabs v3 renderiza qualquer voz, então um nó com o v3 nunca muda de modelo.
Adicione emoção com tags de áudio
O ElevenLabs v3 lê tags de áudio: instruções curtas entre colchetes, colocadas no texto no ponto em que o efeito deve acontecer. Por exemplo: I can't believe it [laughs] that's amazing.
| Tipo | Exemplos |
|---|---|
| Emoções | [excited], [sad], [angry] |
| Reações | [laughs], [sighs], [gasps] |
| Modo de falar | [whispers], [shouting] |
| Ritmo | [pause], [long pause] |
| Tom | [cheerfully], [deadpan] |
| Efeitos sonoros | [applause], [thunder] |
Os modelos v2 removem as tags de áudio antes de falar, e o texto que sobra pode soar estranho. Para adicionar uma pausa em um modelo v2, use uma tag de pausa, como <break time="1.0s" />.
Ouça a diferença
Os dois takes abaixo usam o ElevenLabs v3 e a voz pronta Rachel. O primeiro lê o texto com duas tags de áudio; o segundo lê as mesmas palavras sem elas.
Idiomas
A Detecção automática funciona bem para a maioria dos textos. Para textos que não estão em inglês, escolher o idioma explicitamente pode melhorar a pronúncia.
- Multilingual v2 (29 idiomas): inglês, japonês, chinês, alemão, híndi, francês, coreano, português, italiano, espanhol, indonésio, holandês, turco, filipino, polonês, sueco, búlgaro, romeno, árabe, tcheco, grego, finlandês, croata, malaio, eslovaco, dinamarquês, tâmil, ucraniano e russo.
- Turbo v2.5 (32 idiomas): todos os idiomas do Multilingual v2, mais húngaro, norueguês e vietnamita.
- v3 (46 idiomas): todos os idiomas do Turbo v2.5, mais hebraico, tailandês, bengali, urdu, persa, sérvio, lituano, letão, estoniano, georgiano, islandês, catalão, africâner e suaíli.
Créditos
O preço depende do modelo, e o ElevenLabs Turbo v2.5 é o mais barato. A tabela em Modelos mostra cada preço, e a página de cada modelo traz os detalhes.
Dicas
- Mantenha a Estabilidade perto de 0,5. Esse valor equilibra expressividade e consistência. Leve-a para perto de 1 em narrações que precisam soar uniformes.
- Coloque as tags onde o efeito acontece. Uma tag no meio de uma frase muda a fala naquele ponto.
- Divida roteiros longos no v3. Acima de 5.000 caracteres, divida o roteiro em vários nós ou mude para o Turbo v2.5.
- Coloque a voz na cena. Uma voz seca sobre um vídeo pode soar como se tivesse sido gravada em outro lugar. Passe-a pelo Efeitos de áudio (Audio FX) com um reverb como Sala (ambiente interno).
- Nivele vários clipes. Passe os clipes pelo Ajustar volume (Adjust Volume) com Normalizar, para que toquem no mesmo volume.
Solução de problemas
A execução falha com um erro de voz. A voz não existe mais, por exemplo porque foi removida da Biblioteca de vozes. Escolha outra voz e execute o nó de novo.
O final do texto está faltando. O texto passa do limite do modelo, e o excedente foi cortado. Divida o texto ou mude para o ElevenLabs Turbo v2.5.
Palavras entre colchetes estão faltando ou o texto soa estranho. Você usou tags de áudio com um modelo v2, que as remove. Mude o Modelo para ElevenLabs v3 ou remova as tags.
Pela API
POST /v1/text-to-speech executa o mesmo nó por código. Quando uma requisição omite provider, o Nodaro escolhe pelo tamanho. Um texto de até 5.000 caracteres é executado no ElevenLabs v3, e um texto mais longo, no Turbo v2.5, então um texto longo nunca é cortado no limite do v3. Um provider que você define é sempre usado como está. Pela ferramenta MCP generate_speech, um ID de voz desconhecido é substituído pela voz Rachel, para que o assistente receba áudio mesmo assim. Veja Voz e mídia e as ferramentas MCP.
Perguntas frequentes
Páginas relacionadas
Texto para diálogo
Design de voz
Sincronização labial
Efeitos de áudio
ElevenLabs v3
Última atualização
Áudio de referência
Traga para um workflow o áudio de um vídeo do YouTube, de um arquivo enviado ou de um link direto. O nó extrai a faixa de áudio e deixa você ouvi-la antes.
Texto para diálogo
Dê voz a uma conversa inteira em um só áudio: uma voz por fala, tags de áudio para emoção ou falas preenchidas com um roteiro. ElevenLabs Dialogue v3.