# Texto para fala

> Transforme texto em fala natural com o ElevenLabs v3, Turbo v2.5 ou Multilingual v2. Escolha uma voz, dê emoção com tags de áudio e fale em até 46 idiomas.

Source: https://nodaro.ai/pt-BR/docs/nodes/audio/text-to-speech

O nó **Texto para fala** (Text to Speech) transforma texto em áudio falado com os modelos de voz da ElevenLabs. Você escreve ou conecta o texto e escolhe uma voz e um modelo. O nó retorna um arquivo de áudio que você pode colocar sob um vídeo, sincronizar com os lábios de um rosto ou mixar com música. O modelo padrão, o ElevenLabs v3, fala 46 idiomas e entende tags de áudio como `[laughs]` e `[whispers]`.

- Found in: Audio › Speech & Voiceover
- Output: audio
- Credits: 17–33 créditos
- Models: 3
- API type: `text-to-speech`

## Quando usar
- Você precisa de uma locução ou de uma narração para um vídeo, um vídeo explicativo ou um anúncio.
- Você quer que um personagem diga uma fala, por exemplo antes de a [**Sincronização labial** (Lip Sync)](https://nodaro.ai/docs/nodes/video/lip-sync) animar um retrato.
- Você quer um áudio no estilo podcast a partir de um roteiro escrito.
- Você quer o mesmo roteiro em vários idiomas.
- Você quer uma interpretação expressiva, com emoções, reações e pausas escritas direto no texto.

Para uma conversa entre várias vozes em um só arquivo, use o [**Texto para diálogo** (Text to Dialogue)](https://nodaro.ai/docs/nodes/audio/text-to-dialogue).

## Início rápido
### Adicione o nó
Pressione Tab no canvas e escolha **Áudio › Fala e narração › Texto para fala**.

### Forneça o texto
Conecte um nó [**Texto** (Text)](https://nodaro.ai/docs/nodes/automate/text), [**Prompt**](https://nodaro.ai/docs/nodes/automate/prompt) ou [**Gerar roteiro** (Generate Script)](https://nodaro.ai/docs/nodes/video/generate-script) à entrada **Prompt**. Para digitar o texto no próprio nó, abra o painel de configurações e defina **Origem do texto** como **Escrever diretamente**.

### Escolha a voz e o modelo
Em **Voz**, abra o explorador de vozes, ouça algumas prévias e escolha uma. Em **Modelo**, mantenha o **ElevenLabs v3**, a menos que você precise de um texto mais longo ou de um preço menor.

### Execute
Clique em **Executar** no nó. A fala aparece no nó com um player, e todos os resultados anteriores ficam no histórico de resultados dele.

Workflow: Um roteiro vira uma narração, um reverb de sala coloca a voz na cena, e a voz é mesclada a um vídeo.

- Texto → Texto para fala (prompt)
- Texto para fala → Efeitos de áudio (áudio)
- Efeitos de áudio → Mesclar vídeo e áudio (áudio)
- Gerar vídeo → Mesclar vídeo e áudio (vídeo)

## Entradas
| Entrada | Aceita | O que faz |
| --- | --- | --- |
| **Prompt** | Nós de texto, como Texto, Prompt, Gerar roteiro e **Combinar texto** (Combine Text) | O texto a falar, quando a **Origem do texto** é **Do nó conectado**. |

A saída, **Áudio**, é a URL do áudio falado. Ela pode alimentar quantos nós você quiser ao mesmo tempo.

## Configurações
| Configuração | O que faz |
| --- | --- |
| **Origem do texto** | **Do nó conectado** (o padrão) fala o texto conectado a **Prompt**. **Escrever diretamente** fala o texto que você digita em **Texto**. |
| **Texto** | O texto a falar, quando a Origem do texto é **Escrever diretamente**. Digite `[` ou `/` para inserir uma tag de áudio. Você pode inserir o valor de outro nó escrevendo o rótulo dele entre chaves, como `{Script}`. |
| **Modelo** | **ElevenLabs v3** (o padrão), **ElevenLabs Turbo v2.5** ou **ElevenLabs Multilingual v2**. |
| **Voz** | A voz que fala. Abre o explorador de vozes. A voz padrão é **Rachel**. |
| **Idioma** | **Detecção automática** (o padrão) ou um idioma da lista do modelo. |
| **Estabilidade** | De 0 a 1. Valores mais baixos soam mais expressivos e variados; valores mais altos soam mais uniformes. |
| **Semelhança** | De 0 a 1. O quanto o resultado se aproxima do timbre da voz. Só no Turbo v2.5 e no Multilingual v2. |
| **Exagero de estilo** | De 0 a 1. Reforça o estilo da voz original. Só no Turbo v2.5 e no Multilingual v2. |
| **Velocidade** | De `0.7x` a `1.2x`. Só no Turbo v2.5 e no Multilingual v2. |
| **Texto antes e depois** | Texto sempre adicionado antes e depois do texto a falar. Fica oculto para quem usa o seu workflow como app. Veja [Texto antes e depois do prompt](https://nodaro.ai/docs/concepts/prompt-pre-post-text). |

**As configurações de voz seguem a prévia da voz.** Quando você não mexe nos controles deslizantes, o nó usa as configurações salvas da própria voz, as mesmas com que a prévia dela foi feita. Assim, o resultado soa como a prévia que você ouviu. Quando você move um controle, só aquele valor muda, e a voz mantém as outras configurações salvas.

![O painel de configurações do Texto para fala com Origem do texto, Modelo, Voz, Idioma e o controle deslizante Estabilidade.](https://nodaro.ai/docs-media/screens/en/nodes/text-to-speech/settings.light.webp)

## Modelos
O Texto para fala pode executar os três modelos de fala da ElevenLabs abaixo. Clique em um modelo para ver o preço em créditos.

| Model | Maker | Modes | Credits | Details |
| --- | --- | --- | --- | --- |
| [ElevenLabs v3](https://nodaro.ai/docs/models/audio/elevenlabs-v3) | ElevenLabs | Text to speech | 33 | Latest ElevenLabs TTS — supports [audio tags] for emotion / pacing. Direct API. |
| [ElevenLabs Turbo v2.5](https://nodaro.ai/docs/models/audio/elevenlabs-turbo-v2-5) | ElevenLabs | Text to speech | 17 | Fast, cheap ElevenLabs TTS via the direct ElevenLabs API. Good for narration. |
| [ElevenLabs Multilingual v2](https://nodaro.ai/docs/models/audio/elevenlabs-multilingual-v2) | ElevenLabs | Text to speech | 33 | Multi-language ElevenLabs TTS via the direct ElevenLabs API. |

| Modelo | Idiomas | Tags de áudio | Caracteres por execução |
| --- | --- | --- | --- |
| **ElevenLabs v3** (padrão) | 46 | Sim | 5.000 |
| **ElevenLabs Turbo v2.5** | 32 | Não, são removidas antes da fala | 40.000 |
| **ElevenLabs Multilingual v2** | 29 | Não, são removidas antes da fala | 10.000 |

### Qual modelo escolher
- **ElevenLabs v3** — o padrão. Escolha-o para uma fala expressiva, tags de áudio e o maior número de idiomas.
- **ElevenLabs Turbo v2.5** — mais barato e mais rápido. Escolha-o para narrações simples e textos longos, de até 40.000 caracteres por execução.
- **ElevenLabs Multilingual v2** — fala natural em 29 idiomas, com até 10.000 caracteres por execução.

Para conhecer todos os modelos de áudio do Nodaro, leia [Como escolher um modelo](https://nodaro.ai/docs/guides/choosing-models).

## Escolha uma voz
O explorador de vozes tem três abas:

- **Prontas** — as vozes padrão da ElevenLabs.
- **Minhas vozes** — as vozes personalizadas que você já tem. Para criar uma nova voz a partir de uma descrição, use o [**Design de voz** (Voice Design)](https://nodaro.ai/docs/nodes/audio/voice-design).
- **Biblioteca de vozes** — a biblioteca compartilhada da ElevenLabs, com busca e filtros de sotaque, idade, idioma, caso de uso e tom.

Cada voz tem uma prévia que você pode ouvir antes de escolhê-la.

Os criadores verificam cada voz da Biblioteca de vozes para modelos específicos. Suponha que o nó execute o Turbo v2.5 ou o Multilingual v2, e você escolha uma voz da biblioteca que não foi verificada para esse modelo. O nó então muda o **Modelo** para um modelo para o qual a voz foi verificada. O ElevenLabs v3 renderiza qualquer voz, então um nó com o v3 nunca muda de modelo.

## Adicione emoção com tags de áudio
O ElevenLabs v3 lê tags de áudio: instruções curtas entre colchetes, colocadas no texto no ponto em que o efeito deve acontecer. Por exemplo: `I can't believe it [laughs] that's amazing`.

| Tipo | Exemplos |
| --- | --- |
| Emoções | `[excited]`, `[sad]`, `[angry]` |
| Reações | `[laughs]`, `[sighs]`, `[gasps]` |
| Modo de falar | `[whispers]`, `[shouting]` |
| Ritmo | `[pause]`, `[long pause]` |
| Tom | `[cheerfully]`, `[deadpan]` |
| Efeitos sonoros | `[applause]`, `[thunder]` |

Os modelos v2 removem as tags de áudio antes de falar, e o texto que sobra pode soar estranho. Para adicionar uma pausa em um modelo v2, use uma tag de pausa, como `<break time="1.0s" />`.

### Ouça a diferença
Os dois takes abaixo usam o ElevenLabs v3 e a voz pronta Rachel. O primeiro lê o texto com duas tags de áudio; o segundo lê as mesmas palavras sem elas.

```
I looked everywhere for it. [whispers] And then I found it, right under the old map. [laughs] It was there the whole time.
```

Audio: [Com as duas tags, [whispers] e [laughs].](https://nodaro.ai/docs-media/examples/text-to-speech/with-tags.mp3)
Audio: [As mesmas palavras, sem tags.](https://nodaro.ai/docs-media/examples/text-to-speech/plain.mp3)

## Idiomas
A **Detecção automática** funciona bem para a maioria dos textos. Para textos que não estão em inglês, escolher o idioma explicitamente pode melhorar a pronúncia.

- **Multilingual v2 (29 idiomas):** inglês, japonês, chinês, alemão, híndi, francês, coreano, português, italiano, espanhol, indonésio, holandês, turco, filipino, polonês, sueco, búlgaro, romeno, árabe, tcheco, grego, finlandês, croata, malaio, eslovaco, dinamarquês, tâmil, ucraniano e russo.
- **Turbo v2.5 (32 idiomas):** todos os idiomas do Multilingual v2, mais húngaro, norueguês e vietnamita.
- **v3 (46 idiomas):** todos os idiomas do Turbo v2.5, mais hebraico, tailandês, bengali, urdu, persa, sérvio, lituano, letão, estoniano, georgiano, islandês, catalão, africâner e suaíli.

## Créditos
O preço depende do modelo, e o ElevenLabs Turbo v2.5 é o mais barato. A tabela em [Modelos](#models) mostra cada preço, e a página de cada modelo traz os detalhes.

## Dicas
- **Mantenha a Estabilidade perto de 0,5.** Esse valor equilibra expressividade e consistência. Leve-a para perto de 1 em narrações que precisam soar uniformes.
- **Coloque as tags onde o efeito acontece.** Uma tag no meio de uma frase muda a fala naquele ponto.
- **Divida roteiros longos no v3.** Acima de 5.000 caracteres, divida o roteiro em vários nós ou mude para o Turbo v2.5.
- **Coloque a voz na cena.** Uma voz seca sobre um vídeo pode soar como se tivesse sido gravada em outro lugar. Passe-a pelo [**Efeitos de áudio** (Audio FX)](https://nodaro.ai/docs/nodes/audio/audio-fx) com um reverb como **Sala (ambiente interno)**.
- **Nivele vários clipes.** Passe os clipes pelo [**Ajustar volume** (Adjust Volume)](https://nodaro.ai/docs/nodes/audio/adjust-volume) com **Normalizar**, para que toquem no mesmo volume.

## Solução de problemas
**A execução falha com um erro de voz.** A voz não existe mais, por exemplo porque foi removida da Biblioteca de vozes. Escolha outra voz e execute o nó de novo.

**O final do texto está faltando.** O texto passa do limite do modelo, e o excedente foi cortado. Divida o texto ou mude para o ElevenLabs Turbo v2.5.

**Palavras entre colchetes estão faltando ou o texto soa estranho.** Você usou tags de áudio com um modelo v2, que as remove. Mude o **Modelo** para ElevenLabs v3 ou remova as tags.

## Pela API
`POST /v1/text-to-speech` executa o mesmo nó por código. Quando uma requisição omite `provider`, o Nodaro escolhe pelo tamanho. Um texto de até 5.000 caracteres é executado no ElevenLabs v3, e um texto mais longo, no Turbo v2.5, então um texto longo nunca é cortado no limite do v3. Um `provider` que você define é sempre usado como está. Pela ferramenta MCP `generate_speech`, um ID de voz desconhecido é substituído pela voz Rachel, para que o assistente receba áudio mesmo assim. Veja [Voz e mídia](https://nodaro.ai/docs/developers/api/voice-and-media) e as [ferramentas MCP](https://nodaro.ai/docs/mcp/tools).

## Frequently asked questions

### Qual modelo devo escolher no “Texto para fala”?

Comece com o ElevenLabs v3, o padrão. Ele fala 46 idiomas e entende tags de áudio para emoção e ritmo. Use o ElevenLabs Turbo v2.5 para narrações simples mais baratas e para textos longos, porque ele aceita até 40.000 caracteres por execução.

### Qual pode ser o tamanho do texto?

O ElevenLabs v3 fala até 5.000 caracteres por execução, o Multilingual v2 até 10.000 e o Turbo v2.5 até 40.000. Um texto mais longo é encurtado até o limite em vez de ser recusado, e o painel de configurações avisa você antes que isso aconteça.

### Como faço a voz rir, sussurrar ou fazer uma pausa?

Com o ElevenLabs v3, escreva uma tag de áudio entre colchetes no ponto em que o efeito deve acontecer, por exemplo “I can't believe it [laughs] that's amazing”. Os modelos v2 removem as tags de áudio antes de falar.

### Posso usar a minha própria voz?

As vozes personalizadas que você já tem aparecem em “Minhas vozes”, no explorador de vozes. Para criar uma nova voz personalizada a partir de uma descrição escrita, use o nó “Design de voz”.

### O que acontece se a voz que escolhi foi excluída?

A execução falha com um erro claro. O Nodaro nunca troca por outra voz sem avisar você, então escolha outra voz e execute o nó de novo.
