# Transcrever

> Transcreva a fala de um áudio ou vídeo com o ElevenLabs STT ou o Whisper: o tempo de cada palavra para legendas, os falantes e tags de música e risadas.

Source: https://nodaro.ai/pt-BR/docs/nodes/audio/transcribe

O nó **Transcrever** (Transcribe) transforma fala em texto. Conecte um áudio ou um vídeo, e o nó retorna a transcrição duas vezes: como texto simples e como uma transcrição estruturada, com o tempo de cada palavra. Você pode escolher entre três mecanismos, e eles diferem em um ponto que importa para as legendas: se retornam ou não os tempos de cada palavra.

- Found in: Audio › Transcribe
- Output: text
- Credits: 25–44 créditos
- Models: 3
- API type: `transcribe`

## Quando usar
- Transcrever uma entrevista ou um podcast para criar conteúdo escrito.
- Criar legendas a partir do som de um vídeo, com [**Adicionar legendas** (Add Captions)](https://nodaro.ai/docs/nodes/video/add-captions).
- Transformar notas de voz e gravações de reuniões em texto.
- Tornar uma biblioteca de áudios pesquisável como texto.
- Passar uma transcrição a um nó de texto para resumi-la ou analisá-la.
- Dar ao [**Plano de edição** (Edit Plan)](https://nodaro.ai/docs/nodes/video/edit-plan) a transcrição com tempos de que ele precisa para planejar uma edição.

## Início rápido
### Adicione o nó
Pressione Tab no canvas e escolha **Áudio › Transcrição › Transcrever**.

### Conecte a gravação
Conecte um nó de áudio ou um nó de vídeo à entrada **Áudio**.

### Escolha o mecanismo e o idioma
Abra o painel de configurações. Mantenha **Provedor** em **ElevenLabs STT**, a menos que você precise de outro mecanismo. Mantenha **Idioma** em **Detecção automática** ou escolha o idioma.

### Execute
Clique em **Executar** no nó. A transcrição simples aparece na saída **Texto**, e a transcrição com tempos, na saída **Transcrição**.

Workflow: Um vídeo é transcrito uma vez: a transcrição com tempos conduz legendas palavra por palavra, e o texto é resumido.

- Enviar vídeo → Transcrever (áudio)
- Enviar vídeo → Adicionar legendas (vídeo)
- Transcrever → Adicionar legendas (transcrição)
- Transcrever → Prompt (prompt)

## Entrada e saídas
| Entrada | Aceita | O que faz |
| --- | --- | --- |
| **Áudio** | Nós de áudio e de vídeo | A fala a transcrever. No caso de um vídeo, o nó usa a faixa de áudio dele. |

| Saída | O que traz |
| --- | --- |
| **Texto** | A transcrição inteira como texto simples. Ela se conecta a qualquer nó que receba texto. |
| **Transcrição** | A transcrição estruturada, com os tempos das palavras e dos segmentos em milissegundos. Ela alimenta o Adicionar legendas e os nós de edição. |

Em um prompt, uma referência ao rótulo do nó, como `{Transcribe}`, fornece o texto simples.

## Configurações
| Configuração | O que faz |
| --- | --- |
| **Provedor** | O mecanismo: **ElevenLabs STT** (o padrão), **Whisper — sem tempos por palavra** ou **Incredibly Fast Whisper**. |
| **Idioma** | **Detecção automática** (o padrão) ou um de 20 idiomas, como inglês, espanhol, hebraico, japonês e árabe. |
| **Identificação de falantes** | Identifica quem disse o quê. Vem desativada por padrão. Só aparece quando o Provedor é **ElevenLabs STT**. |
| **Marcar eventos sonoros** | Marca na transcrição os sons que não são fala, como `[music]` ou `[laughter]`. Vem desativada por padrão. Só aparece quando o Provedor é **ElevenLabs STT**. |

Identificação de falantes e Marcar eventos sonoros são independentes: ative uma, as duas ou nenhuma.

![O painel de configurações do Transcrever com o Provedor em ElevenLabs STT, o Idioma em Detecção automática e as caixas de seleção Identificação de falantes e Marcar eventos sonoros.](https://nodaro.ai/docs-media/screens/en/nodes/transcribe/settings.light.webp)

## Modelos
| Model | Maker | Modes | Credits | Details |
| --- | --- | --- | --- | --- |
| [ElevenLabs STT](https://nodaro.ai/docs/models/audio/elevenlabs-stt) | ElevenLabs | Speech to text | 25 | Speech-to-text with WORD-level timestamps (always on), speaker diarization and audio-event tags. The engine to use when the transcript feeds captions. |
| [Incredibly Fast Whisper](https://nodaro.ai/docs/models/audio/incredibly-fast-whisper) | OpenAI | Speech to text | 44 | Fast Whisper speech-to-text. Returns WORD-level timestamps when asked, so its transcript can feed captions. |
| [Whisper](https://nodaro.ai/docs/models/audio/whisper) | OpenAI | Speech to text | 44 | Whisper speech-to-text — PHRASE-level segments only, NO word timestamps. Fine for a transcript or a static subtitle; not for word-timed (kinetic) captions. |

## Tempos de cada palavra: qual mecanismo os retorna
| Mecanismo | Tempos de cada palavra | Observações |
| --- | --- | --- |
| **ElevenLabs STT** (padrão) | Sempre | Projetado para trabalhar palavra por palavra. O mecanismo para legendas, rótulos de falante e eventos sonoros. |
| **Incredibly Fast Whisper** | Quando necessário | O nó pede os tempos de cada palavra automaticamente quando a saída **Transcrição** está conectada. |
| **Whisper** | Nunca | Só segmentos de frases. Serve para uma transcrição simples ou uma legenda estática. |

Se o ElevenLabs STT ou o Incredibly Fast Whisper não retornar os tempos de cada palavra para um áudio que claramente tem fala, a execução falha e os créditos são reembolsados. Um áudio sem nenhuma fala ainda é concluído com sucesso, sem palavras, por exemplo um clipe cuja transcrição é `[music]`.

## A transcrição estruturada
A saída **Transcrição** tem esta forma:

```json
{
"version": 1,
"language": "en",
"words": [
{ "text": "Welcome", "startMs": 0, "endMs": 420 },
{ "text": "back", "startMs": 460, "endMs": 700 }
],
"segments": [
{ "startMs": 0, "endMs": 700, "text": "Welcome back" }
]
}
```

- Todos os tempos estão em milissegundos inteiros.
- `words` traz cada palavra com o início e o fim dela. Ele é preenchido sempre que o mecanismo retorna os tempos de cada palavra.
- `segments` traz as frases ou os trechos maiores, quando o mecanismo os fornece.
- Em uma execução com Identificação de falantes, cada palavra e cada segmento também têm um `speaker`. Uma palavra também pode trazer um `confidence`.

Na saída **Texto**, a Identificação de falantes adiciona rótulos como `Speaker 1:` antes de cada segmento, e Marcar eventos sonoros adiciona tags como `[music]` e `[laughter]` no lugar em que os sons ocorrem.

## Crie legendas a partir de uma transcrição
Conecte a saída **Transcrição** à entrada de transcrição do [Adicionar legendas](https://nodaro.ai/docs/nodes/video/add-captions). O Adicionar legendas então desenha legendas sincronizadas com cada palavra. Para isso, use o **ElevenLabs STT** ou o **Incredibly Fast Whisper**.

**Uma transcrição do Whisper não serve para legendas.** Quando um nó Transcrever com o **Whisper** alimenta o Adicionar legendas, a execução é recusada antes que qualquer coisa seja executada ou cobrada, com esta mensagem:

```
Captions need word timings, but the "whisper" engine does not return word timings — pick incredibly-fast-whisper or elevenlabs-stt.
```

- A verificação também cobre uma cadeia que passa pelo [**Aplicar EDL** (Apply EDL)](https://nodaro.ai/docs/nodes/video/apply-edl) e cadeias dentro de um sub-workflow, em qualquer profundidade.
- O painel de configurações mostra o mesmo aviso ao lado de **Provedor** assim que a conexão existe, para que você corrija antes de executar.
- Executar o nó Transcrever sozinho nunca é bloqueado. Uma transcrição do Whisper que vai para qualquer outro lugar não tem problema.
- Um caso não pode ser verificado com antecedência: uma cadeia em que o Transcrever e o Adicionar legendas ficam em lados diferentes do limite de um sub-workflow. Essa execução falha no Adicionar legendas, depois que a transcrição já foi executada e cobrada.

## Créditos
O Transcrever custa um preço fixo por execução, qualquer que seja a duração do áudio:

| Mecanismo | Créditos por execução |
| --- | --- |
| **ElevenLabs STT** | 25 |
| **Incredibly Fast Whisper** | 44 |
| **Whisper** | 44 |

Uma requisição recusada antes de começar, como uma transcrição do Whisper conectada ao Adicionar legendas, não é cobrada.

## Em uma instalação self-hosted
Cada mecanismo usa a sua própria chave de provedor. Quando o mecanismo escolhido não tem chave e a instalação tem uma [conexão com o Nodaro Cloud](https://nodaro.ai/docs/self-hosting/cloud-connect), a transcrição passa por essa conexão. Sem nenhuma das duas, o nó falha com uma mensagem que indica a chave a adicionar. Veja [Chaves de provedor](https://nodaro.ai/docs/self-hosting/provider-keys).

## Dicas
- **Deixe o idioma em Detecção automática.** Escolha um idioma só quando você souber qual é, por exemplo quando dois idiomas soam parecidos.
- **Identifique os falantes em conversas.** Ative **Identificação de falantes** em entrevistas, reuniões e podcasts.
- **Marque os eventos quando eles importarem.** Ative **Marcar eventos sonoros** quando os sons de fundo ajudarem a entender a gravação.
- **Limpe antes o áudio com ruído.** Passe a gravação pelo [**Extrator de voz** (Voice Extractor)](https://nodaro.ai/docs/nodes/audio/voice-extractor) antes do Transcrever.
- **Divida áudios muito longos.** Segmentos mais curtos são transcritos com mais confiabilidade. O [**Dividir em partes** (Split into Chunks)](https://nodaro.ai/docs/nodes/video/split-into-chunks) corta um arquivo longo em partes iguais.
- **Ou alinhe o seu próprio roteiro.** Quando você já tem o roteiro exato, o [**Alinhamento forçado** (Forced Alignment)](https://nodaro.ai/docs/nodes/audio/forced-alignment) marca no áudio o tempo de cada palavra dele.

## Pela API
`POST /v1/transcribe` recebe `audioUrl` e, opcionalmente, `provider` (`elevenlabs-stt`, `incredibly-fast-whisper` ou `whisper`), `language`, `diarize`, `tagAudioEvents` e `wordTimestamps`.

- **Indique o mecanismo.** Uma requisição sem `provider` executa o Whisper, para que as integrações existentes mantenham o mecanismo que já usavam. Defina `provider` sempre que precisar dos tempos de cada palavra, de `diarize` ou de `tagAudioEvents`.
- **Tempos de cada palavra.** `incredibly-fast-whisper` só retorna as palavras com `wordTimestamps: true`. `wordTimestamps: true` com `whisper` é recusado com um `400 validation_error` antes de o job ser criado, então nada é cobrado. O mecanismo nunca é trocado sem aviso.
- **Legendas.** O `output_data.words` do job concluído já tem o formato das legendas (`text`, `startMs`, `endMs`). Passe-o para `POST /v1/add-captions` como `captions`, e o Adicionar legendas não transcreve de novo.
- **Preço.** `GET /v1/credits/model-cost?model=<engine>` retorna o preço exato para a sua conta.

O método do SDK é `client.audio.transcribe`, e o comando da CLI é `nodaro audio transcribe --provider <engine>`. A ferramenta MCP `transcribe` sempre executa o ElevenLabs STT, então o resultado dela sempre tem os tempos de cada palavra. Veja [Voz e mídia](https://nodaro.ai/docs/developers/api/voice-and-media).

## Frequently asked questions

### Qual mecanismo de transcrição devo escolher?

Mantenha o ElevenLabs STT, o padrão. Ele sempre retorna os tempos de cada palavra, pode identificar os falantes e marcar eventos sonoros, e é o mais barato. O Incredibly Fast Whisper também retorna os tempos de cada palavra quando um nó precisa deles. O Whisper retorna só frases, o que basta para uma transcrição simples.

### Por que o meu workflow com “Transcrever” e “Adicionar legendas” foi recusado?

O nó “Transcrever” usa o Whisper, que não retorna os tempos de cada palavra, e as legendas precisam deles. Mude “Provedor” para ElevenLabs STT ou Incredibly Fast Whisper e execute de novo. A execução é recusada antes de começar, então nada é cobrado.

### Quantos créditos o nó “Transcrever” custa?

Um preço fixo por execução, qualquer que seja a duração do áudio. O ElevenLabs STT custa 25 créditos, o Incredibly Fast Whisper custa 44 e o Whisper custa 44.

### O nó “Transcrever” consegue distinguir os falantes?

Sim, com o ElevenLabs STT. Ative “Identificação de falantes”, e o texto indica o falante de cada segmento, como “Speaker 1:”. Cada palavra da transcrição estruturada também traz o falante dela.

### Posso transcrever um vídeo?

Sim. Conecte o vídeo à entrada “Áudio”, e o nó transcreve a faixa de áudio dele.
