Transcrever
Transcreva a fala de um áudio ou vídeo com o ElevenLabs STT ou o Whisper: o tempo de cada palavra para legendas, os falantes e tags de música e risadas.
O nó Transcrever (Transcribe) transforma fala em texto. Conecte um áudio ou um vídeo, e o nó retorna a transcrição duas vezes: como texto simples e como uma transcrição estruturada, com o tempo de cada palavra. Você pode escolher entre três mecanismos, e eles diferem em um ponto que importa para as legendas: se retornam ou não os tempos de cada palavra.
Quando usar
- Transcrever uma entrevista ou um podcast para criar conteúdo escrito.
- Criar legendas a partir do som de um vídeo, com Adicionar legendas (Add Captions).
- Transformar notas de voz e gravações de reuniões em texto.
- Tornar uma biblioteca de áudios pesquisável como texto.
- Passar uma transcrição a um nó de texto para resumi-la ou analisá-la.
- Dar ao Plano de edição (Edit Plan) a transcrição com tempos de que ele precisa para planejar uma edição.
Início rápido
Adicione o nó
Pressione Tab no canvas e escolha Áudio › Transcrição › Transcrever.
Conecte a gravação
Conecte um nó de áudio ou um nó de vídeo à entrada Áudio.
Escolha o mecanismo e o idioma
Abra o painel de configurações. Mantenha Provedor em ElevenLabs STT, a menos que você precise de outro mecanismo. Mantenha Idioma em Detecção automática ou escolha o idioma.
Execute
Clique em Executar no nó. A transcrição simples aparece na saída Texto, e a transcrição com tempos, na saída Transcrição.
Entrada e saídas
| Entrada | Aceita | O que faz |
|---|---|---|
| Áudio | Nós de áudio e de vídeo | A fala a transcrever. No caso de um vídeo, o nó usa a faixa de áudio dele. |
| Saída | O que traz |
|---|---|
| Texto | A transcrição inteira como texto simples. Ela se conecta a qualquer nó que receba texto. |
| Transcrição | A transcrição estruturada, com os tempos das palavras e dos segmentos em milissegundos. Ela alimenta o Adicionar legendas e os nós de edição. |
Em um prompt, uma referência ao rótulo do nó, como {Transcribe}, fornece o texto simples.
Configurações
| Configuração | O que faz |
|---|---|
| Provedor | O mecanismo: ElevenLabs STT (o padrão), Whisper — sem tempos por palavra ou Incredibly Fast Whisper. |
| Idioma | Detecção automática (o padrão) ou um de 20 idiomas, como inglês, espanhol, hebraico, japonês e árabe. |
| Identificação de falantes | Identifica quem disse o quê. Vem desativada por padrão. Só aparece quando o Provedor é ElevenLabs STT. |
| Marcar eventos sonoros | Marca na transcrição os sons que não são fala, como [music] ou [laughter]. Vem desativada por padrão. Só aparece quando o Provedor é ElevenLabs STT. |
Identificação de falantes e Marcar eventos sonoros são independentes: ative uma, as duas ou nenhuma.


Modelos
| Modelo | Desenvolvedor | Modos | Créditos | Detalhes |
|---|---|---|---|---|
| ElevenLabs STT | ElevenLabs | Fala para texto | 25 | Fala para texto com marcações de tempo POR PALAVRA (sempre ativas), identificação de falantes e tags de eventos sonoros. É o mecanismo certo quando a transcrição alimenta legendas. |
| Incredibly Fast Whisper | OpenAI | Fala para texto | 44 | Fala para texto rápido com o Whisper. Retorna marcações de tempo POR PALAVRA quando solicitado, então a transcrição pode alimentar legendas. |
| Whisper | OpenAI | Fala para texto | 44 | Fala para texto com o Whisper — só segmentos POR FRASE, SEM marcações de tempo por palavra. Serve para uma transcrição ou uma legenda estática, mas não para legendas sincronizadas palavra por palavra (cinéticas). |
Tempos de cada palavra: qual mecanismo os retorna
| Mecanismo | Tempos de cada palavra | Observações |
|---|---|---|
| ElevenLabs STT (padrão) | Sempre | Projetado para trabalhar palavra por palavra. O mecanismo para legendas, rótulos de falante e eventos sonoros. |
| Incredibly Fast Whisper | Quando necessário | O nó pede os tempos de cada palavra automaticamente quando a saída Transcrição está conectada. |
| Whisper | Nunca | Só segmentos de frases. Serve para uma transcrição simples ou uma legenda estática. |
Se o ElevenLabs STT ou o Incredibly Fast Whisper não retornar os tempos de cada palavra para um áudio que claramente tem fala, a execução falha e os créditos são reembolsados. Um áudio sem nenhuma fala ainda é concluído com sucesso, sem palavras, por exemplo um clipe cuja transcrição é [music].
A transcrição estruturada
A saída Transcrição tem esta forma:
{
"version": 1,
"language": "en",
"words": [
{ "text": "Welcome", "startMs": 0, "endMs": 420 },
{ "text": "back", "startMs": 460, "endMs": 700 }
],
"segments": [
{ "startMs": 0, "endMs": 700, "text": "Welcome back" }
]
}- Todos os tempos estão em milissegundos inteiros.
wordstraz cada palavra com o início e o fim dela. Ele é preenchido sempre que o mecanismo retorna os tempos de cada palavra.segmentstraz as frases ou os trechos maiores, quando o mecanismo os fornece.- Em uma execução com Identificação de falantes, cada palavra e cada segmento também têm um
speaker. Uma palavra também pode trazer umconfidence.
Na saída Texto, a Identificação de falantes adiciona rótulos como Speaker 1: antes de cada segmento, e Marcar eventos sonoros adiciona tags como [music] e [laughter] no lugar em que os sons ocorrem.
Crie legendas a partir de uma transcrição
Conecte a saída Transcrição à entrada de transcrição do Adicionar legendas. O Adicionar legendas então desenha legendas sincronizadas com cada palavra. Para isso, use o ElevenLabs STT ou o Incredibly Fast Whisper.
Uma transcrição do Whisper não serve para legendas. Quando um nó Transcrever com o Whisper alimenta o Adicionar legendas, a execução é recusada antes que qualquer coisa seja executada ou cobrada, com esta mensagem:
Captions need word timings, but the "whisper" engine does not return word timings — pick incredibly-fast-whisper or elevenlabs-stt.- A verificação também cobre uma cadeia que passa pelo Aplicar EDL (Apply EDL) e cadeias dentro de um sub-workflow, em qualquer profundidade.
- O painel de configurações mostra o mesmo aviso ao lado de Provedor assim que a conexão existe, para que você corrija antes de executar.
- Executar o nó Transcrever sozinho nunca é bloqueado. Uma transcrição do Whisper que vai para qualquer outro lugar não tem problema.
- Um caso não pode ser verificado com antecedência: uma cadeia em que o Transcrever e o Adicionar legendas ficam em lados diferentes do limite de um sub-workflow. Essa execução falha no Adicionar legendas, depois que a transcrição já foi executada e cobrada.
Créditos
O Transcrever custa um preço fixo por execução, qualquer que seja a duração do áudio:
| Mecanismo | Créditos por execução |
|---|---|
| ElevenLabs STT | 25 |
| Incredibly Fast Whisper | 44 |
| Whisper | 44 |
Uma requisição recusada antes de começar, como uma transcrição do Whisper conectada ao Adicionar legendas, não é cobrada.
Em uma instalação self-hosted
Cada mecanismo usa a sua própria chave de provedor. Quando o mecanismo escolhido não tem chave e a instalação tem uma conexão com o Nodaro Cloud, a transcrição passa por essa conexão. Sem nenhuma das duas, o nó falha com uma mensagem que indica a chave a adicionar. Veja Chaves de provedor.
Dicas
- Deixe o idioma em Detecção automática. Escolha um idioma só quando você souber qual é, por exemplo quando dois idiomas soam parecidos.
- Identifique os falantes em conversas. Ative Identificação de falantes em entrevistas, reuniões e podcasts.
- Marque os eventos quando eles importarem. Ative Marcar eventos sonoros quando os sons de fundo ajudarem a entender a gravação.
- Limpe antes o áudio com ruído. Passe a gravação pelo Extrator de voz (Voice Extractor) antes do Transcrever.
- Divida áudios muito longos. Segmentos mais curtos são transcritos com mais confiabilidade. O Dividir em partes (Split into Chunks) corta um arquivo longo em partes iguais.
- Ou alinhe o seu próprio roteiro. Quando você já tem o roteiro exato, o Alinhamento forçado (Forced Alignment) marca no áudio o tempo de cada palavra dele.
Pela API
POST /v1/transcribe recebe audioUrl e, opcionalmente, provider (elevenlabs-stt, incredibly-fast-whisper ou whisper), language, diarize, tagAudioEvents e wordTimestamps.
- Indique o mecanismo. Uma requisição sem
providerexecuta o Whisper, para que as integrações existentes mantenham o mecanismo que já usavam. Definaprovidersempre que precisar dos tempos de cada palavra, dediarizeou detagAudioEvents. - Tempos de cada palavra.
incredibly-fast-whispersó retorna as palavras comwordTimestamps: true.wordTimestamps: truecomwhisperé recusado com um400 validation_errorantes de o job ser criado, então nada é cobrado. O mecanismo nunca é trocado sem aviso. - Legendas. O
output_data.wordsdo job concluído já tem o formato das legendas (text,startMs,endMs). Passe-o paraPOST /v1/add-captionscomocaptions, e o Adicionar legendas não transcreve de novo. - Preço.
GET /v1/credits/model-cost?model=<engine>retorna o preço exato para a sua conta.
O método do SDK é client.audio.transcribe, e o comando da CLI é nodaro audio transcribe --provider <engine>. A ferramenta MCP transcribe sempre executa o ElevenLabs STT, então o resultado dela sempre tem os tempos de cada palavra. Veja Voz e mídia.
Perguntas frequentes
Páginas relacionadas
Adicionar legendas
Alinhamento forçado
Plano de edição
Extrator de voz
ElevenLabs STT
Última atualização
Efeitos de áudio
Ponha uma voz numa sala, num carro ou numa igreja com reverb, ou aplique telefone, megafone, eco ou atraso e EQ próprios. 22 créditos fixos por execução.
Alinhamento forçado
Marque no áudio o tempo de cada palavra de uma transcrição conhecida e receba o início e o fim de cada uma como dados, para karaokê, gráficos e legendas.