Docs do Nodaro
DocumentaçãoReferência de nósModelosAgentes de IA (MCP)DesenvolvedoresSelf-hostingPesquisa
Áudio

Transcrever

Transcreva a fala de um áudio ou vídeo com o ElevenLabs STT ou o Whisper: o tempo de cada palavra para legendas, os falantes e tags de música e risadas.

O nó Transcrever (Transcribe) transforma fala em texto. Conecte um áudio ou um vídeo, e o nó retorna a transcrição duas vezes: como texto simples e como uma transcrição estruturada, com o tempo de cada palavra. Você pode escolher entre três mecanismos, e eles diferem em um ponto que importa para as legendas: se retornam ou não os tempos de cada palavra.

Quando usar

  • Transcrever uma entrevista ou um podcast para criar conteúdo escrito.
  • Criar legendas a partir do som de um vídeo, com Adicionar legendas (Add Captions).
  • Transformar notas de voz e gravações de reuniões em texto.
  • Tornar uma biblioteca de áudios pesquisável como texto.
  • Passar uma transcrição a um nó de texto para resumi-la ou analisá-la.
  • Dar ao Plano de edição (Edit Plan) a transcrição com tempos de que ele precisa para planejar uma edição.

Início rápido

Adicione o nó

Pressione Tab no canvas e escolha Áudio › Transcrição › Transcrever.

Conecte a gravação

Conecte um nó de áudio ou um nó de vídeo à entrada Áudio.

Escolha o mecanismo e o idioma

Abra o painel de configurações. Mantenha Provedor em ElevenLabs STT, a menos que você precise de outro mecanismo. Mantenha Idioma em Detecção automática ou escolha o idioma.

Execute

Clique em Executar no nó. A transcrição simples aparece na saída Texto, e a transcrição com tempos, na saída Transcrição.

áudiovídeotranscriçãopromptEnviar vídeoPessoa falandoTranscreverElevenLabs STTAdicionar legendasDestaque de palavrasPromptEscreva um resumo
Um vídeo é transcrito uma vez: a transcrição com tempos conduz legendas palavra por palavra, e o texto é resumido.

Entrada e saídas

EntradaAceitaO que faz
ÁudioNós de áudio e de vídeoA fala a transcrever. No caso de um vídeo, o nó usa a faixa de áudio dele.
SaídaO que traz
TextoA transcrição inteira como texto simples. Ela se conecta a qualquer nó que receba texto.
TranscriçãoA transcrição estruturada, com os tempos das palavras e dos segmentos em milissegundos. Ela alimenta o Adicionar legendas e os nós de edição.

Em um prompt, uma referência ao rótulo do nó, como {Transcribe}, fornece o texto simples.

Configurações

ConfiguraçãoO que faz
ProvedorO mecanismo: ElevenLabs STT (o padrão), Whisper — sem tempos por palavra ou Incredibly Fast Whisper.
IdiomaDetecção automática (o padrão) ou um de 20 idiomas, como inglês, espanhol, hebraico, japonês e árabe.
Identificação de falantesIdentifica quem disse o quê. Vem desativada por padrão. Só aparece quando o Provedor é ElevenLabs STT.
Marcar eventos sonorosMarca na transcrição os sons que não são fala, como [music] ou [laughter]. Vem desativada por padrão. Só aparece quando o Provedor é ElevenLabs STT.

Identificação de falantes e Marcar eventos sonoros são independentes: ative uma, as duas ou nenhuma.

O painel de configurações do Transcrever com o Provedor em ElevenLabs STT, o Idioma em Detecção automática e as caixas de seleção Identificação de falantes e Marcar eventos sonoros.O painel de configurações do Transcrever com o Provedor em ElevenLabs STT, o Idioma em Detecção automática e as caixas de seleção Identificação de falantes e Marcar eventos sonoros.

Modelos

ModeloDesenvolvedorModosCréditosDetalhes
ElevenLabs STTElevenLabsFala para texto25Fala para texto com marcações de tempo POR PALAVRA (sempre ativas), identificação de falantes e tags de eventos sonoros. É o mecanismo certo quando a transcrição alimenta legendas.
Incredibly Fast WhisperOpenAIFala para texto44Fala para texto rápido com o Whisper. Retorna marcações de tempo POR PALAVRA quando solicitado, então a transcrição pode alimentar legendas.
WhisperOpenAIFala para texto44Fala para texto com o Whisper — só segmentos POR FRASE, SEM marcações de tempo por palavra. Serve para uma transcrição ou uma legenda estática, mas não para legendas sincronizadas palavra por palavra (cinéticas).

Tempos de cada palavra: qual mecanismo os retorna

MecanismoTempos de cada palavraObservações
ElevenLabs STT (padrão)SempreProjetado para trabalhar palavra por palavra. O mecanismo para legendas, rótulos de falante e eventos sonoros.
Incredibly Fast WhisperQuando necessárioO nó pede os tempos de cada palavra automaticamente quando a saída Transcrição está conectada.
WhisperNuncaSó segmentos de frases. Serve para uma transcrição simples ou uma legenda estática.

Se o ElevenLabs STT ou o Incredibly Fast Whisper não retornar os tempos de cada palavra para um áudio que claramente tem fala, a execução falha e os créditos são reembolsados. Um áudio sem nenhuma fala ainda é concluído com sucesso, sem palavras, por exemplo um clipe cuja transcrição é [music].

A transcrição estruturada

A saída Transcrição tem esta forma:

{
  "version": 1,
  "language": "en",
  "words": [
    { "text": "Welcome", "startMs": 0, "endMs": 420 },
    { "text": "back", "startMs": 460, "endMs": 700 }
  ],
  "segments": [
    { "startMs": 0, "endMs": 700, "text": "Welcome back" }
  ]
}
  • Todos os tempos estão em milissegundos inteiros.
  • words traz cada palavra com o início e o fim dela. Ele é preenchido sempre que o mecanismo retorna os tempos de cada palavra.
  • segments traz as frases ou os trechos maiores, quando o mecanismo os fornece.
  • Em uma execução com Identificação de falantes, cada palavra e cada segmento também têm um speaker. Uma palavra também pode trazer um confidence.

Na saída Texto, a Identificação de falantes adiciona rótulos como Speaker 1: antes de cada segmento, e Marcar eventos sonoros adiciona tags como [music] e [laughter] no lugar em que os sons ocorrem.

Crie legendas a partir de uma transcrição

Conecte a saída Transcrição à entrada de transcrição do Adicionar legendas. O Adicionar legendas então desenha legendas sincronizadas com cada palavra. Para isso, use o ElevenLabs STT ou o Incredibly Fast Whisper.

Uma transcrição do Whisper não serve para legendas. Quando um nó Transcrever com o Whisper alimenta o Adicionar legendas, a execução é recusada antes que qualquer coisa seja executada ou cobrada, com esta mensagem:

Captions need word timings, but the "whisper" engine does not return word timings — pick incredibly-fast-whisper or elevenlabs-stt.
  • A verificação também cobre uma cadeia que passa pelo Aplicar EDL (Apply EDL) e cadeias dentro de um sub-workflow, em qualquer profundidade.
  • O painel de configurações mostra o mesmo aviso ao lado de Provedor assim que a conexão existe, para que você corrija antes de executar.
  • Executar o nó Transcrever sozinho nunca é bloqueado. Uma transcrição do Whisper que vai para qualquer outro lugar não tem problema.
  • Um caso não pode ser verificado com antecedência: uma cadeia em que o Transcrever e o Adicionar legendas ficam em lados diferentes do limite de um sub-workflow. Essa execução falha no Adicionar legendas, depois que a transcrição já foi executada e cobrada.

Créditos

O Transcrever custa um preço fixo por execução, qualquer que seja a duração do áudio:

MecanismoCréditos por execução
ElevenLabs STT25
Incredibly Fast Whisper44
Whisper44

Uma requisição recusada antes de começar, como uma transcrição do Whisper conectada ao Adicionar legendas, não é cobrada.

Em uma instalação self-hosted

Cada mecanismo usa a sua própria chave de provedor. Quando o mecanismo escolhido não tem chave e a instalação tem uma conexão com o Nodaro Cloud, a transcrição passa por essa conexão. Sem nenhuma das duas, o nó falha com uma mensagem que indica a chave a adicionar. Veja Chaves de provedor.

Dicas

  • Deixe o idioma em Detecção automática. Escolha um idioma só quando você souber qual é, por exemplo quando dois idiomas soam parecidos.
  • Identifique os falantes em conversas. Ative Identificação de falantes em entrevistas, reuniões e podcasts.
  • Marque os eventos quando eles importarem. Ative Marcar eventos sonoros quando os sons de fundo ajudarem a entender a gravação.
  • Limpe antes o áudio com ruído. Passe a gravação pelo Extrator de voz (Voice Extractor) antes do Transcrever.
  • Divida áudios muito longos. Segmentos mais curtos são transcritos com mais confiabilidade. O Dividir em partes (Split into Chunks) corta um arquivo longo em partes iguais.
  • Ou alinhe o seu próprio roteiro. Quando você já tem o roteiro exato, o Alinhamento forçado (Forced Alignment) marca no áudio o tempo de cada palavra dele.

Pela API

POST /v1/transcribe recebe audioUrl e, opcionalmente, provider (elevenlabs-stt, incredibly-fast-whisper ou whisper), language, diarize, tagAudioEvents e wordTimestamps.

  • Indique o mecanismo. Uma requisição sem provider executa o Whisper, para que as integrações existentes mantenham o mecanismo que já usavam. Defina provider sempre que precisar dos tempos de cada palavra, de diarize ou de tagAudioEvents.
  • Tempos de cada palavra. incredibly-fast-whisper só retorna as palavras com wordTimestamps: true. wordTimestamps: true com whisper é recusado com um 400 validation_error antes de o job ser criado, então nada é cobrado. O mecanismo nunca é trocado sem aviso.
  • Legendas. O output_data.words do job concluído já tem o formato das legendas (text, startMs, endMs). Passe-o para POST /v1/add-captions como captions, e o Adicionar legendas não transcreve de novo.
  • Preço. GET /v1/credits/model-cost?model=<engine> retorna o preço exato para a sua conta.

O método do SDK é client.audio.transcribe, e o comando da CLI é nodaro audio transcribe --provider <engine>. A ferramenta MCP transcribe sempre executa o ElevenLabs STT, então o resultado dela sempre tem os tempos de cada palavra. Veja Voz e mídia.

Perguntas frequentes

Última atualização

Nesta página