Adicionar legendas
Transcreva um vídeo e grave as legendas, simples ou em um de cinco estilos animados palavra por palavra, com fonte, contorno, posição e palavras por linha.
O nó Adicionar legendas (Add Captions) coloca legendas em um vídeo. Ele transcreve a fala do vídeo, ou usa uma transcrição que você conecta, e grava as palavras na imagem. Você pode mostrar uma legenda estática simples ou um de cinco estilos animados que acompanham a fala palavra por palavra. Você também controla a fonte, o contorno, a posição e o número de palavras em cada linha.
Quando usar
- Você quer legendas em um vídeo de uma pessoa falando para a câmera ou em um vídeo narrado.
- Você quer legendas animadas, palavra por palavra, para TikTok, Reels ou Shorts.
- Você quer legendas acessíveis em qualquer vídeo com fala.
- Você quer a letra no estilo karaokê sobre um videoclipe.
Início rápido
Adicionar o nó
Pressione Tab no canvas e escolha Vídeo › Títulos, gráficos e legendas › Adicionar legendas.
Conectar o vídeo
Conecte um vídeo com fala clara à entrada Vídeo. O nó transcreve a fala sozinho. Para usar uma transcrição que você já tem, conecte-a também à entrada Transcrição.
Escolher um estilo e um visual
Abra o painel de configurações e escolha um Estilo, como Palavras estilo TikTok (cinética), e depois um Visual. A prévia no painel mostra o resultado. Você também pode começar de uma predefinição de fábrica, como TikTok em negrito.
Executar
Clique em Executar. O vídeo legendado aparece no nó.
Entradas
| Entrada | Aceita | O que faz |
|---|---|---|
| Vídeo | Nós de vídeo | O vídeo a legendar. Entrada obrigatória. |
| Transcrição | A saída de transcrição do Transcrever (Transcribe) ou do Aplicar EDL (Apply EDL) | Opcional. As palavras e os tempos delas. Sem ela, o nó transcreve a fala do vídeo. |
A saída, Vídeo, é o vídeo com as legendas gravadas na imagem.
Configurações
| Configuração | O que faz |
|---|---|
| Estilo | Como as legendas aparecem. Legenda (estática) é o padrão. Os outros cinco estilos são animados. Veja Estilos de legenda. |
| Visual | Uma predefinição de fonte, contorno, uso de maiúsculas e cor da palavra falada: Contorno (TikTok) ou Limpo. Legenda também oferece Nenhum (simples), o padrão dela. Os controles abaixo substituem partes isoladas do visual. Veja Visuais. |
| Posição | Inferior (o padrão), Superior ou Centro. Veja Posição. |
| Posição vertical | Um controle deslizante de 0 a 100%: a altura do centro do bloco de legenda. Depois de definida, ela substitui a Posição. Automático devolve o posicionamento à Posição. |
| Tamanho da fonte | De 12 a 200 pixels. O padrão é 32. Quando você muda para um estilo animado, um tamanho deixado em 32 passa para 64, e o inverso acontece quando você volta. |
| Cor | A cor do texto. O padrão é branco (#FFFFFF). |
| Fonte | Automático (do visual) ou uma de 24 fontes, como Montserrat, Inter, Anton, Bebas Neue, Oswald e Poppins. |
| Peso da fonte | Automático (padrão do visual) ou um peso de 100 Fino a 900 Ultranegrito. Se a fonte não tiver esse peso, o mais próximo é usado. |
| Máx. de palavras por linha | De 1 a 20. Vazio, a linha recebe tantas palavras quanto a largura do quadro permitir. Fica oculto em Pop de palavras, que sempre mostra uma palavra. Veja Máx. de palavras por linha. |
| Maiúsculas | Mostra as legendas em letras maiúsculas. |
| Cor do contorno | A cor do contorno em volta do texto. Um botão Automático devolve a cor ao visual. |
| Espessura do contorno | De 0 a 40 pixels. Vazio segue o visual, e 0 significa sem contorno. |
| Cor da palavra falada | Só nos estilos animados. A cor da palavra que está sendo falada. Automático segue o visual. |
| Animar | Só nos estilos animados. Ativado por padrão. Desative para congelar o movimento de cada palavra. Veja Animar. |
| Legendas por palavra | Só nos estilos animados. Ativado por padrão: uma legenda por palavra. Desative para agrupar em linhas as palavras de uma transcrição conectada. |


Fontes
A lista Fonte tem 24 fontes:
| Tipo | Fontes |
|---|---|
| Sem serifa | Inter, Roboto, Open Sans, Montserrat, Poppins, Raleway, Nunito, Lato, Rubik, Heebo, Cairo, Tajawal |
| Com serifa | Playfair Display, Merriweather, Lora, EB Garamond |
| Display condensada | Bebas Neue, Oswald, Anton |
| Manuscrita | Dancing Script, Pacifico, Caveat |
| Monoespaçada | Roboto Mono, Fira Code |
Rubik, Heebo, Cairo e Tajawal cobrem hebraico e árabe. As legendas em hebraico e em árabe vão da direita para a esquerda. A direção segue o idioma da maior parte das legendas, então um nome de marca em alfabeto latino no início de um clipe em hebraico não inverte as linhas dele.
Estilos de legenda
| Estilo | O que você vê |
|---|---|
| Legenda (estática) | Uma legenda padrão. A fala transcrita aparece uma linha de frase por vez, mantida na tela. |
| Destaque de palavra (cinética) | Uma linha por vez, com a palavra falada em destaque. |
| Karaokê (cinética) | Uma linha por vez, preenchida palavra por palavra à medida que é falada. |
| Palavras estilo TikTok (cinética) | Páginas de 1 a 4 palavras que surgem com um pop. Uma página nunca atravessa o fim de uma frase ou uma pausa. |
| Pop de palavras (cinética) | Uma palavra por vez, que entra com efeito de mola. Cada palavra fica até a próxima começar. |
| Saltitante (cinética) | Uma linha por vez, e cada palavra salta quando é falada. |
No app, os cinco estilos animados se chamam estilos cinéticos.
Visuais
Um visual reúne várias escolhas de aparência, para que a legenda fique legível com uma única configuração.
| Visual | O que renderiza |
|---|---|
| Contorno (TikTok) | Montserrat Black (peso 900) em maiúsculas, texto branco com um contorno preto grosso e a palavra falada em amarelo. É o padrão dos estilos animados. |
| Limpo | Inter, sem contorno e sem maiúsculas. |
| Nenhum (simples) | Só em Legenda, e é o padrão dela: uma legenda neutra em Inter, sem contorno e sem maiúsculas. |
- Os controles substituem partes isoladas de um visual. Com Contorno (TikTok), mudar só a Cor da palavra falada mantém a fonte, as maiúsculas e o contorno.
- A cor da palavra falada aparece em três estilos. Só Palavras estilo TikTok, Karaokê e Destaque de palavra marcam uma palavra por vez. Legenda e Pop de palavras usam a fonte, o contorno e o uso de maiúsculas do visual em uma única cor.
- O tamanho da fonte depende da fonte do visual. A Montserrat Black em maiúsculas é cerca de 30% mais larga por caractere que a Inter em maiúsculas e minúsculas. Por isso, com o mesmo Tamanho da fonte, cabem menos palavras por linha em Contorno (TikTok). Escolha Limpo, uma fonte estreita como Bebas Neue, Anton ou Oswald, ou um tamanho menor.
- O contorno cresce com o texto. Quando o visual desenha o contorno, a espessura dele é 10% do tamanho da fonte, arredondada, e de no mínimo 2 pixels. Metade dele fica fora das letras, então a borda visível tem cerca de 5% do tamanho da fonte: um contorno de 6 pixels no tamanho 64 e um contorno de 3 pixels no tamanho 32. Defina a Espessura do contorno para escolher a sua, ou
0para nenhum contorno.
Como as legendas são agrupadas em linhas
Destaque de palavra, Karaokê, Saltitante e uma Legenda transcrita mostram uma linha por vez: nem uma palavra por vez, nem a transcrição inteira em um único bloco.
- Uma linha recebe tantas palavras quanto couberem em cerca de 85% da largura do quadro, no tamanho de fonte e na fonte escolhidos.
- Uma linha termina antes no fim de uma frase, marcado por
.,!,?ou…, ou em uma pausa de 0,5 segundo ou mais entre duas palavras. - Uma frase longa demais para uma linha é dividida em linhas equilibradas, para que a última palavra dela nunca fique sozinha. Por exemplo,
OK SO I BUILT/A WORLD IN/NODARO STUDIO., em vez de terminar com umSTUDIO.sozinho. - Uma linha fica na tela por até 1,5 segundo depois da última palavra dela, e a linha seguinte a substitui no momento em que começa. Pausas dentro de uma linha e pausas curtas entre linhas nunca deixam um quadro vazio. Um silêncio de mais de 1,5 segundo apaga a legenda.
- Dentro da linha, o efeito passa de palavra em palavra: o destaque, o preenchimento ou o salto. Durante uma pausa, a última palavra falada continua ativa. Uma linha do estilo Legenda não tem efeito por palavra.
Os dois estilos que não mostram linhas seguem as mesmas regras:
- Pop de palavras mantém cada palavra na tela até a próxima começar, por no máximo 1,5 segundo depois que a palavra termina.
- Palavras estilo TikTok nunca estende uma página além do fim de uma frase ou de uma pausa de 0,5 segundo ou mais. Cada página fica até a próxima começar, por no máximo 1,5 segundo depois da última palavra dela.
Máx. de palavras por linha
Máx. de palavras por linha limita o número de palavras em uma linha, ou em uma página de Palavras estilo TikTok. Ele funciona por cima das regras acima: uma linha continua terminando em 85% da largura do quadro, no fim de uma frase e em uma pausa. O limite só pode deixar as linhas mais curtas. Use 1 ou 2 para legendas curtas e impactantes, ou deixe vazio para preencher a largura.
| Estilo | Efeito |
|---|---|
| Destaque de palavra, Karaokê, Saltitante | Nenhuma linha tem mais palavras que o número definido. |
| Palavras estilo TikTok | Nenhuma página tem mais palavras que o número definido. |
| Legenda | Nenhuma linha de frase tem mais palavras que o número definido. |
| Pop de palavras | Nenhum. O estilo sempre mostra uma palavra. |
Por exemplo, sem limite, Destaque de palavra mostra as linhas OK SO I BUILT, A WORLD IN e NODARO STUDIO. Com Máx. de palavras por linha definido como 2, ele mostra OK SO, I BUILT, A WORLD e assim por diante, cada uma mantida até a próxima começar. Uma frase com um número ímpar de palavras termina com uma linha de uma palavra só.
O limite conta palavras, não entradas de legenda. Uma legenda de uma frase inteira com mais palavras que o limite é dividida em partes menores, e o tempo dela é repartido entre essas partes conforme o tamanho do texto de cada uma.
Animar
Animar liga e desliga o movimento por palavra dos estilos animados. Desativá-lo congela o movimento, mas mantém o agrupamento das linhas, o tempo que cada linha fica na tela e a cor da palavra falada.
| Estilo | O que para de se mover |
|---|---|
| Destaque de palavra | A mudança de tamanho da palavra ativa |
| Karaokê | A varredura progressiva |
| Palavras estilo TikTok | A entrada com efeito de mola da página |
| Pop de palavras | A entrada com efeito de mola da palavra. A palavra aparece de uma vez e continua na tela até a próxima. |
| Saltitante | O salto de cada palavra |
Para uma legenda totalmente estática, também sem mudança de cor, defina ainda a Cor da palavra falada com o mesmo valor da Cor.
Posição
Toda posição ancora o bloco de legenda pela borda mais próxima da borda do quadro, então uma legenda que quebra em mais linhas cresce para dentro e nunca é cortada. O posicionamento é o mesmo em todos os estilos.
| Configuração | Onde o bloco fica |
|---|---|
| Superior | A borda superior do bloco a 12% da altura do quadro. As linhas extras crescem para baixo. |
| Inferior (o padrão) | A borda inferior do bloco 18% acima da parte de baixo do quadro, longe dos botões do TikTok e do Reels. As linhas extras crescem para cima. |
| Centro | O centro do bloco a 50% da altura do quadro. |
| Posição vertical | O centro do bloco na porcentagem que você definir, medida a partir do topo. Ela substitui a Posição. |
A Posição vertical define o centro, não uma borda. Em 85%, o centro do bloco fica a 85% da altura, e a parte de baixo dele desce mais. Em um quadro de 1920 pixels de altura, 83,5% coloca o centro em cerca de 1603 pixels. Um valor por volta de 65% fica abaixo de um rosto e acima dos botões da parte de baixo de um app.
De onde vêm as palavras
No editor, o Adicionar legendas obtém as palavras de uma de duas formas:
- Ele transcreve o vídeo. Sem nada conectado à Transcrição, o nó transcreve a fala do vídeo com o Incredibly Fast Whisper. Verifique se a fala está clara.
- Ele lê uma transcrição conectada. Conecte a saída de transcrição do Transcrever ou do Aplicar EDL à entrada Transcrição. O Aplicar EDL remapeia cada palavra de acordo com os cortes, então as legendas continuam alinhadas ao vídeo reeditado, com precisão de cerca de 80 milissegundos em um fade cruzado.
A transcrição precisa dos tempos das palavras
Uma transcrição conectada precisa trazer o tempo de cada palavra. Uma transcrição sem palavras é recusada antes que qualquer crédito seja reservado.
O mecanismo Whisper do Transcrever retorna frases, e não os tempos das palavras. Se um nó Transcrever com o Whisper alimentar este nó, diretamente ou pelo Aplicar EDL, o workflow para antes que qualquer coisa seja executada ou cobrada. A mensagem cita o nó Transcrever. Mude esse nó Transcrever para um mecanismo com tempos das palavras, como o Incredibly Fast Whisper ou o ElevenLabs STT. A mesma verificação vale para cadeias dentro de um sub-workflow. Só uma cadeia que atravessa o limite de um sub-workflow é recusada neste nó, depois que a transcrição já foi executada.
Legendas por palavra
Com uma transcrição conectada e um estilo animado escolhido, Legendas por palavra decide como as palavras da transcrição viram legendas:
- Ativado (o padrão) cria uma legenda por palavra, que é o que os estilos por palavra precisam.
- Desativado agrupa primeiro as palavras em linhas. Uma linha termina numa troca de falante, no fim de uma frase, num silêncio ou num número máximo de palavras. Use-o para legendas mais calmas, uma linha por vez.
Máx. de palavras por linha vale nos dois casos.
Mecanismos de transcrição
| Mecanismo | Tempos das palavras | Onde você pode escolher |
|---|---|---|
| Incredibly Fast Whisper | Sim | É o padrão em todos os lugares |
| ElevenLabs STT | Sim | API, MCP, SDK e CLI |
| Whisper | Não, só frases | API, MCP, SDK e CLI |
O mecanismo não muda o preço do Adicionar legendas. Os estilos animados precisam dos tempos das palavras, então precisam do Incredibly Fast Whisper ou do ElevenLabs STT. Legenda precisa só dos tempos das frases, então funciona com todos os mecanismos.
Taxa de quadros do resultado
Uma renderização de legendas animadas mantém a taxa de quadros do vídeo de origem. A taxa é arredondada para um número inteiro, como 24 para 23,976 ou 30 para 29,97, e mantida entre 15 e 60 fps. Três casos são renderizados a 30 fps:
- A taxa de quadros da origem não pode ser lida.
- A origem tem taxa de quadros variável.
- O clipe passa do limite de 108.000 quadros da renderização. A 60 fps, isso é um clipe de mais de 30 minutos.
Uma legenda estática simples sempre mantém a taxa de quadros da origem.
Predefinições de fábrica
O Adicionar legendas vem com sete predefinições na pasta Estilos de legenda. Cada uma define o estilo, a posição, o tamanho da fonte e a cor, e transcreve o vídeo.
| Predefinição | Estilo | Posição | Tamanho da fonte | Cor |
|---|---|---|---|---|
| Legendas limpas | Legenda | Inferior | 32 | Branco |
| TikTok em negrito | Palavras estilo TikTok | Centro | 72 | Branco |
| Destaque karaokê | Karaokê | Inferior | 56 | Branco |
| Pop de palavras | Pop de palavras | Centro | 64 | Amarelo (#FFE600) |
| Legendas saltitantes | Saltitante | Inferior | 64 | Branco |
| Destaque de palavra | Destaque de palavra | Inferior | 48 | Ciano (#00E5FF) |
| Faixa superior | Legenda | Superior | 36 | Branco |
Veja em Predefinições como aplicar, salvar e compartilhar predefinições.
Créditos
O Adicionar legendas tem dois preços:
| Renderização | Créditos |
|---|---|
| Uma legenda estática simples, com o seu próprio texto fixo e sem nenhum controle de estilo definido | 33 |
| Todo o resto: todos os estilos animados, uma legenda transcrita ou alimentada por uma transcrição, uma legenda com qualquer controle de estilo e legendas por segmento | 55 |
O painel de configurações não tem um campo de texto, então um nó configurado no editor sempre legenda a fala ou uma transcrição, e cada execução custa 55 créditos. A legenda de 33 créditos é um texto fixo enviado pela API, pelo MCP, pelo SDK ou pela CLI. O mecanismo de transcrição e os controles de estilo não mudam o preço de um estilo animado.
Dicas
- Combine o estilo com o conteúdo. Use Legenda para conteúdo profissional e Destaque de palavra ou Palavras estilo TikTok para redes sociais.
- Cuidado com os botões da plataforma. A posição padrão, Inferior, já fica longe dos botões do TikTok e do Reels. Para vídeos verticais de redes sociais, Centro também funciona bem.
- Mantenha o texto legível. Texto branco sobre uma imagem escura é o mais fácil de ler. Use texto colorido sobre uma imagem clara.
- Corrija as palavras primeiro. Para as legendas mais precisas, transcreva com o Transcrever, corrija o texto e depois marque o tempo com o Alinhamento forçado (Forced Alignment).
- Legende por último. Coloque o Adicionar legendas depois da Sobreposição em vídeo (Video Overlay), para que logos e cartões fiquem por baixo das legendas.
Solução de problemas
O workflow para antes de ser executado e cita um nó Transcrever. Esse nó Transcrever usa o mecanismo Whisper, que não retorna os tempos das palavras. Mude-o para o Incredibly Fast Whisper ou o ElevenLabs STT.
As linhas têm menos palavras que o esperado. O visual Contorno (TikTok) usa uma fonte larga. Escolha Limpo, uma fonte estreita como a Bebas Neue, ou um Tamanho da fonte menor.
Uma legenda é cortada na borda do quadro. Use uma das opções de Posição em vez de uma Posição vertical perto da borda. Essas opções ancoram a borda do bloco, então as linhas extras crescem para dentro.
Pela API e pelo MCP
Código e assistentes de IA podem fazer mais do que o editor. POST /v1/add-captions, a ferramenta MCP add_captions, o client.media.addCaptions(...) do SDK e a CLI aceitam os mesmos controles do painel de configurações, e mais os seguintes:
- O seu próprio texto. Em Legenda,
texté gravado como um bloco fixo durante o vídeo inteiro e nunca é substituído por uma transcrição. Uma quebra de linha no texto força uma nova linha. Em um estilo animado,texté só um texto de reserva: ele é usado quando a transcrição não encontra palavras, e é distribuído igualmente ao longo do vídeo. - Os seus próprios tempos das palavras.
captionsé uma lista de entradas de legenda, cada uma comtext,startMseendMs. Para os estilos animados, envie uma entrada por palavra. - O mecanismo de transcrição.
transcribe_providerescolheincredibly-fast-whisper(o padrão),elevenlabs-sttouwhisper. Um estilo animado com o Whisper e sem outra fonte de palavras é recusado antes que qualquer crédito seja reservado. Definaauto_transcribecomofalsepara desativar a transcrição; uma requisição sem nenhuma fonte de palavras é recusada. - Tratamentos diferentes por intervalo de tempo.
segmentsaplica um estilo e um visual diferentes a cada intervalo de tempo do mesmo vídeo, em uma única chamada. Veja Legendas por segmento.
Quando uma requisição traz várias fontes de palavras, o nó usa a primeira desta ordem: captions, uma transcrição, text em Legenda e, por último, a transcrição do vídeo.
Os nomes dos campos mudam conforme a interface. O corpo REST e o SDK usam maxWordsPerLine, a ferramenta MCP usa max_words_per_line, e a CLI usa --max-words-per-line.
Legendas por segmento
Cada segmento tem um início e um fim em milissegundos, não pode se sobrepor a outro segmento e pode definir os próprios controles de estilo e de visual. Um segmento sem palavras próprias usa as legendas compartilhadas ou a transcrição, limitadas ao intervalo de tempo dele. Os tempos das legendas são sempre medidos a partir do início do vídeo, e não do início do segmento. As legendas por segmento sempre usam a renderização animada, então custam 55 créditos.
Por exemplo, estes argumentos da ferramenta MCP add_captions mostram uma frase grande com contorno no topo por 3 segundos e, depois, uma palavra por vez na parte de baixo:
{
"video_url": "https://example.com/clip.mp4",
"look": "outline",
"segments": [
{ "start_ms": 0, "end_ms": 3000, "style": "subtitle", "position": "top", "font_size": 96, "text": "Same face, every shot. No re-prompting." },
{ "start_ms": 3000, "end_ms": 20000, "style": "word-pop", "position": "bottom", "font_size": 48 }
]
}- Palavras em um limite. Uma palavra pertence ao segmento que contém o início dela, então ela nunca aparece duas vezes. Uma frase que atravessa um limite é dividida ali, e cada parte aparece no estilo do próprio segmento. Uma parte com menos de 250 milissegundos é descartada, a menos que isso faça a frase inteira se perder.
- O que um segmento herda. Cor, cor de fundo, posição, posição vertical, Animar e Máx. de palavras por linha vêm do nível superior quando o segmento não os define. Um segmento que define a própria posição não herda a posição vertical do nível superior. Os controles do visual, como fonte, peso, contorno, cor da palavra falada e maiúsculas, só são herdados por um segmento sem
lookpróprio. Um segmento que indica um visual começa do zero a partir dessa predefinição.
Perguntas frequentes
Páginas relacionadas
Transcrever
Aplicar EDL
Alinhamento forçado
Sobreposição em vídeo
Formato para redes
Última atualização
Sobreposição Lottie
Descreva as sobreposições, e a IA posiciona e temporiza animações Lottie, como confete, corações ou setas, ou seus Gráficos animados, sobre um vídeo.
Renderizar vídeo
Renderize em MP4 planos de Gráficos animados, Título 3D, Efeitos de vídeo, Sobreposição Lottie, Compor vídeo ou cenas 3D, ou organize mídias sem plano.