Análise de vídeo
Divida um vídeo, ou o link de um post do YouTube, TikTok, Instagram, X ou Facebook, de até 10 minutos em cenas de até 8 s, com imagem pronta para prompt.
Disponível em Nodaro Cloud
O nó Análise de vídeo (Video Analysis) divide um vídeo em uma descrição cena a cena que um modelo de IA consegue recriar. Ele corta o vídeo em cenas de até 8 segundos, uma geração cada, e descreve a imagem, o enquadramento, a câmera e o som de cada cena. Pessoas, objetos e lugares recorrentes viram slots de entidade reutilizáveis, para que você possa escalar de novo o vídeo com os seus próprios personagens, objetos e locais.
Em uma instalação self-hosted, o nó mostra uma marca NODARO e é executado pela sua conexão com o Nodaro Cloud, com cobrança na conta conectada. Sem uma conexão, o nó mostra um botão CONECTAR NODARO e não é executado.
Quando usar
- Você quer transformar um vídeo de referência em um plano tomada a tomada para recriá-lo com IA.
- Você quer extrair o elenco de um vídeo para filmá-lo de novo com os seus próprios personagens, objetos e locais.
- Você quer uma descrição de cada cena, pronta para prompt, para alimentar nós de imagem e de vídeo.
- Você quer as camadas de som de cada cena, o diálogo mais descrições da música e dos efeitos sonoros, para uma trilha sonora equivalente.
Início rápido
Adicionar o nó
Pressione Tab no canvas e escolha Vídeo › Análise › Análise de vídeo.
Fornecer um vídeo
Conecte um nó de vídeo, como o Enviar vídeo (Upload Video), à entrada Vídeo, ou cole um link em URL do YouTube no painel de configurações. Para um link, o painel mostra a duração do vídeo, que define o preço.
Escolher a qualidade
Escolha uma Qualidade da análise. Pro é o padrão. Se quiser, escreva em Foco da análise (opcional) o que mais importa.
Executar e usar o resultado
Clique em Executar. Conecte a saída Texto a um prompt, por exemplo do Gerar vídeo Pro (Generate Video Pro), ou a saída JSON das cenas a um nó que leia dados estruturados.
Entradas
| Entrada | Aceita | O que faz |
|---|---|---|
| Vídeo | Nós de vídeo, como Enviar vídeo, URL de vídeo (Video URL) e Gerar vídeo (Generate Video), e nós de texto, como Texto (Text) e Prompt | O vídeo a analisar, ou um link para ele. Opcional quando URL do YouTube está definida. Um vídeo conectado sempre tem prioridade sobre um link conectado, e um link conectado tem prioridade sobre URL do YouTube. |
Um link vindo de um nó de texto. O texto inteiro precisa ser um único link, e nada mais: um link youtube.com ou youtu.be, ou o link de um único post do TikTok, Instagram, X ou Facebook. Um texto com outras palavras em volta do link é ignorado. Se o nó então não tiver nenhum outro vídeo ou link, ele se recusa a executar. O nó não consegue ler a duração de um link vindo de um nó de texto antes de a execução começar, então o botão Executar dele mostra o preço da faixa de 600 segundos. O preço da execução em si é definido pela duração que ela lê quando começa (veja Créditos). Para ter o preço exato antes da execução, use um nó URL de vídeo.
Saídas
| Saída | O que leva |
|---|---|
| JSON das cenas | A análise completa como dados estruturados: meta, look, slots e scenes. Veja O que a análise contém. |
| Texto | A mesma análise em texto simples. Conecte-a a qualquer prompt ou entrada de texto, sem copiar e colar. |
Configurações
| Configuração | O que faz |
|---|---|
| Qualidade da análise | Inteligente, Pro (o padrão), Rápido, Misto ou Misto (consistente). Veja Qual qualidade escolher. |
| Seleção do resultado | Escolher (o padrão) ou Combinar. O vídeo é analisado várias vezes. Escolher mantém a passagem mais forte como está. Combinar também adiciona detalhes das outras passagens depois de conferi-los com a filmagem. É um pouco mais lento e o mais completo. Inteligente ignora esta configuração. |
| Variações do elenco — detecta visuais alternativos de cada entidade | Desativado por padrão. Também detecta os diferentes visuais de cada pessoa ou coisa e as cenas em que cada visual aparece. Veja Visuais alternativos. |
| Traduzir para o inglês | Duas caixas de seleção, ambas desmarcadas por padrão: Fala — o que é dito ou cantado e Texto na tela — placas, legendas, títulos. Veja Idioma da saída. |
| URL do YouTube | Um link youtube.com ou youtu.be a analisar quando nem um vídeo nem um link estão conectados à entrada Vídeo. |
| Foco da análise (opcional) | Até 2.000 caracteres sobre aquilo em que a análise deve prestar atenção, por exemplo “fotos de produtos e texto na tela”. |
| Texto antes e depois | Texto adicionado antes e depois do foco da análise no momento da execução. Veja Texto antes e depois do prompt. |
O Foco da análise direciona a atenção, nunca o formato. Ele não muda a estrutura do resultado, a duração das cenas nem a lista de campos. Deixe-o vazio para uma análise geral.


Qual qualidade escolher
Você escolhe um nível de qualidade, não um modelo. O Nodaro escolhe o modelo de análise por trás de cada nível, então um nível pode melhorar com o tempo sem nenhuma mudança no seu workflow.
| Qualidade da análise | O que faz | Use quando |
|---|---|---|
| Rápido | Uma análise econômica | Você pode trocar um pouco de detalhe por preço e velocidade. |
| Pro (o padrão) | Uma análise mais fiel das cenas e das entidades | Na maioria das análises. |
| Misto | Várias passagens de análise combinadas para a máxima completude | A completude é o mais importante. |
| Misto (consistente) | O mesmo plano, ajustado para o resultado mais consistente de uma execução para outra | Você analisa o mesmo tipo de vídeo com frequência e quer uma saída estável. |
| Inteligente | A maior precisão: uma passagem principal detalhada combinada com várias passagens econômicas, e sempre refinada | A lista de tomadas vai guiar uma nova geração. |
Todo nível analisa cada parte do vídeo várias vezes e mantém ou mescla o melhor resultado: três passagens no Rápido e no Pro, e seis nos dois níveis Misto. O Inteligente e os dois níveis Misto também terminam com uma revisão de continuidade. Ela corrige afirmações que se contradizem entre as cenas. Ela também emite um aviso de atenção à continuidade quando um estado duradouro parece ser abandonado, por exemplo um objeto algemado a um personagem que desaparece das cenas seguintes. Cada correção e cada ponto de atenção aparecem nos avisos do resultado.
O que a análise contém
O resultado tem quatro partes. Os nós seguintes e o seu próprio código leem a mesma estrutura.
meta — dados sobre o arquivo
| Campo | O que contém |
|---|---|
durationSec | A duração medida, em segundos |
width, height | O tamanho do quadro, em pixels |
aspectRatio | A proporção, ajustada para 16:9, 9:16, 1:1, 4:3, 3:4 ou 21:9 quando a diferença é de até 3%; caso contrário, a razão simplificada entre largura e altura |
title | O título da origem, quando conhecido, como o título do YouTube |
language | O principal idioma falado. Ele sempre descreve a filmagem, sejam quais forem as configurações de tradução. |
look — a fotografia do clipe inteiro
Propriedades que pertencem à peça inteira, e não a uma tomada, informadas uma só vez para que todas as tomadas geradas de novo as compartilhem. Todos os campos são opcionais, e a parte inteira é omitida quando a análise não consegue lê-la.
| Campo | O que contém |
|---|---|
style | O meio, como “live-action photoreal”, “2D anime”, “stop-motion claymation” ou “3D render” |
styleId | A entrada correspondente do seletor Estilo (Style), quando o meio se encaixa em uma |
grade | A correção de cor e a paleta |
format | O formato da câmera ou do filme e a película, como “16mm film grain” |
lens | O caráter da lente, como “wide-angle, shallow depth of field throughout” |
lighting | O estilo geral de iluminação. Uma cena diferente descreve a própria iluminação. |
genre | O tipo de peça, como “cinematic trailer” ou “talking-head vlog” |
influence | A influência visual que a peça evoca claramente, como o seletor Estilo de fotógrafo / artista (Photographer / Artist Style). É omitida, a menos que o estilo seja claramente reconhecível. |
slots — as pessoas, os objetos e os lugares que você pode escalar
Cada entidade recorrente é extraída uma vez, para que você possa substituí-la pela sua.
| Campo | O que contém |
|---|---|
slotId | Um id estável, usado no texto visual de uma cena como token de slot, por exemplo {slot:hero} |
label | Um nome legível |
source | O tipo de entidade usada para escalá-lo: um personagem, um objeto, um local ou uma criatura |
role | O papel dele no vídeo, como “narrator” ou “hero product” |
description | Uma descrição visual completa, usada quando nenhuma entidade é escalada |
refImageUrl | Um quadro do vídeo em que a entidade aparece claramente, escolhido automaticamente |
variations | Os outros visuais da entidade, quando Variações do elenco está ativado |
scenes — uma entrada por tomada
| Campo | O que contém |
|---|---|
sceneNumber | O número da cena, a partir de 1, ao longo do vídeo inteiro |
startSec, endSec | Onde a cena começa e termina, em segundos |
label | Um rótulo curto da cena |
shotType | O tamanho do enquadramento: Wide, Medium, Medium Close-Up, Close-Up, Extreme Close-Up, ou Two-Shot, Insert ou Aerial |
angle | Onde a câmera fica. Sem o campo, a câmera fica na altura dos olhos. Veja os valores abaixo. |
camera | O movimento de câmera em texto livre, como “slow push-in”. Vazio para uma tomada com a câmera fixa. |
speed | slow-motion, ramp-in, ramp-out, timelapse, freeze ou reverse. Sem o campo, a velocidade é normal. |
effects | Efeitos na imagem: blur, pixelate, glitch, grain, vignette, flash, distortion ou double-exposure. Sem o campo, a imagem é limpa. |
onScreenText | Texto gravado na imagem, como títulos e legendas, palavra por palavra, na escrita original |
visual | A descrição visual com tokens de slot, para escalar de novo |
visualResolved | A mesma descrição com todos os slots escritos por extenso. Renderize a partir deste campo. |
audio | As camadas de som da cena. Veja abaixo. |
slotRefs | Os slots que aparecem na cena |
slotVariations | Qual visual cada slot usa nesta cena, quando Variações do elenco está ativado |
oversized | Presente quando a cena tem mais de 8 segundos porque não pôde ser cortada mais curta. Continua sendo uma geração. |
Cada cena também registra uma transição visível para a tomada seguinte, quando há uma.
Ângulos de câmera. angle é um destes valores: eye-level, low, high, overhead, worms-eye, dutch, over-the-shoulder, pov, profile ou from-behind. Os três campos de câmera são independentes: shotType diz quanto do sujeito está no quadro, angle diz onde a câmera fica, e camera diz o que a câmera faz. Uma tomada média por cima do ombro é shotType Medium com angle over-the-shoulder.
Leia visualResolved, não visual. visual mantém os tokens de slot para que você possa escalar a cena de novo depois. visualResolved é o texto completo, pronto para prompt, que todo nó seguinte deve usar.
Camadas de áudio
O audio de uma cena é uma lista dos sons que tocam ao mesmo tempo. Uma música de fundo sob uma fala, sobre um respingo de água, são três camadas. Uma lista vazia significa silêncio de verdade.
| Campo | O que contém |
|---|---|
mode | speech, music ou sfx |
content | Na fala, as palavras exatas. Na música e nos efeitos sonoros, uma descrição pronta para a geração. |
voice | Na fala, como a voz soa, como “male, warm, conversational” |
speakerSlot | Na fala, o slot de quem fala na tela, quando a análise consegue identificar |
- Cada fala aparece uma vez. Ler as camadas de fala na ordem das cenas dá a trilha sonora sem nada dito duas vezes. Uma fala que atravessa um corte é dividida no corte, e uma fala sobre uma montagem pertence à tomada em que começa.
- Músicas da trilha sonora são música. Uma canção que ninguém canta na tela faz parte da camada de música, com os vocais descritos ali. Só as palavras faladas ou cantadas dentro da história são fala.
- Quem fala é opcional.
speakerSloté omitido quando a análise não tem certeza, quando quem fala é um narrador que não aparece e quando quem fala é uma pessoa que aparece só uma vez, sem slot.
Visuais alternativos
Com Variações do elenco — detecta visuais alternativos de cada entidade ativado, a análise separa os diferentes visuais do mesmo sujeito em vez de fazer uma média deles em uma única descrição. Uma simples troca de roupa entre as cenas conta tanto quanto um sonho, um flashback, um disfarce, uma transformação ou uma época.
- Até 4 visuais por slot. Cada visual tem um id, como
dream,flashback,disguise,costume,transformation,eraoualt-1. Ele também tem um rótulo curto, uma descrição completa do sujeito nesse visual e um quadro que o mostra. - As cenas dizem qual visual está ativo. Uma cena sem visual para um slot usa o visual padrão do slot.
- Duas formas de encontrar visuais. Uma passagem observa a filmagem em busca de trocas de roupa, cabelo e maquiagem. Uma segunda passagem lê a análise pronta em busca de visuais que a filmagem não mostra, como “vinte anos depois”. Nenhuma das passagens renomeia um slot ou muda o texto de uma cena.
- Nada desaparece sem aviso. Quando um sujeito tem mais visuais do que o limite, os visuais extras são incorporados ao visual padrão, e o resultado registra essa incorporação.
O Gerar vídeo Pro mantém cada visual consistente dentro das próprias cenas.
Idioma da saída
Com as duas caixas de Traduzir para o inglês desmarcadas, a análise mantém o idioma original do vídeo. A fala é citada palavra por palavra, e o texto na tela continua na escrita original. É isso que você quer para recriar um vídeo como ele é.
As duas caixas mudam coisas diferentes, então você pode marcá-las de forma independente:
| Caixa de seleção | O que ela traduz |
|---|---|
| Fala — o que é dito ou cantado | As palavras faladas e cantadas |
| Texto na tela — placas, legendas, títulos | O texto visível na imagem |
Por exemplo, você pode ter uma narração em inglês sobre uma rua cujas placas continuam em chinês. Com qualquer uma das caixas marcada, as descrições das cenas, as notas de câmera, as descrições dos slots e as notas de voz também são escritas em inglês.
- Os nomes ficam como estão. Nomes de marcas, produtos, pessoas e lugares nunca são traduzidos.
- O campo de idioma não muda.
languagesempre indica o idioma falado na filmagem. - Isso muda a recriação. As descrições das cenas são os prompts da nova geração, então uma placa traduzida é renderizada em inglês na nova tomada.
- As palavras originais não são mantidas. A tradução as substitui. Execute de novo com as caixas desmarcadas se precisar do original.
Videoclipes. Por padrão, a letra das músicas que ninguém canta na tela fica dentro da camada de música. Para um videoclipe, em que a música é a peça, defina musicVideo: true na requisição da API, ou music_video na ferramenta MCP. Cada verso cantado volta então palavra por palavra como fala, cena por cena. Essa opção só está disponível pela API e pelo MCP.
Vídeos longos e limites
- Duração máxima: 10 minutos (600 segundos) para qualquer origem. O limite é conferido quando você executa o nó e de novo depois que o vídeo é baixado.
- Janelas: um vídeo de até 180 segundos é analisado em uma passagem. Um vídeo mais longo é analisado em janelas sobrepostas de cerca de 150 segundos, com 5 segundos de sobreposição, e depois mesclado em um único resultado contínuo e renumerado.
- Links: URL do YouTube aceita um link
youtube.comouyoutu.be. A entrada Vídeo também aceita o link de um único post do TikTok, Instagram, X ou Facebook, vindo de um nó de texto ou de um nó URL de vídeo. Transmissões ao vivo são recusadas; analise a gravação depois que a transmissão terminar.
Créditos
O preço depende da Qualidade da análise e da duração do vídeo. A duração cai na menor faixa em que cabe: até 60, 180, 360 ou 600 segundos.
| Qualidade da análise | Até 60 s | Até 180 s | Até 360 s | Até 600 s |
|---|---|---|---|---|
| Rápido | 200 | 204 | 567 | 933 |
| Pro | 238 | 256 | 704 | 1.162 |
| Misto e Misto (consistente) | 297 | 321 | 802 | 1.295 |
| Inteligente | 455 | 554 | 1.394 | 2.284 |
- Uma tolerância de 3 segundos por faixa. Um vídeo de até 1:03 é cobrado na faixa de 60 segundos, de até 3:03 na faixa de 180 segundos e de até 6:03 na faixa de 360 segundos. Depois do download, o nó mede o vídeo de novo e aceita até 6 segundos além da faixa em que ele foi cobrado. Um vídeo mais longo que isso faz a execução falhar, e os créditos dela são reembolsados.
- Um link do YouTube em uma execução do workflow. O Nodaro lê a duração do próprio vídeo do link antes de reservar qualquer coisa. A execução recebe o preço da faixa em que essa duração cabe. Uma transmissão ao vivo, ou um vídeo com mais de 10 minutos, é recusada antes de qualquer cobrança.
- Um link de outro site. O Nodaro lê da mesma forma a duração de um post do TikTok, Instagram, X ou Facebook, e a execução recebe o preço da faixa em que essa duração cabe. Para um link vindo de um nó de texto, o nó não consegue ler essa duração antes de a execução começar, então o botão Executar dele mostra o preço da faixa de 600 segundos. Um post cuja página não informa a duração, o que pode acontecer no Instagram, é tratado como duração desconhecida. Para ter o preço exato antes da execução, use um nó URL de vídeo no lugar: ele busca o vídeo primeiro, e o preço da análise é definido pela duração do vídeo.
- Duração desconhecida. Em uma execução do workflow, se a duração do vídeo não puder ser lida, é usada a duração que o painel de configurações mostrou para o mesmo link. Se não houver nenhuma, a execução recebe o preço da faixa de 600 segundos. Se depois não for possível buscar o vídeo do link, a execução falha e os créditos dela são reembolsados. Ao clicar em Executar só neste nó, e também pela API e pelo MCP, um vídeo cuja duração não pode ser lida é recusado.
- Por que os níveis custam diferente. Vídeos mais longos precisam de mais janelas, e cada nível analisa cada janela várias vezes. Essas passagens repetidas são o principal motivo pelo qual o Misto e o Inteligente custam mais.
Dicas
- Comece com o Pro. Desça para o Rápido para uma passagem mais barata quando puder abrir mão de algum detalhe.
- Use o Foco da análise. Aponte a análise para o que importa na sua recriação: fotos de produtos, texto na tela ou um personagem.
- Confira a análise antes de gastar. Conecte o resultado ao Auditoria com IA (AI Audit), que assiste ao vídeo de novo e corrige só o que a filmagem confirma, antes de gerar todas as cenas.
- Renderize a partir de
visualResolved. UsevisualeslotRefssó se você montar a sua própria etapa para escalar de novo.
Pela API
A mesma análise está disponível para código e para assistentes de IA. O resultado completo também fica guardado na saída do job. A origem é videoUrl ou youtubeUrl, e as configurações correspondem a llmModel (o nível de qualidade), selectionMode, variations, translateSpeechToEnglish, translateOnScreenTextToEnglish e analysisFocus. Veja Executar um único nó e as ferramentas MCP.
Perguntas frequentes
Páginas relacionadas
Gerar vídeo Pro
Auditoria com IA
URL de vídeo
Enviar vídeo
Video Analysis (Pro)
Última atualização
GIF para vídeo
Converta de graça um GIF animado em MP4, repita GIFs curtos até uma duração útil e use o clipe como referência de movimento em modelos que recusam GIF.
Auditoria com IA
Reveja um vídeo junto com a análise dele, aplique só as correções que as imagens confirmam e receba um relatório de correções, recusas e pontos de atenção.