Docs do Nodaro
DocumentaçãoReferência de nósModelosAgentes de IA (MCP)DesenvolvedoresSelf-hostingPesquisa
Vídeo

Análise de vídeo

Divida um vídeo, ou o link de um post do YouTube, TikTok, Instagram, X ou Facebook, de até 10 minutos em cenas de até 8 s, com imagem pronta para prompt.

Disponível em Nodaro Cloud

O nó Análise de vídeo (Video Analysis) divide um vídeo em uma descrição cena a cena que um modelo de IA consegue recriar. Ele corta o vídeo em cenas de até 8 segundos, uma geração cada, e descreve a imagem, o enquadramento, a câmera e o som de cada cena. Pessoas, objetos e lugares recorrentes viram slots de entidade reutilizáveis, para que você possa escalar de novo o vídeo com os seus próprios personagens, objetos e locais.

Em uma instalação self-hosted, o nó mostra uma marca NODARO e é executado pela sua conexão com o Nodaro Cloud, com cobrança na conta conectada. Sem uma conexão, o nó mostra um botão CONECTAR NODARO e não é executado.

Quando usar

  • Você quer transformar um vídeo de referência em um plano tomada a tomada para recriá-lo com IA.
  • Você quer extrair o elenco de um vídeo para filmá-lo de novo com os seus próprios personagens, objetos e locais.
  • Você quer uma descrição de cada cena, pronta para prompt, para alimentar nós de imagem e de vídeo.
  • Você quer as camadas de som de cada cena, o diálogo mais descrições da música e dos efeitos sonoros, para uma trilha sonora equivalente.

Início rápido

Adicionar o nó

Pressione Tab no canvas e escolha Vídeo › Análise › Análise de vídeo.

Fornecer um vídeo

Conecte um nó de vídeo, como o Enviar vídeo (Upload Video), à entrada Vídeo, ou cole um link em URL do YouTube no painel de configurações. Para um link, o painel mostra a duração do vídeo, que define o preço.

Escolher a qualidade

Escolha uma Qualidade da análise. Pro é o padrão. Se quiser, escreva em Foco da análise (opcional) o que mais importa.

Executar e usar o resultado

Clique em Executar. Conecte a saída Texto a um prompt, por exemplo do Gerar vídeo Pro (Generate Video Pro), ou a saída JSON das cenas a um nó que leia dados estruturados.

vídeovídeoanálisepromptEnviar vídeoVídeo de referênciaAnálise de vídeoProAuditoria com IAGerar vídeo Pro
Um vídeo de referência é analisado, o Auditoria com IA confere de novo a análise com a filmagem, e o texto corrigido guia o Gerar vídeo Pro.

Entradas

EntradaAceitaO que faz
VídeoNós de vídeo, como Enviar vídeo, URL de vídeo (Video URL) e Gerar vídeo (Generate Video), e nós de texto, como Texto (Text) e PromptO vídeo a analisar, ou um link para ele. Opcional quando URL do YouTube está definida. Um vídeo conectado sempre tem prioridade sobre um link conectado, e um link conectado tem prioridade sobre URL do YouTube.

Um link vindo de um nó de texto. O texto inteiro precisa ser um único link, e nada mais: um link youtube.com ou youtu.be, ou o link de um único post do TikTok, Instagram, X ou Facebook. Um texto com outras palavras em volta do link é ignorado. Se o nó então não tiver nenhum outro vídeo ou link, ele se recusa a executar. O nó não consegue ler a duração de um link vindo de um nó de texto antes de a execução começar, então o botão Executar dele mostra o preço da faixa de 600 segundos. O preço da execução em si é definido pela duração que ela lê quando começa (veja Créditos). Para ter o preço exato antes da execução, use um nó URL de vídeo.

Saídas

SaídaO que leva
JSON das cenasA análise completa como dados estruturados: meta, look, slots e scenes. Veja O que a análise contém.
TextoA mesma análise em texto simples. Conecte-a a qualquer prompt ou entrada de texto, sem copiar e colar.

Configurações

ConfiguraçãoO que faz
Qualidade da análiseInteligente, Pro (o padrão), Rápido, Misto ou Misto (consistente). Veja Qual qualidade escolher.
Seleção do resultadoEscolher (o padrão) ou Combinar. O vídeo é analisado várias vezes. Escolher mantém a passagem mais forte como está. Combinar também adiciona detalhes das outras passagens depois de conferi-los com a filmagem. É um pouco mais lento e o mais completo. Inteligente ignora esta configuração.
Variações do elenco — detecta visuais alternativos de cada entidadeDesativado por padrão. Também detecta os diferentes visuais de cada pessoa ou coisa e as cenas em que cada visual aparece. Veja Visuais alternativos.
Traduzir para o inglêsDuas caixas de seleção, ambas desmarcadas por padrão: Fala — o que é dito ou cantado e Texto na tela — placas, legendas, títulos. Veja Idioma da saída.
URL do YouTubeUm link youtube.com ou youtu.be a analisar quando nem um vídeo nem um link estão conectados à entrada Vídeo.
Foco da análise (opcional)Até 2.000 caracteres sobre aquilo em que a análise deve prestar atenção, por exemplo “fotos de produtos e texto na tela”.
Texto antes e depoisTexto adicionado antes e depois do foco da análise no momento da execução. Veja Texto antes e depois do prompt.

O Foco da análise direciona a atenção, nunca o formato. Ele não muda a estrutura do resultado, a duração das cenas nem a lista de campos. Deixe-o vazio para uma análise geral.

O painel de configurações do Análise de vídeo com a Qualidade da análise em Pro, a Seleção do resultado em Combinar, as duas caixas de tradução marcadas e uma URL do YouTube cujo vídeo passa do limite de 10 minutos.O painel de configurações do Análise de vídeo com a Qualidade da análise em Pro, a Seleção do resultado em Combinar, as duas caixas de tradução marcadas e uma URL do YouTube cujo vídeo passa do limite de 10 minutos.

Qual qualidade escolher

Você escolhe um nível de qualidade, não um modelo. O Nodaro escolhe o modelo de análise por trás de cada nível, então um nível pode melhorar com o tempo sem nenhuma mudança no seu workflow.

Qualidade da análiseO que fazUse quando
RápidoUma análise econômicaVocê pode trocar um pouco de detalhe por preço e velocidade.
Pro (o padrão)Uma análise mais fiel das cenas e das entidadesNa maioria das análises.
MistoVárias passagens de análise combinadas para a máxima completudeA completude é o mais importante.
Misto (consistente)O mesmo plano, ajustado para o resultado mais consistente de uma execução para outraVocê analisa o mesmo tipo de vídeo com frequência e quer uma saída estável.
InteligenteA maior precisão: uma passagem principal detalhada combinada com várias passagens econômicas, e sempre refinadaA lista de tomadas vai guiar uma nova geração.

Todo nível analisa cada parte do vídeo várias vezes e mantém ou mescla o melhor resultado: três passagens no Rápido e no Pro, e seis nos dois níveis Misto. O Inteligente e os dois níveis Misto também terminam com uma revisão de continuidade. Ela corrige afirmações que se contradizem entre as cenas. Ela também emite um aviso de atenção à continuidade quando um estado duradouro parece ser abandonado, por exemplo um objeto algemado a um personagem que desaparece das cenas seguintes. Cada correção e cada ponto de atenção aparecem nos avisos do resultado.

O que a análise contém

O resultado tem quatro partes. Os nós seguintes e o seu próprio código leem a mesma estrutura.

meta — dados sobre o arquivo

CampoO que contém
durationSecA duração medida, em segundos
width, heightO tamanho do quadro, em pixels
aspectRatioA proporção, ajustada para 16:9, 9:16, 1:1, 4:3, 3:4 ou 21:9 quando a diferença é de até 3%; caso contrário, a razão simplificada entre largura e altura
titleO título da origem, quando conhecido, como o título do YouTube
languageO principal idioma falado. Ele sempre descreve a filmagem, sejam quais forem as configurações de tradução.

look — a fotografia do clipe inteiro

Propriedades que pertencem à peça inteira, e não a uma tomada, informadas uma só vez para que todas as tomadas geradas de novo as compartilhem. Todos os campos são opcionais, e a parte inteira é omitida quando a análise não consegue lê-la.

CampoO que contém
styleO meio, como “live-action photoreal”, “2D anime”, “stop-motion claymation” ou “3D render”
styleIdA entrada correspondente do seletor Estilo (Style), quando o meio se encaixa em uma
gradeA correção de cor e a paleta
formatO formato da câmera ou do filme e a película, como “16mm film grain”
lensO caráter da lente, como “wide-angle, shallow depth of field throughout”
lightingO estilo geral de iluminação. Uma cena diferente descreve a própria iluminação.
genreO tipo de peça, como “cinematic trailer” ou “talking-head vlog”
influenceA influência visual que a peça evoca claramente, como o seletor Estilo de fotógrafo / artista (Photographer / Artist Style). É omitida, a menos que o estilo seja claramente reconhecível.

slots — as pessoas, os objetos e os lugares que você pode escalar

Cada entidade recorrente é extraída uma vez, para que você possa substituí-la pela sua.

CampoO que contém
slotIdUm id estável, usado no texto visual de uma cena como token de slot, por exemplo {slot:hero}
labelUm nome legível
sourceO tipo de entidade usada para escalá-lo: um personagem, um objeto, um local ou uma criatura
roleO papel dele no vídeo, como “narrator” ou “hero product”
descriptionUma descrição visual completa, usada quando nenhuma entidade é escalada
refImageUrlUm quadro do vídeo em que a entidade aparece claramente, escolhido automaticamente
variationsOs outros visuais da entidade, quando Variações do elenco está ativado

scenes — uma entrada por tomada

CampoO que contém
sceneNumberO número da cena, a partir de 1, ao longo do vídeo inteiro
startSec, endSecOnde a cena começa e termina, em segundos
labelUm rótulo curto da cena
shotTypeO tamanho do enquadramento: Wide, Medium, Medium Close-Up, Close-Up, Extreme Close-Up, ou Two-Shot, Insert ou Aerial
angleOnde a câmera fica. Sem o campo, a câmera fica na altura dos olhos. Veja os valores abaixo.
cameraO movimento de câmera em texto livre, como “slow push-in”. Vazio para uma tomada com a câmera fixa.
speedslow-motion, ramp-in, ramp-out, timelapse, freeze ou reverse. Sem o campo, a velocidade é normal.
effectsEfeitos na imagem: blur, pixelate, glitch, grain, vignette, flash, distortion ou double-exposure. Sem o campo, a imagem é limpa.
onScreenTextTexto gravado na imagem, como títulos e legendas, palavra por palavra, na escrita original
visualA descrição visual com tokens de slot, para escalar de novo
visualResolvedA mesma descrição com todos os slots escritos por extenso. Renderize a partir deste campo.
audioAs camadas de som da cena. Veja abaixo.
slotRefsOs slots que aparecem na cena
slotVariationsQual visual cada slot usa nesta cena, quando Variações do elenco está ativado
oversizedPresente quando a cena tem mais de 8 segundos porque não pôde ser cortada mais curta. Continua sendo uma geração.

Cada cena também registra uma transição visível para a tomada seguinte, quando há uma.

Ângulos de câmera. angle é um destes valores: eye-level, low, high, overhead, worms-eye, dutch, over-the-shoulder, pov, profile ou from-behind. Os três campos de câmera são independentes: shotType diz quanto do sujeito está no quadro, angle diz onde a câmera fica, e camera diz o que a câmera faz. Uma tomada média por cima do ombro é shotType Medium com angle over-the-shoulder.

Leia visualResolved, não visual. visual mantém os tokens de slot para que você possa escalar a cena de novo depois. visualResolved é o texto completo, pronto para prompt, que todo nó seguinte deve usar.

Camadas de áudio

O audio de uma cena é uma lista dos sons que tocam ao mesmo tempo. Uma música de fundo sob uma fala, sobre um respingo de água, são três camadas. Uma lista vazia significa silêncio de verdade.

CampoO que contém
modespeech, music ou sfx
contentNa fala, as palavras exatas. Na música e nos efeitos sonoros, uma descrição pronta para a geração.
voiceNa fala, como a voz soa, como “male, warm, conversational”
speakerSlotNa fala, o slot de quem fala na tela, quando a análise consegue identificar
  • Cada fala aparece uma vez. Ler as camadas de fala na ordem das cenas dá a trilha sonora sem nada dito duas vezes. Uma fala que atravessa um corte é dividida no corte, e uma fala sobre uma montagem pertence à tomada em que começa.
  • Músicas da trilha sonora são música. Uma canção que ninguém canta na tela faz parte da camada de música, com os vocais descritos ali. Só as palavras faladas ou cantadas dentro da história são fala.
  • Quem fala é opcional. speakerSlot é omitido quando a análise não tem certeza, quando quem fala é um narrador que não aparece e quando quem fala é uma pessoa que aparece só uma vez, sem slot.

Visuais alternativos

Com Variações do elenco — detecta visuais alternativos de cada entidade ativado, a análise separa os diferentes visuais do mesmo sujeito em vez de fazer uma média deles em uma única descrição. Uma simples troca de roupa entre as cenas conta tanto quanto um sonho, um flashback, um disfarce, uma transformação ou uma época.

  • Até 4 visuais por slot. Cada visual tem um id, como dream, flashback, disguise, costume, transformation, era ou alt-1. Ele também tem um rótulo curto, uma descrição completa do sujeito nesse visual e um quadro que o mostra.
  • As cenas dizem qual visual está ativo. Uma cena sem visual para um slot usa o visual padrão do slot.
  • Duas formas de encontrar visuais. Uma passagem observa a filmagem em busca de trocas de roupa, cabelo e maquiagem. Uma segunda passagem lê a análise pronta em busca de visuais que a filmagem não mostra, como “vinte anos depois”. Nenhuma das passagens renomeia um slot ou muda o texto de uma cena.
  • Nada desaparece sem aviso. Quando um sujeito tem mais visuais do que o limite, os visuais extras são incorporados ao visual padrão, e o resultado registra essa incorporação.

O Gerar vídeo Pro mantém cada visual consistente dentro das próprias cenas.

Idioma da saída

Com as duas caixas de Traduzir para o inglês desmarcadas, a análise mantém o idioma original do vídeo. A fala é citada palavra por palavra, e o texto na tela continua na escrita original. É isso que você quer para recriar um vídeo como ele é.

As duas caixas mudam coisas diferentes, então você pode marcá-las de forma independente:

Caixa de seleçãoO que ela traduz
Fala — o que é dito ou cantadoAs palavras faladas e cantadas
Texto na tela — placas, legendas, títulosO texto visível na imagem

Por exemplo, você pode ter uma narração em inglês sobre uma rua cujas placas continuam em chinês. Com qualquer uma das caixas marcada, as descrições das cenas, as notas de câmera, as descrições dos slots e as notas de voz também são escritas em inglês.

  • Os nomes ficam como estão. Nomes de marcas, produtos, pessoas e lugares nunca são traduzidos.
  • O campo de idioma não muda. language sempre indica o idioma falado na filmagem.
  • Isso muda a recriação. As descrições das cenas são os prompts da nova geração, então uma placa traduzida é renderizada em inglês na nova tomada.
  • As palavras originais não são mantidas. A tradução as substitui. Execute de novo com as caixas desmarcadas se precisar do original.

Videoclipes. Por padrão, a letra das músicas que ninguém canta na tela fica dentro da camada de música. Para um videoclipe, em que a música é a peça, defina musicVideo: true na requisição da API, ou music_video na ferramenta MCP. Cada verso cantado volta então palavra por palavra como fala, cena por cena. Essa opção só está disponível pela API e pelo MCP.

Vídeos longos e limites

  • Duração máxima: 10 minutos (600 segundos) para qualquer origem. O limite é conferido quando você executa o nó e de novo depois que o vídeo é baixado.
  • Janelas: um vídeo de até 180 segundos é analisado em uma passagem. Um vídeo mais longo é analisado em janelas sobrepostas de cerca de 150 segundos, com 5 segundos de sobreposição, e depois mesclado em um único resultado contínuo e renumerado.
  • Links: URL do YouTube aceita um link youtube.com ou youtu.be. A entrada Vídeo também aceita o link de um único post do TikTok, Instagram, X ou Facebook, vindo de um nó de texto ou de um nó URL de vídeo. Transmissões ao vivo são recusadas; analise a gravação depois que a transmissão terminar.

Créditos

O preço depende da Qualidade da análise e da duração do vídeo. A duração cai na menor faixa em que cabe: até 60, 180, 360 ou 600 segundos.

Qualidade da análiseAté 60 sAté 180 sAté 360 sAté 600 s
Rápido200204567933
Pro2382567041.162
Misto e Misto (consistente)2973218021.295
Inteligente4555541.3942.284
  • Uma tolerância de 3 segundos por faixa. Um vídeo de até 1:03 é cobrado na faixa de 60 segundos, de até 3:03 na faixa de 180 segundos e de até 6:03 na faixa de 360 segundos. Depois do download, o nó mede o vídeo de novo e aceita até 6 segundos além da faixa em que ele foi cobrado. Um vídeo mais longo que isso faz a execução falhar, e os créditos dela são reembolsados.
  • Um link do YouTube em uma execução do workflow. O Nodaro lê a duração do próprio vídeo do link antes de reservar qualquer coisa. A execução recebe o preço da faixa em que essa duração cabe. Uma transmissão ao vivo, ou um vídeo com mais de 10 minutos, é recusada antes de qualquer cobrança.
  • Um link de outro site. O Nodaro lê da mesma forma a duração de um post do TikTok, Instagram, X ou Facebook, e a execução recebe o preço da faixa em que essa duração cabe. Para um link vindo de um nó de texto, o nó não consegue ler essa duração antes de a execução começar, então o botão Executar dele mostra o preço da faixa de 600 segundos. Um post cuja página não informa a duração, o que pode acontecer no Instagram, é tratado como duração desconhecida. Para ter o preço exato antes da execução, use um nó URL de vídeo no lugar: ele busca o vídeo primeiro, e o preço da análise é definido pela duração do vídeo.
  • Duração desconhecida. Em uma execução do workflow, se a duração do vídeo não puder ser lida, é usada a duração que o painel de configurações mostrou para o mesmo link. Se não houver nenhuma, a execução recebe o preço da faixa de 600 segundos. Se depois não for possível buscar o vídeo do link, a execução falha e os créditos dela são reembolsados. Ao clicar em Executar só neste nó, e também pela API e pelo MCP, um vídeo cuja duração não pode ser lida é recusado.
  • Por que os níveis custam diferente. Vídeos mais longos precisam de mais janelas, e cada nível analisa cada janela várias vezes. Essas passagens repetidas são o principal motivo pelo qual o Misto e o Inteligente custam mais.

Dicas

  • Comece com o Pro. Desça para o Rápido para uma passagem mais barata quando puder abrir mão de algum detalhe.
  • Use o Foco da análise. Aponte a análise para o que importa na sua recriação: fotos de produtos, texto na tela ou um personagem.
  • Confira a análise antes de gastar. Conecte o resultado ao Auditoria com IA (AI Audit), que assiste ao vídeo de novo e corrige só o que a filmagem confirma, antes de gerar todas as cenas.
  • Renderize a partir de visualResolved. Use visual e slotRefs só se você montar a sua própria etapa para escalar de novo.

Pela API

A mesma análise está disponível para código e para assistentes de IA. O resultado completo também fica guardado na saída do job. A origem é videoUrl ou youtubeUrl, e as configurações correspondem a llmModel (o nível de qualidade), selectionMode, variations, translateSpeechToEnglish, translateOnScreenTextToEnglish e analysisFocus. Veja Executar um único nó e as ferramentas MCP.

Perguntas frequentes

Última atualização

Nesta página