# Análise de vídeo

> Divida um vídeo, ou o link de um post do YouTube, TikTok, Instagram, X ou Facebook, de até 10 minutos em cenas de até 8 s, com imagem pronta para prompt.

Source: https://nodaro.ai/pt-BR/docs/nodes/video/video-analysis

O nó **Análise de vídeo** (Video Analysis) divide um vídeo em uma descrição cena a cena que um modelo de IA consegue recriar. Ele corta o vídeo em cenas de até 8 segundos, uma geração cada, e descreve a imagem, o enquadramento, a câmera e o som de cada cena. Pessoas, objetos e lugares recorrentes viram **slots de entidade** reutilizáveis, para que você possa escalar de novo o vídeo com os seus próprios personagens, objetos e locais.

- Found in: Video › Analyze
- Output: data
- API type: `video-analysis`

Em uma instalação self-hosted, o nó mostra uma marca **NODARO** e é executado pela sua [conexão com o Nodaro Cloud](https://nodaro.ai/docs/self-hosting/cloud-connect), com cobrança na conta conectada. Sem uma conexão, o nó mostra um botão **CONECTAR NODARO** e não é executado.

## Quando usar
- Você quer transformar um vídeo de referência em um plano tomada a tomada para recriá-lo com IA.
- Você quer extrair o elenco de um vídeo para filmá-lo de novo com os seus próprios personagens, objetos e locais.
- Você quer uma descrição de cada cena, pronta para prompt, para alimentar nós de imagem e de vídeo.
- Você quer as camadas de som de cada cena, o diálogo mais descrições da música e dos efeitos sonoros, para uma trilha sonora equivalente.

## Início rápido
### Adicionar o nó
Pressione Tab no canvas e escolha **Vídeo › Análise › Análise de vídeo**.

### Fornecer um vídeo
Conecte um nó de vídeo, como o [**Enviar vídeo** (Upload Video)](https://nodaro.ai/docs/nodes/video/upload-video), à entrada **Vídeo**, ou cole um link em **URL do YouTube** no painel de configurações. Para um link, o painel mostra a duração do vídeo, que define o preço.

### Escolher a qualidade
Escolha uma **Qualidade da análise**. **Pro** é o padrão. Se quiser, escreva em **Foco da análise (opcional)** o que mais importa.

### Executar e usar o resultado
Clique em **Executar**. Conecte a saída **Texto** a um prompt, por exemplo do [**Gerar vídeo Pro** (Generate Video Pro)](https://nodaro.ai/docs/nodes/video/generate-video-pro), ou a saída **JSON das cenas** a um nó que leia dados estruturados.

Workflow: Um vídeo de referência é analisado, o Auditoria com IA confere de novo a análise com a filmagem, e o texto corrigido guia o Gerar vídeo Pro.

- Enviar vídeo → Análise de vídeo (vídeo)
- Enviar vídeo → Auditoria com IA (vídeo)
- Análise de vídeo → Auditoria com IA (análise)
- Auditoria com IA → Gerar vídeo Pro (prompt)

## Entradas
| Entrada | Aceita | O que faz |
| --- | --- | --- |
| **Vídeo** | Nós de vídeo, como Enviar vídeo, **URL de vídeo** (Video URL) e **Gerar vídeo** (Generate Video), e nós de texto, como [**Texto** (Text)](https://nodaro.ai/docs/nodes/automate/text) e [**Prompt**](https://nodaro.ai/docs/nodes/automate/prompt) | O vídeo a analisar, ou um link para ele. Opcional quando **URL do YouTube** está definida. Um vídeo conectado sempre tem prioridade sobre um link conectado, e um link conectado tem prioridade sobre **URL do YouTube**. |

**Um link vindo de um nó de texto.** O texto inteiro precisa ser um único link, e nada mais: um link `youtube.com` ou `youtu.be`, ou o link de um único post do TikTok, Instagram, X ou Facebook. Um texto com outras palavras em volta do link é ignorado. Se o nó então não tiver nenhum outro vídeo ou link, ele se recusa a executar. O nó não consegue ler a duração de um link vindo de um nó de texto antes de a execução começar, então o botão **Executar** dele mostra o preço da faixa de 600 segundos. O preço da execução em si é definido pela duração que ela lê quando começa (veja [Créditos](#credits)). Para ter o preço exato antes da execução, use um nó [URL de vídeo](https://nodaro.ai/docs/nodes/automate/video-url).

## Saídas
| Saída | O que leva |
| --- | --- |
| **JSON das cenas** | A análise completa como dados estruturados: `meta`, `look`, `slots` e `scenes`. Veja [O que a análise contém](#what-the-analysis-contains). |
| **Texto** | A mesma análise em texto simples. Conecte-a a qualquer prompt ou entrada de texto, sem copiar e colar. |

## Configurações
| Configuração | O que faz |
| --- | --- |
| **Qualidade da análise** | **Inteligente**, **Pro** (o padrão), **Rápido**, **Misto** ou **Misto (consistente)**. Veja [Qual qualidade escolher](#which-quality-to-choose). |
| **Seleção do resultado** | **Escolher** (o padrão) ou **Combinar**. O vídeo é analisado várias vezes. Escolher mantém a passagem mais forte como está. Combinar também adiciona detalhes das outras passagens depois de conferi-los com a filmagem. É um pouco mais lento e o mais completo. Inteligente ignora esta configuração. |
| **Variações do elenco — detecta visuais alternativos de cada entidade** | Desativado por padrão. Também detecta os diferentes visuais de cada pessoa ou coisa e as cenas em que cada visual aparece. Veja [Visuais alternativos](#appearance-looks). |
| **Traduzir para o inglês** | Duas caixas de seleção, ambas desmarcadas por padrão: **Fala — o que é dito ou cantado** e **Texto na tela — placas, legendas, títulos**. Veja [Idioma da saída](#output-language). |
| **URL do YouTube** | Um link `youtube.com` ou `youtu.be` a analisar quando nem um vídeo nem um link estão conectados à entrada **Vídeo**. |
| **Foco da análise (opcional)** | Até 2.000 caracteres sobre aquilo em que a análise deve prestar atenção, por exemplo “fotos de produtos e texto na tela”. |
| **Texto antes e depois** | Texto adicionado antes e depois do foco da análise no momento da execução. Veja [Texto antes e depois do prompt](https://nodaro.ai/docs/concepts/prompt-pre-post-text). |

O **Foco da análise** direciona a atenção, nunca o formato. Ele não muda a estrutura do resultado, a duração das cenas nem a lista de campos. Deixe-o vazio para uma análise geral.

![O painel de configurações do Análise de vídeo com a Qualidade da análise em Pro, a Seleção do resultado em Combinar, as duas caixas de tradução marcadas e uma URL do YouTube cujo vídeo passa do limite de 10 minutos.](https://nodaro.ai/docs-media/screens/en/nodes/video-analysis/settings.light.webp)

## Qual qualidade escolher
Você escolhe um nível de qualidade, não um modelo. O Nodaro escolhe o modelo de análise por trás de cada nível, então um nível pode melhorar com o tempo sem nenhuma mudança no seu workflow.

| Qualidade da análise | O que faz | Use quando |
| --- | --- | --- |
| **Rápido** | Uma análise econômica | Você pode trocar um pouco de detalhe por preço e velocidade. |
| **Pro** (o padrão) | Uma análise mais fiel das cenas e das entidades | Na maioria das análises. |
| **Misto** | Várias passagens de análise combinadas para a máxima completude | A completude é o mais importante. |
| **Misto (consistente)** | O mesmo plano, ajustado para o resultado mais consistente de uma execução para outra | Você analisa o mesmo tipo de vídeo com frequência e quer uma saída estável. |
| **Inteligente** | A maior precisão: uma passagem principal detalhada combinada com várias passagens econômicas, e sempre refinada | A lista de tomadas vai guiar uma nova geração. |

Todo nível analisa cada parte do vídeo várias vezes e mantém ou mescla o melhor resultado: três passagens no Rápido e no Pro, e seis nos dois níveis Misto. O Inteligente e os dois níveis Misto também terminam com uma **revisão de continuidade**. Ela corrige afirmações que se contradizem entre as cenas. Ela também emite um aviso de atenção à continuidade quando um estado duradouro parece ser abandonado, por exemplo um objeto algemado a um personagem que desaparece das cenas seguintes. Cada correção e cada ponto de atenção aparecem nos avisos do resultado.

## O que a análise contém
O resultado tem quatro partes. Os nós seguintes e o seu próprio código leem a mesma estrutura.

### `meta` — dados sobre o arquivo
| Campo | O que contém |
| --- | --- |
| `durationSec` | A duração medida, em segundos |
| `width`, `height` | O tamanho do quadro, em pixels |
| `aspectRatio` | A proporção, ajustada para `16:9`, `9:16`, `1:1`, `4:3`, `3:4` ou `21:9` quando a diferença é de até 3%; caso contrário, a razão simplificada entre largura e altura |
| `title` | O título da origem, quando conhecido, como o título do YouTube |
| `language` | O principal idioma falado. Ele sempre descreve a filmagem, sejam quais forem as configurações de tradução. |

### `look` — a fotografia do clipe inteiro
Propriedades que pertencem à peça inteira, e não a uma tomada, informadas uma só vez para que todas as tomadas geradas de novo as compartilhem. Todos os campos são opcionais, e a parte inteira é omitida quando a análise não consegue lê-la.

| Campo | O que contém |
| --- | --- |
| `style` | O meio, como “live-action photoreal”, “2D anime”, “stop-motion claymation” ou “3D render” |
| `styleId` | A entrada correspondente do seletor [**Estilo** (Style)](https://nodaro.ai/docs/nodes/creative-controls/style), quando o meio se encaixa em uma |
| `grade` | A correção de cor e a paleta |
| `format` | O formato da câmera ou do filme e a película, como “16mm film grain” |
| `lens` | O caráter da lente, como “wide-angle, shallow depth of field throughout” |
| `lighting` | O estilo geral de iluminação. Uma cena diferente descreve a própria iluminação. |
| `genre` | O tipo de peça, como “cinematic trailer” ou “talking-head vlog” |
| `influence` | A influência visual que a peça evoca claramente, como o seletor [**Estilo de fotógrafo / artista** (Photographer / Artist Style)](https://nodaro.ai/docs/nodes/creative-controls/photographer). É omitida, a menos que o estilo seja claramente reconhecível. |

### `slots` — as pessoas, os objetos e os lugares que você pode escalar
Cada entidade recorrente é extraída uma vez, para que você possa substituí-la pela sua.

| Campo | O que contém |
| --- | --- |
| `slotId` | Um id estável, usado no texto `visual` de uma cena como token de slot, por exemplo `{slot:hero}` |
| `label` | Um nome legível |
| `source` | O tipo de entidade usada para escalá-lo: um personagem, um objeto, um local ou uma criatura |
| `role` | O papel dele no vídeo, como “narrator” ou “hero product” |
| `description` | Uma descrição visual completa, usada quando nenhuma entidade é escalada |
| `refImageUrl` | Um quadro do vídeo em que a entidade aparece claramente, escolhido automaticamente |
| `variations` | Os outros visuais da entidade, quando **Variações do elenco** está ativado |

### `scenes` — uma entrada por tomada
| Campo | O que contém |
| --- | --- |
| `sceneNumber` | O número da cena, a partir de 1, ao longo do vídeo inteiro |
| `startSec`, `endSec` | Onde a cena começa e termina, em segundos |
| `label` | Um rótulo curto da cena |
| `shotType` | O tamanho do enquadramento: Wide, Medium, Medium Close-Up, Close-Up, Extreme Close-Up, ou Two-Shot, Insert ou Aerial |
| `angle` | Onde a câmera fica. Sem o campo, a câmera fica na altura dos olhos. Veja os valores abaixo. |
| `camera` | O movimento de câmera em texto livre, como “slow push-in”. Vazio para uma tomada com a câmera fixa. |
| `speed` | `slow-motion`, `ramp-in`, `ramp-out`, `timelapse`, `freeze` ou `reverse`. Sem o campo, a velocidade é normal. |
| `effects` | Efeitos na imagem: `blur`, `pixelate`, `glitch`, `grain`, `vignette`, `flash`, `distortion` ou `double-exposure`. Sem o campo, a imagem é limpa. |
| `onScreenText` | Texto gravado na imagem, como títulos e legendas, palavra por palavra, na escrita original |
| `visual` | A descrição visual com tokens de slot, para escalar de novo |
| `visualResolved` | A mesma descrição com todos os slots escritos por extenso. **Renderize a partir deste campo.** |
| `audio` | As camadas de som da cena. Veja abaixo. |
| `slotRefs` | Os slots que aparecem na cena |
| `slotVariations` | Qual visual cada slot usa nesta cena, quando **Variações do elenco** está ativado |
| `oversized` | Presente quando a cena tem mais de 8 segundos porque não pôde ser cortada mais curta. Continua sendo uma geração. |

Cada cena também registra uma transição visível para a tomada seguinte, quando há uma.

**Ângulos de câmera.** `angle` é um destes valores: `eye-level`, `low`, `high`, `overhead`, `worms-eye`, `dutch`, `over-the-shoulder`, `pov`, `profile` ou `from-behind`. Os três campos de câmera são independentes: `shotType` diz quanto do sujeito está no quadro, `angle` diz onde a câmera fica, e `camera` diz o que a câmera faz. Uma tomada média por cima do ombro é `shotType` Medium com `angle` over-the-shoulder.

**Leia `visualResolved`, não `visual`.** `visual` mantém os tokens de slot para que você possa escalar a cena de novo depois. `visualResolved` é o texto completo, pronto para prompt, que todo nó seguinte deve usar.

### Camadas de áudio
O `audio` de uma cena é uma lista dos sons que tocam ao mesmo tempo. Uma música de fundo sob uma fala, sobre um respingo de água, são três camadas. Uma lista vazia significa silêncio de verdade.

| Campo | O que contém |
| --- | --- |
| `mode` | `speech`, `music` ou `sfx` |
| `content` | Na fala, as palavras exatas. Na música e nos efeitos sonoros, uma descrição pronta para a geração. |
| `voice` | Na fala, como a voz soa, como “male, warm, conversational” |
| `speakerSlot` | Na fala, o slot de quem fala na tela, quando a análise consegue identificar |

- **Cada fala aparece uma vez.** Ler as camadas de fala na ordem das cenas dá a trilha sonora sem nada dito duas vezes. Uma fala que atravessa um corte é dividida no corte, e uma fala sobre uma montagem pertence à tomada em que começa.
- **Músicas da trilha sonora são música.** Uma canção que ninguém canta na tela faz parte da camada de música, com os vocais descritos ali. Só as palavras faladas ou cantadas dentro da história são fala.
- **Quem fala é opcional.** `speakerSlot` é omitido quando a análise não tem certeza, quando quem fala é um narrador que não aparece e quando quem fala é uma pessoa que aparece só uma vez, sem slot.

## Visuais alternativos
Com **Variações do elenco — detecta visuais alternativos de cada entidade** ativado, a análise separa os diferentes visuais do mesmo sujeito em vez de fazer uma média deles em uma única descrição. Uma simples troca de roupa entre as cenas conta tanto quanto um sonho, um flashback, um disfarce, uma transformação ou uma época.

- **Até 4 visuais por slot.** Cada visual tem um id, como `dream`, `flashback`, `disguise`, `costume`, `transformation`, `era` ou `alt-1`. Ele também tem um rótulo curto, uma descrição completa do sujeito nesse visual e um quadro que o mostra.
- **As cenas dizem qual visual está ativo.** Uma cena sem visual para um slot usa o visual padrão do slot.
- **Duas formas de encontrar visuais.** Uma passagem observa a filmagem em busca de trocas de roupa, cabelo e maquiagem. Uma segunda passagem lê a análise pronta em busca de visuais que a filmagem não mostra, como “vinte anos depois”. Nenhuma das passagens renomeia um slot ou muda o texto de uma cena.
- **Nada desaparece sem aviso.** Quando um sujeito tem mais visuais do que o limite, os visuais extras são incorporados ao visual padrão, e o resultado registra essa incorporação.

O [Gerar vídeo Pro](https://nodaro.ai/docs/nodes/video/generate-video-pro) mantém cada visual consistente dentro das próprias cenas.

## Idioma da saída
Com as duas caixas de **Traduzir para o inglês** desmarcadas, a análise mantém o idioma original do vídeo. A fala é citada palavra por palavra, e o texto na tela continua na escrita original. É isso que você quer para recriar um vídeo como ele é.

As duas caixas mudam coisas diferentes, então você pode marcá-las de forma independente:

| Caixa de seleção | O que ela traduz |
| --- | --- |
| **Fala — o que é dito ou cantado** | As palavras faladas e cantadas |
| **Texto na tela — placas, legendas, títulos** | O texto visível na imagem |

Por exemplo, você pode ter uma narração em inglês sobre uma rua cujas placas continuam em chinês. Com qualquer uma das caixas marcada, as descrições das cenas, as notas de câmera, as descrições dos slots e as notas de voz também são escritas em inglês.

- **Os nomes ficam como estão.** Nomes de marcas, produtos, pessoas e lugares nunca são traduzidos.
- **O campo de idioma não muda.** `language` sempre indica o idioma falado na filmagem.
- **Isso muda a recriação.** As descrições das cenas são os prompts da nova geração, então uma placa traduzida é renderizada em inglês na nova tomada.
- **As palavras originais não são mantidas.** A tradução as substitui. Execute de novo com as caixas desmarcadas se precisar do original.

**Videoclipes.** Por padrão, a letra das músicas que ninguém canta na tela fica dentro da camada de música. Para um videoclipe, em que a música é a peça, defina `musicVideo: true` na requisição da API, ou `music_video` na ferramenta MCP. Cada verso cantado volta então palavra por palavra como fala, cena por cena. Essa opção só está disponível pela API e pelo MCP.

## Vídeos longos e limites
- **Duração máxima:** 10 minutos (600 segundos) para qualquer origem. O limite é conferido quando você executa o nó e de novo depois que o vídeo é baixado.
- **Janelas:** um vídeo de até 180 segundos é analisado em uma passagem. Um vídeo mais longo é analisado em janelas sobrepostas de cerca de 150 segundos, com 5 segundos de sobreposição, e depois mesclado em um único resultado contínuo e renumerado.
- **Links:** **URL do YouTube** aceita um link `youtube.com` ou `youtu.be`. A entrada **Vídeo** também aceita o link de um único post do TikTok, Instagram, X ou Facebook, vindo de um nó de texto ou de um nó URL de vídeo. Transmissões ao vivo são recusadas; analise a gravação depois que a transmissão terminar.

## Créditos
O preço depende da **Qualidade da análise** e da duração do vídeo. A duração cai na menor faixa em que cabe: até 60, 180, 360 ou 600 segundos.

| Qualidade da análise | Até 60 s | Até 180 s | Até 360 s | Até 600 s |
| --- | --- | --- | --- | --- |
| [Rápido](https://nodaro.ai/docs/models/video/video-analysis-fast) | 200 | 204 | 567 | 933 |
| [Pro](https://nodaro.ai/docs/models/video/video-analysis-pro) | 238 | 256 | 704 | 1.162 |
| [Misto](https://nodaro.ai/docs/models/video/video-analysis-mixed) e Misto (consistente) | 297 | 321 | 802 | 1.295 |
| [Inteligente](https://nodaro.ai/docs/models/video/video-analysis-smart) | 455 | 554 | 1.394 | 2.284 |

- **Uma tolerância de 3 segundos por faixa.** Um vídeo de até 1:03 é cobrado na faixa de 60 segundos, de até 3:03 na faixa de 180 segundos e de até 6:03 na faixa de 360 segundos. Depois do download, o nó mede o vídeo de novo e aceita até 6 segundos além da faixa em que ele foi cobrado. Um vídeo mais longo que isso faz a execução falhar, e os créditos dela são reembolsados.
- **Um link do YouTube em uma execução do workflow.** O Nodaro lê a duração do próprio vídeo do link antes de reservar qualquer coisa. A execução recebe o preço da faixa em que essa duração cabe. Uma transmissão ao vivo, ou um vídeo com mais de 10 minutos, é recusada antes de qualquer cobrança.
- **Um link de outro site.** O Nodaro lê da mesma forma a duração de um post do TikTok, Instagram, X ou Facebook, e a execução recebe o preço da faixa em que essa duração cabe. Para um link vindo de um nó de texto, o nó não consegue ler essa duração antes de a execução começar, então o botão **Executar** dele mostra o preço da faixa de 600 segundos. Um post cuja página não informa a duração, o que pode acontecer no Instagram, é tratado como duração desconhecida. Para ter o preço exato antes da execução, use um nó [URL de vídeo](https://nodaro.ai/docs/nodes/automate/video-url) no lugar: ele busca o vídeo primeiro, e o preço da análise é definido pela duração do vídeo.
- **Duração desconhecida.** Em uma execução do workflow, se a duração do vídeo não puder ser lida, é usada a duração que o painel de configurações mostrou para o mesmo link. Se não houver nenhuma, a execução recebe o preço da faixa de 600 segundos. Se depois não for possível buscar o vídeo do link, a execução falha e os créditos dela são reembolsados. Ao clicar em **Executar** só neste nó, e também pela API e pelo MCP, um vídeo cuja duração não pode ser lida é recusado.
- **Por que os níveis custam diferente.** Vídeos mais longos precisam de mais janelas, e cada nível analisa cada janela várias vezes. Essas passagens repetidas são o principal motivo pelo qual o Misto e o Inteligente custam mais.

## Dicas
- **Comece com o Pro.** Desça para o Rápido para uma passagem mais barata quando puder abrir mão de algum detalhe.
- **Use o Foco da análise.** Aponte a análise para o que importa na sua recriação: fotos de produtos, texto na tela ou um personagem.
- **Confira a análise antes de gastar.** Conecte o resultado ao [**Auditoria com IA** (AI Audit)](https://nodaro.ai/docs/nodes/video/ai-audit), que assiste ao vídeo de novo e corrige só o que a filmagem confirma, antes de gerar todas as cenas.
- **Renderize a partir de `visualResolved`.** Use `visual` e `slotRefs` só se você montar a sua própria etapa para escalar de novo.

## Pela API
A mesma análise está disponível para código e para assistentes de IA. O resultado completo também fica guardado na saída do job. A origem é `videoUrl` ou `youtubeUrl`, e as configurações correspondem a `llmModel` (o nível de qualidade), `selectionMode`, `variations`, `translateSpeechToEnglish`, `translateOnScreenTextToEnglish` e `analysisFocus`. Veja [Executar um único nó](https://nodaro.ai/docs/developers/api/nodes) e as [ferramentas MCP](https://nodaro.ai/docs/mcp/tools).

## Frequently asked questions

### Qual “Qualidade da análise” devo escolher?

O “Pro”, o padrão, serve para a maioria das análises. Escolha “Rápido” para uma passagem mais barata e mais rápida, “Inteligente” para a maior precisão quando a lista de tomadas vai guiar uma nova geração, e “Misto” quando quiser a análise mais completa.

### Quantos créditos o “Análise de vídeo” custa?

O preço depende da “Qualidade da análise” e da duração do vídeo, em faixas de até 60, 180, 360 e 600 segundos. Por exemplo, um vídeo de 45 segundos custa 200 créditos no “Rápido”, 238 no “Pro” e 455 no “Inteligente”.

### Posso analisar um vídeo do YouTube?

Sim. Cole um link youtube.com ou youtu.be em “URL do YouTube” ou conecte à entrada “Vídeo” um nó “Texto” que contenha só o link. Transmissões ao vivo são recusadas, então espere até a gravação ficar disponível. Um vídeo conectado ao nó sempre tem prioridade sobre um link.

### Posso analisar um vídeo do TikTok, Instagram, X ou Facebook?

Sim. Cole o link do post em um nó “URL de vídeo” e conecte esse nó à entrada “Vídeo”. O nó busca o vídeo primeiro, então o preço da análise é definido pela duração do vídeo. Um nó “Texto” que contenha só o link também funciona, mas o “Análise de vídeo” não consegue ler a duração desse link antes de a execução começar, então o botão “Executar” dele mostra o preço da faixa de 600 segundos. O preço da execução em si é definido pela duração que ela lê quando começa.

### Qual pode ser a duração do vídeo?

Até 10 minutos. Vídeos de até 3 minutos são analisados em uma passagem, e vídeos mais longos, em janelas sobrepostas que são mescladas em um único resultado.

### Como recrio o vídeo analisado?

Conecte a saída “Texto” ao prompt do “Gerar vídeo Pro”. A opção “Elenco automático pela análise” desse nó usa os quadros que a análise escolheu para cada pessoa e objeto, então a recriação mantém a aparência deles igual à do original.
