Docs do Nodaro
DocumentaçãoReferência de nósModelosAgentes de IA (MCP)DesenvolvedoresSelf-hostingPesquisa
Automatizar

Extrair da web

Busque resultados do Google, o texto de uma página ou site, itens de feeds RSS ou Atom ou posts do TikTok, e envie tudo em JSON para nós de IA e de lista.

O nó Extrair da web (Web Scrape) busca conteúdo na web e o retorna como uma lista de itens em JSON. Ele tem quatro origens: resultados de pesquisa do Google, o texto de uma página da web ou de um site inteiro, os itens de um feed RSS ou Atom e os posts recentes de um perfil do TikTok. Conecte o resultado a um nó Prompt para resumi-lo ou reescrevê-lo, ou ao Extrair campo (Extract Field) para executar uma geração por item.

Quando usar

  • Trazer os resultados de pesquisa de uma palavra-chave para um workflow de conteúdo.
  • Ler uma página da web ou um site em Markdown e deixar um nó Prompt resumir o texto ou extrair fatos dele.
  • Ler os itens mais novos de um site de notícias, de um blog ou de um canal do YouTube, com agendamento.
  • Coletar os posts recentes de um perfil do TikTok para análise ou para novas ideias.

Início rápido

Adicionar o nó

Pressione Tab no canvas e escolha Automatizar › Coleta de conteúdo › Extrair da web.

Escolher uma origem

Abra o painel de configurações, escolha uma Origem e preencha os campos dela, por exemplo uma Consulta para o Google Search. O botão Executar mostra o preço dessa origem.

Executar

Clique em Executar. Os primeiros itens aparecem no nó, e a aba Resultados do painel de configurações lista todos eles.

Usar os itens

Conecte a saída JSON a um nó Prompt, que lê o JSON como texto, ou ao Extrair campo para tirar um campo de cada item. No nó Prompt, deixe o Prompt do usuário vazio e escreva a tarefa em Instruções (prompt do sistema).

promptGatilho agendadoDiário, 9hExtrair da webFeed RSSPromptResuma as notíciasPublicar no Telegram
Toda manhã, o Gatilho agendado executa o workflow inteiro: o Extrair da web lê um feed de notícias, um nó Prompt escreve um resumo e o Publicar no Telegram envia esse resumo para um canal.

Origens

OrigemO que retornaCampos
Google SearchAté 10 resultados de pesquisa para uma consultaConsulta. Máximo de resultados, de 1 a 10, padrão 5. Código do país, um código de 2 letras como us, para adaptar os resultados a um país.
Conteúdo do site (Markdown)O texto de uma página, ou de até 20 páginas de um site, em MarkdownURL inicial, o endereço como você o digita em um navegador. O https:// é opcional. Modo de rastreamento: Página única (o padrão) ou Rastreamento do site, até 20 páginas, que segue os links do site a partir do endereço inicial.
Feed RSSOs itens de um feed RSS ou AtomURL do feed, com ou sem https://. Limite de resultados, de 1 a 50, padrão 10.
TikTokOs posts recentes de um perfil, ou um único postURL do perfil ou do post, com ou sem https://. Limite de resultados, de 1 a 20, padrão 10.

Todo campo de texto aceita {}. Quando um nó está conectado à entrada URL / pesquisa, o texto dele substitui {}. Assim, um nó Texto (Text) ou Lista (List) pode definir a consulta ou o endereço.

Feeds RSS e Atom

A origem Feed RSS lê os dois formatos de feed: RSS 2.0, com as versões mais antigas 0.9x e 1.0, e Atom. Isso inclui os feeds de canais do YouTube (https://www.youtube.com/feeds/videos.xml?channel_id=...), os feeds releases.atom do GitHub e os feeds que a maioria das plataformas de blog publica.

Todo item tem os mesmos cinco campos, qualquer que seja o formato do feed:

CampoContém
titleO título do item
urlO link do item. Fica vazio quando o item não tem link.
descriptionO resumo ou o conteúdo do item. Pode conter HTML.
pubDateA data de publicação, no formato ISO 8601 quando a data pode ser lida
guidO ID único do item, ou o link dele quando não tem ID

Quando o servidor do feed tem um problema temporário, o nó tenta de novo, com até três requisições em 30 segundos. Uma execução que esgota o tempo falha com o erro “RSS fetch timed out”. Um endereço que retorna algo que não é um feed, como uma página da web ou uma página de erro, faz a execução falhar. O erro diz o que o endereço retornou.

Resultados

Depois de uma execução, o nó mostra os primeiros itens. A aba Resultados do painel de configurações lista todos os itens, com as visualizações Lista e JSON bruto e os botões Copiar JSON e Baixar JSON. Cada item tem um link para a sua fonte, como a página do resultado de pesquisa, o item do feed ou o vídeo do TikTok. Confira um resultado lá antes de usá-lo como base.

A saída, JSON, é a lista de itens. Três formas comuns de usá-la:

  • Resumir ou reescrever. Conecte a saída à entrada Prompt de um nó Prompt. O JSON chega como texto. Deixe o Prompt do usuário vazio, para que o JSON seja o pedido, e escreva a tarefa em Instruções (prompt do sistema).
  • Pegar um campo. Conecte a saída ao Extrair campo, por exemplo para obter o title de cada item do feed como uma lista.
  • Executar uma vez por item. Envie a lista de valores extraídos para um nó de geração, que é executado uma vez para cada valor. Veja Listas e lotes.

Créditos

OrigemCréditos por execução
Google Search33
Conteúdo do site, página única11
Conteúdo do site, rastreamento do site55
Feed RSS11
TikTok11

O botão Executar no nó, o preço ao lado de cada modo de rastreamento e o total da execução de um workflow mostram o preço que você paga.

  • Uma execução que falha é reembolsada por completo.
  • Uma execução que não encontra nada é cobrada. Ela foi concluída, então custa o preço da origem, e o nó guarda o último resultado bom ao lado do vazio. Na origem Feed RSS, um feed real sem itens conta como não encontrar nada.

Rastreamentos longos

Um rastreamento de site segue até 20 páginas e muitas vezes leva vários minutos. No editor e na execução de um workflow, você não precisa fazer nada. O nó espera, e as páginas aparecem no nó quando o rastreamento termina. Se você reabrir o workflow depois que o rastreamento terminou em segundo plano, o resultado também estará lá.

Em uma instalação self-hosted, as origens Google Search, Conteúdo do site e TikTok precisam da chave de web scraping descrita em Chaves de provedor ou de uma conexão com o Nodaro Cloud. A origem Feed RSS não precisa de nenhuma das duas.

Dicas

  • Comece com uma página. Use Página única para conferir se um site retorna um texto útil antes de pagar por um Rastreamento do site.
  • Consulte periodicamente, com agendamento. Adicione um Gatilho agendado (Schedule Trigger) ao workflow para ter um resumo diário ou um workflow movido a notícias.
  • Guarde só o que você precisa. Extraia um campo, como title, antes de um nó que é executado uma vez por item, para que cada execução receba um texto curto e limpo.

Pela API

POST /v1/web-scrape executa o nó por código. Um rastreamento de site pode levar mais tempo que o limite de cerca de 100 segundos de uma única requisição HTTP, então envie "respondAsync": true nos rastreamentos. A chamada responde na hora com um jobId, e você lê as páginas do job concluído com GET /v1/jobs/:id. Sem a flag, a requisição fica aberta até a extração terminar. Um rastreamento que dura mais que o limite da requisição tem a resposta cortada no caminho de volta, embora o job seja concluído e cobrado. Veja Executar um único nó e Jobs.

Perguntas frequentes

Última atualização

Nesta página