Extrair da web
Busque resultados do Google, o texto de uma página ou site, itens de feeds RSS ou Atom ou posts do TikTok, e envie tudo em JSON para nós de IA e de lista.
O nó Extrair da web (Web Scrape) busca conteúdo na web e o retorna como uma lista de itens em JSON. Ele tem quatro origens: resultados de pesquisa do Google, o texto de uma página da web ou de um site inteiro, os itens de um feed RSS ou Atom e os posts recentes de um perfil do TikTok. Conecte o resultado a um nó Prompt para resumi-lo ou reescrevê-lo, ou ao Extrair campo (Extract Field) para executar uma geração por item.
Quando usar
- Trazer os resultados de pesquisa de uma palavra-chave para um workflow de conteúdo.
- Ler uma página da web ou um site em Markdown e deixar um nó Prompt resumir o texto ou extrair fatos dele.
- Ler os itens mais novos de um site de notícias, de um blog ou de um canal do YouTube, com agendamento.
- Coletar os posts recentes de um perfil do TikTok para análise ou para novas ideias.
Início rápido
Adicionar o nó
Pressione Tab no canvas e escolha Automatizar › Coleta de conteúdo › Extrair da web.
Escolher uma origem
Abra o painel de configurações, escolha uma Origem e preencha os campos dela, por exemplo uma Consulta para o Google Search. O botão Executar mostra o preço dessa origem.
Executar
Clique em Executar. Os primeiros itens aparecem no nó, e a aba Resultados do painel de configurações lista todos eles.
Usar os itens
Conecte a saída JSON a um nó Prompt, que lê o JSON como texto, ou ao Extrair campo para tirar um campo de cada item. No nó Prompt, deixe o Prompt do usuário vazio e escreva a tarefa em Instruções (prompt do sistema).
Origens
| Origem | O que retorna | Campos |
|---|---|---|
| Google Search | Até 10 resultados de pesquisa para uma consulta | Consulta. Máximo de resultados, de 1 a 10, padrão 5. Código do país, um código de 2 letras como us, para adaptar os resultados a um país. |
| Conteúdo do site (Markdown) | O texto de uma página, ou de até 20 páginas de um site, em Markdown | URL inicial, o endereço como você o digita em um navegador. O https:// é opcional. Modo de rastreamento: Página única (o padrão) ou Rastreamento do site, até 20 páginas, que segue os links do site a partir do endereço inicial. |
| Feed RSS | Os itens de um feed RSS ou Atom | URL do feed, com ou sem https://. Limite de resultados, de 1 a 50, padrão 10. |
| TikTok | Os posts recentes de um perfil, ou um único post | URL do perfil ou do post, com ou sem https://. Limite de resultados, de 1 a 20, padrão 10. |
Todo campo de texto aceita {}. Quando um nó está conectado à entrada URL / pesquisa, o texto dele substitui {}. Assim, um nó Texto (Text) ou Lista (List) pode definir a consulta ou o endereço.
Feeds RSS e Atom
A origem Feed RSS lê os dois formatos de feed: RSS 2.0, com as versões mais antigas 0.9x e 1.0, e Atom. Isso inclui os feeds de canais do YouTube (https://www.youtube.com/feeds/videos.xml?channel_id=...), os feeds releases.atom do GitHub e os feeds que a maioria das plataformas de blog publica.
Todo item tem os mesmos cinco campos, qualquer que seja o formato do feed:
| Campo | Contém |
|---|---|
title | O título do item |
url | O link do item. Fica vazio quando o item não tem link. |
description | O resumo ou o conteúdo do item. Pode conter HTML. |
pubDate | A data de publicação, no formato ISO 8601 quando a data pode ser lida |
guid | O ID único do item, ou o link dele quando não tem ID |
Quando o servidor do feed tem um problema temporário, o nó tenta de novo, com até três requisições em 30 segundos. Uma execução que esgota o tempo falha com o erro “RSS fetch timed out”. Um endereço que retorna algo que não é um feed, como uma página da web ou uma página de erro, faz a execução falhar. O erro diz o que o endereço retornou.
Resultados
Depois de uma execução, o nó mostra os primeiros itens. A aba Resultados do painel de configurações lista todos os itens, com as visualizações Lista e JSON bruto e os botões Copiar JSON e Baixar JSON. Cada item tem um link para a sua fonte, como a página do resultado de pesquisa, o item do feed ou o vídeo do TikTok. Confira um resultado lá antes de usá-lo como base.
A saída, JSON, é a lista de itens. Três formas comuns de usá-la:
- Resumir ou reescrever. Conecte a saída à entrada Prompt de um nó Prompt. O JSON chega como texto. Deixe o Prompt do usuário vazio, para que o JSON seja o pedido, e escreva a tarefa em Instruções (prompt do sistema).
- Pegar um campo. Conecte a saída ao Extrair campo, por exemplo para obter o
titlede cada item do feed como uma lista. - Executar uma vez por item. Envie a lista de valores extraídos para um nó de geração, que é executado uma vez para cada valor. Veja Listas e lotes.
Créditos
| Origem | Créditos por execução |
|---|---|
| Google Search | 33 |
| Conteúdo do site, página única | 11 |
| Conteúdo do site, rastreamento do site | 55 |
| Feed RSS | 11 |
| TikTok | 11 |
O botão Executar no nó, o preço ao lado de cada modo de rastreamento e o total da execução de um workflow mostram o preço que você paga.
- Uma execução que falha é reembolsada por completo.
- Uma execução que não encontra nada é cobrada. Ela foi concluída, então custa o preço da origem, e o nó guarda o último resultado bom ao lado do vazio. Na origem Feed RSS, um feed real sem itens conta como não encontrar nada.
Rastreamentos longos
Um rastreamento de site segue até 20 páginas e muitas vezes leva vários minutos. No editor e na execução de um workflow, você não precisa fazer nada. O nó espera, e as páginas aparecem no nó quando o rastreamento termina. Se você reabrir o workflow depois que o rastreamento terminou em segundo plano, o resultado também estará lá.
Em uma instalação self-hosted, as origens Google Search, Conteúdo do site e TikTok precisam da chave de web scraping descrita em Chaves de provedor ou de uma conexão com o Nodaro Cloud. A origem Feed RSS não precisa de nenhuma das duas.
Dicas
- Comece com uma página. Use Página única para conferir se um site retorna um texto útil antes de pagar por um Rastreamento do site.
- Consulte periodicamente, com agendamento. Adicione um Gatilho agendado (Schedule Trigger) ao workflow para ter um resumo diário ou um workflow movido a notícias.
- Guarde só o que você precisa. Extraia um campo, como
title, antes de um nó que é executado uma vez por item, para que cada execução receba um texto curto e limpo.
Pela API
POST /v1/web-scrape executa o nó por código. Um rastreamento de site pode levar mais tempo que o limite de cerca de 100 segundos de uma única requisição HTTP, então envie "respondAsync": true nos rastreamentos. A chamada responde na hora com um jobId, e você lê as páginas do job concluído com GET /v1/jobs/:id. Sem a flag, a requisição fica aberta até a extração terminar. Um rastreamento que dura mais que o limite da requisição tem a resposta cortada no caminho de volta, embora o job seja concluído e cobrado. Veja Executar um único nó e Jobs.
Perguntas frequentes
Páginas relacionadas
Prompt
Extrair campo
Gatilho agendado
Lista
Automações
Última atualização
Gatilho do Telegram
Inicie um workflow sempre que o seu bot do Telegram receber uma mensagem e passe o texto, a foto, o vídeo ou o áudio da mensagem para os nós seguintes.
URL de vídeo
Transforme links do YouTube, TikTok, Instagram, Facebook e X em arquivos de vídeo para cortar, legendar, analisar e remixar. Baixe parte de vídeos longos.