Recursos · Blog

Blog sobre coleta de dados

Guias, estudos e casos de sucesso sobre web scraping, monitoramento de preços e entrega de dados para demandas de análise, marketing e produto.

Tecnologias e proteções
Proteção anti-scraping: como funcionam os sistemas anti-bot modernos

Como funcionam os sistemas anti-bot modernos: fingerprinting, análise de comportamento, captchas e o que tudo isso implica para os donos de sites.

7 maio · 14 min
Formatos e fontes de dados
Scraping, parsing e crawling: quais as diferenças?

Scraping, parsing e crawling: em que esses processos se diferenciam, como se relacionam entre si e por que são confundidos com tanta frequência.

5 maio · 8 min
Guia geral de web scraping
Como coletar dados de um site: guia completo para não especialistas

Como coletar dados de sites sem ser programador: da cópia manual e das extensões ao web scraping sob encomenda, entregue pronto para uso.

3 maio · 12 min
Scraping por linguagem
Web scraping em Ruby: guia completo do simples ao complexo

Web scraping em Ruby: Nokogiri, HTTParty, Mechanize e Watir, da análise de páginas estáticas à automação do navegador.

1 maio · 30 min
Formatos e fontes de dados
Parsing de RSS: como extrair dados dos feeds e para que serve

Parsing de feeds RSS e Atom: estrutura dos formatos, bibliotecas prontas para usar e monitoramento de notícias e blogs sem rastrear páginas.

29 abril · 7 min
Tecnologias e proteções
Expressões regulares para o parsing: sintaxe, padrões e limites

Expressões regulares no parsing de dados: sintaxe básica, padrões úteis, limites de aplicação e por que o HTML exige um parser de verdade, e não regex.

27 abril · 8 min
Tecnologias e proteções
Proxies para web scraping: guia completo de tipos, privacidade e detecção

Guia de proxies para web scraping: datacenter, residenciais e móveis, rotação, verificação de privacidade e proteção contra a detecção.

25 abril · 14 min
Scraping por linguagem
Web scraping em PHP com navegador

Controle de um navegador real a partir do PHP: Symfony Panther, chrome-php e Selenium para scrapear sites dinâmicos com JavaScript sem sair do stack PHP.

23 abril · 12 min
Formatos e fontes de dados
Parsing de XML: bibliotecas, XPath e exemplos em várias linguagens

Como trabalhar com XML em diferentes linguagens: DOM versus SAX, XPath, namespaces e leitura em fluxo de arquivos grandes sem estourar a memória.

21 abril · 5 min