Tecnologias e proteções: sites dinâmicos, sistemas anti-bots, proxies e como contornar bloqueios.
Como funcionam os sistemas anti-bot modernos: fingerprinting, análise de comportamento, captchas e o que tudo isso implica para os donos de sites.
Expressões regulares no parsing de dados: sintaxe básica, padrões úteis, limites de aplicação e por que o HTML exige um parser de verdade, e não regex.
Guia de proxies para web scraping: datacenter, residenciais e móveis, rotação, verificação de privacidade e proteção contra a detecção.
Scraping de sites com autenticação: cookies e sessões, tokens, CSRF e exemplos de como fazer login a partir do código em Python, Node.js, PHP e Go.
Selenium para o scraping de sites dinâmicos: configuração de drivers, esperas, como evitar a detecção de automação e quando optar por uma API.
Duas formas de fazer scraping de sites dinâmicos: engenharia reversa das requisições XHR à API e navegadores headless — vantagens, desvantagens e critérios de escolha.
O que é enriquecimento de dados: quais atributos são adicionados a empresas, produtos e contatos, de onde eles vêm e como funciona no nível técnico.
O termo «normalização de dados» tem três sentidos: bancos de dados relacionais, machine learning e limpeza de dados extraídos por scraping. Analisamos cada um.
O que é um parser do DOM e como funciona por dentro: construção da árvore do documento, navegação pelos nós e diferenças em relação às abordagens em fluxo e com regex.