Formatos e fontes de dados: HTML, XML, JSON, APIs e bancos de dados.
Scraping, parsing e crawling: em que esses processos se diferenciam, como se relacionam entre si e por que são confundidos com tanta frequência.
Parsing de feeds RSS e Atom: estrutura dos formatos, bibliotecas prontas para usar e monitoramento de notícias e blogs sem rastrear páginas.
Como trabalhar com XML em diferentes linguagens: DOM versus SAX, XPath, namespaces e leitura em fluxo de arquivos grandes sem estourar a memória.
Parsing de URL: do que se compõe um endereço, como decompor e montar links e como lidar com parâmetros de consulta e codificação em várias linguagens.
Análise de arquivos de texto: leitura linha a linha de grandes volumes, codificações, expressões regulares e exemplos em várias linguagens de programação.
Por que começar a coleta pelo sitemap.xml: parsing de mapas índice, seleção das URLs necessárias e economia no rastreamento do site antes do scraping.
Extração de texto e tabelas de arquivos PDF: camadas de texto versus digitalizações, OCR com Tesseract e exemplos de código em Python, JavaScript e Java.
Parsing de logs de servidores e aplicações: formatos dos logs de acesso e de erros, expressões regulares, ferramentas prontas e exemplos de análise.
Parsing de JSON em detalhe: estruturas aninhadas, streaming de arquivos grandes, JSONPath e os erros típicos ao trabalhar com APIs.