Scraping por linguagem 3 min de leitura

Scraper de tags title, description e cabeçalhos H1–H6: revisão em massa de metadados

Revisão em massa de title, description e cabeçalhos H1–H6 em todo o site: por que o especialista em SEO precisa dela e como automatizar a coleta.

EW
Equipe Web-Scraping.biz
Coleta de dados para as demandas do negócio
Publicado: 17 janeiro 2025

O title, a description e os cabeçalhos H1--H6 são os elementos pelos quais o buscador entende do que trata uma página e pelos quais o usuário decide se clica no snippet. Em um site de centenas ou milhares de páginas, é impossível revisá-los à mão: aqui o title está vazio, ali ele se repete em dezenas de páginas, em outro ponto falta o H1 ou os cabeçalhos quebram a hierarquia. Um scraper de tags reúne todos os metadados do site em uma única tabela, e os problemas saltam aos olhos de imediato.

Este artigo faz parte da série sobre web scraping em SEO. Vejamos o que se coleta, para quê e com quais ferramentas.

O que um scraper de metadados coleta

Ao percorrer o site, para cada URL o scraper extrai:

  • Title — o título da página para a aba do navegador e o snippet.
  • Description — a metadescrição.
  • H1 — o cabeçalho principal da página.
  • H2--H6 — os subtítulos e sua hierarquia.
  • O comprimento das tags, para detectar as curtas demais e as que são cortadas nos resultados de busca.

Em essência, é o mesmo percurso de rastrear a estrutura do site: uma única passada do crawler produz, ao mesmo tempo, a árvore de seções e a tabela de metadados. Por isso tags, titles e cabeçalhos costumam ser coletados com os mesmos programas que a estrutura.

Quais problemas se buscam

Titles e descriptions duplicados. Metatags idênticas em páginas diferentes são uma causa frequente de páginas competindo entre si e se posicionando pior. O scraper detecta todas as repetições na hora.

Tags vazias ou ausentes. Páginas sem title ou sem H1 perdem relevância. Na tabela, elas se destacam de imediato pelas células vazias.

Sobreotimização e comprimento. Titles longos demais são cortados nos resultados, e cabeçalhos saturados de palavras-chave podem acarretar penalizações. A exportação com os comprimentos ajuda a colocar ordem na casa.

Hierarquia de cabeçalhos quebrada. Vários H1 em uma mesma página, níveis pulados, um H2 antes do H1: erros estruturais de marcação que atrapalham tanto o robô quanto a acessibilidade.

O resultado dessa auditoria é uma pauta de tarefas para reescrever as metatags: quais páginas corrigir, onde eliminar duplicidades e onde completar o que falta.

Com que ferramentas scrapear tags e cabeçalhos

Screaming Frog SEO Spider é a ferramenta de referência. Em um rastreamento normal do site, ele já coleta titles, descriptions e cabeçalhos e marca os duplicados, os valores vazios e os longos demais. Com a extração personalizada (Custom Extraction via XPath ou expressões regulares), dá para extrair também elementos fora do padrão — por exemplo, todas as tags <strong> ou o conteúdo de um bloco específico.

As auditorias de site de plataformas como Ahrefs (Site Audit) e SEMrush também registram os titles durante o rastreamento e permitem localizar duplicados e páginas sem cabeçalho.

Um cenário à parte é coletar tags e cabeçalhos não do próprio site, mas dos resultados de busca ou dos sites dos concorrentes. Muitos otimizam suas metatags para se posicionar bem; assim, nos title, description e H1--H6 alheios encontram-se frases-chave já lapidadas e ideias para o plano de conteúdo. Para isso são práticos o modo lista do Screaming Frog (recebe uma lista de URLs dos concorrentes e devolve seus metadados) e os relatórios de análise de SERP do Ahrefs ou do SEMrush, que mostram com quais titles competem os resultados do top do Google. Aqui já há sobreposição com a tarefa de coletar palavras-chave: os cabeçalhos dos concorrentes são uma boa fonte de consultas que passaram despercebidas.

Como isso se encaixa no restante do trabalho

O scraping de tags é o diagnóstico da parte de conteúdo do site, em dupla com o diagnóstico técnico via rastreamento da estrutura. Para reescrever bem as metatags são necessárias palavras-chave, e quem as fornece são o levantamento de palavras-chave, as sugestões do Google e o Google Keyword Planner. E, após as mudanças, o efeito é controlado com o acompanhamento de posições.

Se a tarefa não é analisar as tags de sites específicos, mas os snippets e títulos diretamente do top dos resultados, isso é a extração da SERP do Google, um serviço à parte da nossa agência.