Rastrear a estrutura de um site consiste em percorrer automaticamente todas as suas páginas com um programa rastreador (crawler) e construir a árvore completa de seções e URLs. O crawler se comporta como o robô de um buscador: segue os links internos e registra cada página, seu código de resposta, seu nível de profundidade e as relações entre as seções. No final, você enxerga o site tal como o Google o vê — com todos os seus duplicados, links quebrados e páginas «órfãs».
Este material faz parte da nossa série sobre web scraping em SEO. Vejamos para que serve esse percurso, o que ele mostra e com quais programas é feito.
Para que rastrear a estrutura
Um site de centenas de milhares de páginas não se revisa à mão. E são justamente os problemas estruturais que mais frequentemente travam o posicionamento: o robô gasta o orçamento de rastreamento em duplicados e URLs de lixo, as páginas importantes ficam no quinto nível de profundidade e são mal indexadas, os links internos levam a erros 404. O rastreamento da estrutura responde a estas perguntas:
- Quantas páginas reais o site tem e como elas se distribuem entre as seções.
- Quais páginas devolvem erros (404, 5xx) e para onde levam os redirecionamentos.
- Onde se formaram duplicados de URL e de conteúdo.
- A que profundidade estão «enterradas» as seções importantes (nível de aninhamento).
- Como está montada a estrutura de links internos e se existem páginas «soltas».
Esses dados servem de base para uma especificação técnica de melhorias e ajudam a desenhar uma estrutura lógica e plana, confortável tanto para o usuário quanto para o robô.
O que o crawler coleta
Durante o percurso, para cada URL o programa registra o código de resposta do servidor, o próprio endereço, o nível de profundidade, os links internos de entrada e de saída e, de passagem, os metadados da página: title, description, cabeçalhos. Na essência, o rastreamento da estrutura e o scraping de tags e cabeçalhos são feitos em uma mesma passada: você obtém ao mesmo tempo a árvore do site e a tabela de metadados.
Um ponto forte à parte dos crawlers modernos é a construção da árvore visual. Dá para ver a estrutura de forma gráfica, avaliar a distribuição das páginas por níveis e localizar de imediato as anomalias: seções infladas, ramos sem saída, páginas sem links de entrada.
Com que rastrear a estrutura: panorama de programas
Screaming Frog SEO Spider — o padrão mundial. Varre o site seguindo os links internos, coleta metadados, códigos de resposta e a malha de links internos, e constrói a estrutura. Sabe visualizar a árvore de várias maneiras (Crawl Tree Graph, Directory Tree e outras), executar JavaScript para rastrear sites JS e extrair dados arbitrários por XPath com a seção Custom Extraction. Inclui um modo de comparação de dois rastreamentos — prático para acompanhar as mudanças depois das melhorias. A versão gratuita rastreia até 500 URLs, o suficiente para auditar um site pequeno.
Sitebulb — um crawler de desktop voltado a auditorias: acompanha cada problema detectado com explicações e se destaca pelas visualizações da estrutura, com mapas de rastreamento que tornam evidentes as seções superdimensionadas e os ramos isolados. Boa opção quando o relatório também precisa ser entendido por alguém não técnico.
Ahrefs Site Audit e SEMrush Site Audit — rastreadores em nuvem dentro das grandes plataformas de SEO. Não exigem instalar nada, permitem agendar rastreamentos periódicos e cruzam os problemas técnicos detectados com os demais dados da plataforma (posições, links). Convêm quando você já trabalha em um desses serviços.
Google Search Console — não é um crawler, mas complementa o rastreamento: seu relatório de indexação mostra quais das páginas encontradas pelo crawler estão de fato no índice do Google e quais ficaram de fora, e por qual motivo.
A escolha se resume ao alcance e ao orçamento: para auditorias pontuais de sites pequenos, basta a versão gratuita do Screaming Frog; para o trabalho regular com projetos grandes, adotam-se a licença completa, o Sitebulb ou os rastreadores em nuvem.
Rastrear a estrutura dos sites dos concorrentes
O crawler pode ser lançado não só sobre o próprio site, mas também sobre o de um concorrente — por exemplo, para baixar a estrutura de um grande catálogo ou de uma loja online. Por meio de consultas XPath (digamos, sobre a marcação das migalhas de pão) coleta-se a árvore de categorias, o que ajuda a desenhar a estrutura própria e a descobrir seções deixadas de lado. É uma tarefa vizinha da coleta de palavras-chave: a estrutura do concorrente sugere quais grupos de consultas você ainda não cobriu.
Se o que você precisa entender não é a estrutura de um site específico, mas quem ocupa o topo para as suas consultas, isso já é a extração da SERP do Google — um serviço à parte da nossa agência.