SEO Agência de SEO

Construção de um sistema sob medida para detectar domínios de confiança

Unificamos as listas de domínios expirados de dezenas de plataformas em um único fluxo, enriquecido com métricas, idade e histórico: a agência avalia os candidatos em uma única interface em vez de percorrer as fontes manualmente.

A tarefa

A agência precisava encontrar domínios de confiança entre os que estão sendo liberados (drops) — com boas métricas, idade respeitável e histórico limpo — para depois capturá-los e utilizá-los. As listas de drops estão espalhadas por dezenas de plataformas, os formatos variam e os volumes são enormes: cobrir isso manualmente é inviável.

O que fizemos e quais dados coletamos

Reunimos a lista de plataformas que publicam listas de domínios expirados e drops — GoDaddy, DropCatch, SnapNames, nicsell, Dynadot, Kifdom, Sav, UKBackorder, Catched, park.io, Namecheap, NameSilo, Gname, Aftermarket, Domainlore.uk e outras — e organizamos a coleta regular de suas exportações em um fluxo único.

Depois, o enriquecimento. Trouxemos as datas de drop para um fuso único, para saber quando o domínio é liberado de fato. Complementamos as métricas pelas APIs do Ahrefs e do Moz (autoridade e perfil de links), puxamos o WHOIS para idade e histórico de registro e, para os domínios pré-selecionados, adicionamos os dados do arquivo da web — para ver o que era hospedado antes no domínio e em que idioma era o site. Além disso, construímos uma interface na qual os analistas da agência fazem a pontuação manual final sobre candidatos já coletados e enriquecidos.

O projeto foi estruturado como busca e enriquecimento de dados sobre uma base de dados de domínios, com entrega em uma interface prática e exportações (DaaS).

Dificuldades e como as resolvemos

A principal: a escala. Centenas de milhares de domínios expiram todos os dias, e rodar o pacote completo de verificações em todos não faz sentido. Montamos um pipeline: primeiro coletamos e deduplicamos as listas de domínios expirados, depois enriquecemos com métricas, e as etapas caras (arquivo da web) rodam apenas para os domínios pré-selecionados que passaram do primeiro filtro. O processo roda diariamente.

A segunda: a heterogeneidade das fontes. Cada plataforma tem seu formato de lista e seu jeito de indicar a data e a hora do drop. Trouxemos tudo para um esquema único e um horário único; sobre a padronização, veja nosso artigo de normalização de dados.

A terceira — e decisiva: descartar os domínios com passado "sujo", os que já expiraram antes e hospedaram spam. Pelas métricas, um domínio desses pode parecer atraente, mas na prática está queimado. Verificamos o histórico pelo arquivo da web e pelos sinais de drops anteriores, para que esses candidatos não passassem adiante. O trabalho com APIs externas (Ahrefs, Moz, WHOIS) também ajudou no enriquecimento rápido.

Vale registrar: essas plataformas não têm proteção contra coleta — a tarefa não era contornar bloqueios, e sim escala e qualidade dos dados.

O resultado

A agência obteve um fluxo diário único de domínios em drop, enriquecido com métricas, idade e histórico, e uma interface para a pontuação manual: a avaliação dos candidatos acontece em um só lugar, em vez de percorrer dezenas de plataformas e conferir métricas manualmente.


Serviços usados neste caso: Busca e enriquecimento de dados · Base de dados de domínios · DaaS e dados via API · Dados para SEO e busca

Materiais úteis: Enriquecimento de dados · Normalização de dados · Extração de dados via API