A tarefa
A agência precisava encontrar domínios de confiança entre os que estão sendo liberados (drops) — com boas métricas, idade respeitável e histórico limpo — para depois capturá-los e utilizá-los. As listas de drops estão espalhadas por dezenas de plataformas, os formatos variam e os volumes são enormes: cobrir isso manualmente é inviável.
O que fizemos e quais dados coletamos
Reunimos a lista de plataformas que publicam listas de domínios expirados e drops — GoDaddy, DropCatch, SnapNames, nicsell, Dynadot, Kifdom, Sav, UKBackorder, Catched, park.io, Namecheap, NameSilo, Gname, Aftermarket, Domainlore.uk e outras — e organizamos a coleta regular de suas exportações em um fluxo único.
Depois, o enriquecimento. Trouxemos as datas de drop para um fuso único, para saber quando o domínio é liberado de fato. Complementamos as métricas pelas APIs do Ahrefs e do Moz (autoridade e perfil de links), puxamos o WHOIS para idade e histórico de registro e, para os domínios pré-selecionados, adicionamos os dados do arquivo da web — para ver o que era hospedado antes no domínio e em que idioma era o site. Além disso, construímos uma interface na qual os analistas da agência fazem a pontuação manual final sobre candidatos já coletados e enriquecidos.
O projeto foi estruturado como busca e enriquecimento de dados sobre uma base de dados de domínios, com entrega em uma interface prática e exportações (DaaS).
Dificuldades e como as resolvemos
A principal: a escala. Centenas de milhares de domínios expiram todos os dias, e rodar o pacote completo de verificações em todos não faz sentido. Montamos um pipeline: primeiro coletamos e deduplicamos as listas de domínios expirados, depois enriquecemos com métricas, e as etapas caras (arquivo da web) rodam apenas para os domínios pré-selecionados que passaram do primeiro filtro. O processo roda diariamente.
A segunda: a heterogeneidade das fontes. Cada plataforma tem seu formato de lista e seu jeito de indicar a data e a hora do drop. Trouxemos tudo para um esquema único e um horário único; sobre a padronização, veja nosso artigo de normalização de dados.
A terceira — e decisiva: descartar os domínios com passado "sujo", os que já expiraram antes e hospedaram spam. Pelas métricas, um domínio desses pode parecer atraente, mas na prática está queimado. Verificamos o histórico pelo arquivo da web e pelos sinais de drops anteriores, para que esses candidatos não passassem adiante. O trabalho com APIs externas (Ahrefs, Moz, WHOIS) também ajudou no enriquecimento rápido.
Vale registrar: essas plataformas não têm proteção contra coleta — a tarefa não era contornar bloqueios, e sim escala e qualidade dos dados.
O resultado
A agência obteve um fluxo diário único de domínios em drop, enriquecido com métricas, idade e histórico, e uma interface para a pontuação manual: a avaliação dos candidatos acontece em um só lugar, em vez de percorrer dezenas de plataformas e conferir métricas manualmente.
Serviços usados neste caso: Busca e enriquecimento de dados · Base de dados de domínios · DaaS e dados via API · Dados para SEO e busca
Materiais úteis: Enriquecimento de dados · Normalização de dados · Extração de dados via API