A tarefa
Os dados do grupo estavam espalhados por várias dezenas de fontes — sites, exportações, formatos e estruturas diferentes. Era preciso um único feed XML de formato homogêneo, atualizado regularmente, que pudesse ser entregue aos sistemas conectados sem remontagem manual.
O que fizemos e quais dados coletamos
Coletamos os dados de todas as fontes — sites, arquivos e exportações de formatos diversos — e os levamos a um esquema único. Além disso, montamos a geração do feed XML final com validação e atualização regular, e a entrega foi organizada como DaaS / dados via API.
Dificuldades e como as resolvemos
A principal: a heterogeneidade. Várias dezenas de fontes são dezenas de estruturas: aqui JSON, ali tabelas e CSV, acolá documentos, às vezes apenas páginas web. Descrevemos um esquema-alvo único e mapeamos cada fonte para ele.
A segunda: a atualidade. As fontes se atualizam em ritmos diferentes, então a coleta seguia um cronograma e as mudanças eram captadas automaticamente.
A terceira: a integridade do feed. O XML final era validado estruturalmente antes da publicação e deduplicado, para que os consumidores do feed não recebessem registros quebrados ou duplicados.
O resultado
O grupo obteve um feed XML único, montado automaticamente e conforme o cronograma a partir de dezenas de fontes — em vez da consolidação manual de exportações dispersas.
Serviços usados neste caso: DaaS e dados via API · Extração de dados web · Monitoramento de mudanças em sites e dados
Materiais úteis: Parsing de XML · Parsing de JSON · Parsing de documentos · Normalização de dados