Configuramos scrapers de notícias sob medida. Coletamos publicações de sites de mídia, do Google News, do Bing News e de feeds RSS. Entregamos títulos, textos completos, datas, autores e seções. Um fluxo de conteúdo limpo para análise, modelos de ML e newsletters: em arquivo, feed ou via API.
O fluxo de notícias alimenta a análise, os modelos e os produtos. O essencial é recebê-lo limpo, completo e no prazo.
Fluxo de notícias do setor para relatórios, tendências e monitoramento de concorrentes.
Corpus de textos prontos para tarefas de NLP: classificação, sumarização automática, NER.
Feeds de notícias e newsletters dentro dos seus aplicativos, sem montar infraestrutura de coleta.
Notícias de empresas e mercados para sinais de trading e monitoramento de riscos.
Notícias regulatórias e mudanças na legislação do seu setor.
Acompanhamento da pauta jornalística e dos temas em alta para as próprias publicações.
Três modalidades conforme a sua tarefa: extração única, entrega periódica de dados ou solução sob medida. Calculamos o preço com base nas fontes, nos volumes e na frequência de atualização. Enviamos o orçamento antes de começar.
Coletar notícias uma única vez: um arquivo de artigos de um período para pesquisa ou migração.
O scraper roda de forma programada: de exportações semanais a um fluxo em tempo real. Os dados chegam automaticamente.
Dados como serviço de ponta a ponta: acesso via API, DaaS ou uma interface pronta, dezenas de fontes e SLA.
Quanto custa a extração de notícias? O preço se compõe de fatores claros, do número de fontes ao formato de entrega. Enviamos o orçamento e uma amostra do fluxo antes de começar.
Descreva as fontes, os temas e os campos necessários e, em até um dia útil, responderemos com o orçamento, os prazos e um exemplo do fluxo.
A extração de notícias (news scraping) é a coleta automática de publicações de sites de imprensa e agregadores. Um programa percorre as fontes, extrai os artigos e os leva a uma estrutura única. Em vez de revisar dezenas de portais manualmente, você recebe um único fluxo de dados limpo.
As notícias continuam sendo a principal fonte de informação sobre o mercado. O scraper as transforma de páginas dispersas em uma tabela ou um JSON com os quais o analista e o modelo já podem trabalhar.
O que o scraper entrega por artigo:
Extraímos dados do Google News e de lá tiramos a lista de editores: mais de 100 000 veículos digitais em atividade, de grandes redações do nível de Folha de S.Paulo, O Globo e Valor Econômico a portais setoriais de nicho.
Também coletamos o Bing News. Esse agregador da Microsoft cobre melhor a imprensa internacional e serve de verificação cruzada da completude do fluxo.
O que isso garante:
Precisa de uma fonte fora dos agregadores? Adicionamos manualmente: salas de imprensa corporativas, blogs setoriais, portais oficiais. A lista de veículos com os contatos das redações é montada pela base de dados de mídia: é um serviço complementar.
Cada fonte é construída do seu jeito: umas têm feed RSS, outras só páginas comuns e, em outras, o conteúdo é carregado por scripts. Na extração de notícias, a velocidade importa tanto quanto a completude, então cada tipo de fonte tem seu próprio coletor.
O processo é o seguinte:
Também preservamos as metatags e os cabeçalhos da página do artigo: description, Open Graph, links canônicos. As republicações são unificadas e cada artigo fica marcado com o link da fonte original. Na saída não há duplicatas.
Os textos e os metadados passam por validação. Se o site muda o layout, o scraper detecta e nossa equipe de desenvolvimento atualiza as regras de parsing. Para os clientes, o fluxo não é interrompido.
Nem todos os sites entregam o conteúdo facilmente. O scraper resolve sozinho as dificuldades comuns:
Um problema frequente: o veículo muda o layout sem avisar. O coletor detecta a falha pela queda de completude e um engenheiro corrige as regras. Para você, o processo passa despercebido. Trabalhamos com um ritmo de rastreamento respeitoso, sem enviar requisições desnecessárias aos sites.
Muitos veículos têm canal no Telegram, e a notícia costuma aparecer lá antes do site. Sob demanda, conectamos os canais públicos de Telegram dos veículos como fonte adicional. O post do canal é vinculado ao veículo e unificado com a versão do artigo no site.
Um esclarecimento sobre o escopo: não coletamos publicações de usuários, comentários nem menções de marca em redes sociais. Essas tarefas são cobertas pelo monitoramento de marca.
Para o negócio, o fluxo de notícias não é um fim em si, e sim uma ferramenta: economiza tempo e traz informação para decidir.
Tarefas comuns:
Para jurídico e compliance, o fluxo cobre a parte regulatória. Uma nova norma é aprovada ou os requisitos mudam, por exemplo em proteção de dados, como a LGPD, e o boletim temático já está nas mãos da equipe. Não tocamos em perfis nem em comentários de usuários: coletamos apenas conteúdo editorial.
Cada projeto começa com uma amostra do fluxo: você revisa os dados, confere a estrutura e os volumes, e depois o trabalho começa. Se a tarefa não é padrão, montamos um protótipo. Cada projeto tem um gerente de projetos dedicado.
A extração de notícias resolve a obtenção de publicações. As tarefas relacionadas são cobertas por serviços à parte:
Desde 2015 coletamos dados para análise e ML. Antes de começar, enviamos grátis uma amostra do fluxo sobre o seu tema. Resposta em um dia útil.
Casos resumidos: quais dados coletamos e que resultados nossos clientes obtiveram.
O registro completo de blogs e veículos .co.uk mais um corpus HTML preparado e armazenado no S3.
Listas de drops de dezenas de plataformas em um só fluxo, com métricas, idade e histórico.
Preços e disponibilidade de medicamentos consolidados em um quadro comparável do mercado.
Uma base setorial de lojas online com contatos verificados para o time de vendas.
Desde 2015 coletamos dados para análise e ML. Um fluxo de notícias só tem valor quando é completo, está limpo e chega no prazo.
Removemos publicidade, navegação e código auxiliar. Ficam o título, o texto do artigo e os metadados.
RSS, HTML, sites dinâmicos e acervos. Coletamos até onde não há feeds.
As republicações são agrupadas com referência à fonte original. Você vê cada artigo uma única vez.
As fontes-chave são consultadas a cada poucos minutos. O fluxo chega quase em tempo real.
O veículo mudou o layout? Nós corrigimos. Nossa equipe de desenvolvimento responde pela completude do fluxo.
Orçamento e amostra do fluxo antes de começar, contrato e um preço claro, sem cobranças ocultas.
Um processo transparente: preparamos o orçamento e enviamos um exemplo do fluxo antes de começar. Sem taxas ocultas nem surpresas.
Envie a lista de fontes ou os temas. Uma breve descrição da tarefa é suficiente.
Estudo do nicho com dados do Google News e do Bing News, estimativa de volume e prazos e amostra gratuita do fluxo.
Configuramos os scrapers, a limpeza, a deduplicação e o formato do fluxo.
As publicações chegam por feed, arquivo ou API. Cuidamos da completude e da qualidade.
O resultado é um fluxo estruturado de publicações, sem ruído nem duplicatas, pronto para entrar no seu sistema.
Publicações com textos completos e metadados: JSON, XML, CSV conforme o seu esquema.
As novas publicações chegam de forma programada, até em tempo real.
O fluxo entra direto nos seus modelos, dashboards e produtos.
Um painel com o feed de notícias, filtros por temas e fontes e exportação.
Textos limpos, deduplicação, idioma, sentimento e classificação por temas.
Cuidamos da completude do fluxo, consertamos os scrapers e adicionamos fontes sob demanda.
A extração de notícias cobre só uma parte do trabalho com dados. As áreas relacionadas são montadas e configuradas conforme a sua tarefa.
Menções de marca na imprensa: sentimento e alcance.
Veículos com contatos de redações para tarefas de PR.
Datasets para treinar modelos: coleta e rotulagem.
Qualquer dado de qualquer site, conforme a sua tarefa.
Preços, produtos e notícias dos seus concorrentes sob controle.
Resultados dos buscadores para as suas palavras-chave.
Se não encontrar a resposta que procura, envie uma solicitação: responderemos em um dia útil.
Veículos digitais, agregadores de notícias, portais setoriais e salas de imprensa corporativas. Quase não há limitações por site. Trabalhamos também com fontes sem RSS: sites dinâmicos, acervos e seções atrás de autenticação, quando as regras da plataforma permitem. Os canais públicos de Telegram dos veículos são conectados sob demanda.
Os projetos partem de US$ 150. O preço final depende do número de fontes, do volume de dados, da frequência de atualização e do processamento adicional (detalhamento dos fatores acima). Enviamos o orçamento exato e uma amostra de dados grátis antes de começar.
Sim. Coletamos a retrospectiva a partir dos acervos dos veículos e dos arquivos da web, até onde alcança a profundidade de armazenamento da fonte. Um arquivo de artigos de períodos passados é útil para treinar modelos e para a análise retrospectiva.
Depende do modo. Com entrega em fluxo contínuo, as fontes-chave são consultadas a cada poucos minutos e a publicação entra no fluxo quase imediatamente após sair. A velocidade do scraper para a sua lista de fontes é definida no teste.
Extraímos dados do Google News e de lá tiramos a lista de editores: mais de 100 000 veículos digitais de todos os temas. Também coletamos o Bing News, o agregador de notícias da Microsoft: ele amplia a cobertura de fontes internacionais e ajuda a verificar a completude do fluxo. Os sites fora dos agregadores são adicionados manualmente conforme a sua lista.
JSON, XML, CSV: em arquivo, feed atualizável ou via API. O esquema de campos é combinado conforme o seu sistema. Também podemos entregar em uma interface web com feed, filtros e exportação.
Não. Não é preciso instalar nenhum programa. Tudo roda do nosso lado: scrapers, limpeza, armazenamento e entrega. Cuidamos do desenvolvimento e da manutenção. Você recebe os dados prontos em um formato conveniente.
Mudanças de layout e proteções das plataformas são dificuldades normais do scraping. O coletor detecta a falha pela queda de completude e nossa equipe atualiza as regras de parsing. Para os clientes, o processo passa despercebido: o fluxo continua chegando.
Sim. Você define seções, palavras-chave ou uma lista de empresas, e só o conteúdo relevante entra no fluxo. Sob demanda, adicionamos classificação por temas, sentimento e extração de entidades: empresas, pessoas, tickers.
São serviços complementares. As publicações sobre a sua empresa, com sentimento e alcance, são acompanhadas pelo monitoramento de mídia. As publicações em redes sociais são captadas pelo monitoramento de marca. A extração de notícias entrega todo o fluxo do tema, sem vínculo com uma marca.