web-archive
Common Crawl (CDX index)
Um projeto sem fins lucrativos que rastreia a web aberta em escala de petabytes e publica tudo o que coleta, com cerca de 2,2 bilhões de páginas por rastreamento e um novo rastreamento divulgado regularmente. Cada rastreamento tem uma API de índice gratuita e sem chave que informa se e quando uma URL foi capturada, e o conteúdo armazenado da página pode então ser extraído do conjunto de dados público. Trata-se de uma série de instantâneos de rastreamento, e não de um arquivo sob demanda, por isso serve para verificar como um site estava nas janelas de rastreamento recentes ou para fazer pesquisa web em massa.
Por que é útil e como funciona
O Common Crawl é o melhor recurso quando se quer saber se uma URL foi capturada em um rastreamento amplo e recente da web aberta, ou quando se faz pesquisa em massa sobre muitos sites ao mesmo tempo. Cada rastreamento mensal publica uma API de índice gratuita e sem chave: basta informar uma URL e ela retorna se e quando aquele endereço foi capturado, junto com um ponteiro para o conteúdo armazenado no conjunto de dados público. Por ser uma série de instantâneos periódicos de rastreamento, e não um arquivo sob demanda, serve mais para verificar o estado de um site nos últimos meses do que para recuperar versões históricas arbitrárias.
O que há dentro
Cada rastreamento abrange cerca de 2,2 bilhões de páginas web. O rastreamento de abril de 2026 (CC-MAIN-2026-17) contém aproximadamente 2,19 bilhões de páginas em 379 terabytes de conteúdo não comprimido. O acervo acumulado de todos os rastreamentos desde 2008 ultrapassa 300 bilhões de páginas.
Acesso via API
https://index.commoncrawl.org/CC-MAIN-2026-25-index?url= <url>&output=json ; collection list https://index.commoncrawl.org/collinfo.json ; WARC on s3://commoncrawl/ and https://data.commoncrawl.org/
Acesso
Acesso programático por API (pode exigir chave, veja a etiqueta API).