Archivarix

web-archive

Common Crawl (CDX index)

Um projeto sem fins lucrativos que rastreia a web aberta em escala de petabytes e publica tudo o que coleta, com cerca de 2,2 bilhões de páginas por rastreamento e um novo rastreamento divulgado regularmente. Cada rastreamento tem uma API de índice gratuita e sem chave que informa se e quando uma URL foi capturada, e o conteúdo armazenado da página pode então ser extraído do conjunto de dados público. Trata-se de uma série de instantâneos de rastreamento, e não de um arquivo sob demanda, por isso serve para verificar como um site estava nas janelas de rastreamento recentes ou para fazer pesquisa web em massa.

Páginas e sites API

Por que é útil e como funciona

O Common Crawl é o melhor recurso quando se quer saber se uma URL foi capturada em um rastreamento amplo e recente da web aberta, ou quando se faz pesquisa em massa sobre muitos sites ao mesmo tempo. Cada rastreamento mensal publica uma API de índice gratuita e sem chave: basta informar uma URL e ela retorna se e quando aquele endereço foi capturado, junto com um ponteiro para o conteúdo armazenado no conjunto de dados público. Por ser uma série de instantâneos periódicos de rastreamento, e não um arquivo sob demanda, serve mais para verificar o estado de um site nos últimos meses do que para recuperar versões históricas arbitrárias.

O que há dentro

Cada rastreamento abrange cerca de 2,2 bilhões de páginas web. O rastreamento de abril de 2026 (CC-MAIN-2026-17) contém aproximadamente 2,19 bilhões de páginas em 379 terabytes de conteúdo não comprimido. O acervo acumulado de todos os rastreamentos desde 2008 ultrapassa 300 bilhões de páginas.

Acesso via API

https://index.commoncrawl.org/CC-MAIN-2026-25-index?url= <url>&output=json ; collection list https://index.commoncrawl.org/collinfo.json ; WARC on s3://commoncrawl/ and https://data.commoncrawl.org/

O que medimos

As nossas próprias sondagens, não o que o arquivo afirma. Repetidas periodicamente; cada valor tem data.

Acessibilidade

Pedido direto
Respondeu HTTP 200 827 ms
Através de um proxy de centro de dados
Respondeu HTTP 200 869 ms
API, direta
Respondeu HTTP 200 487 ms
API, através de proxy
Respondeu HTTP 200 784 ms

Uma pesquisa real devolveu alguma coisa?

Devolveu resultados · 20 resultados para a consulta de teste · mediana 1,2 s · estável entre execuções

Consulta de teste: https://www.example.com/

Cobertura no benchmark

Encontrou 7 de 10 itens de teste (70%) no cluster Páginas e sites. Resposta mediana 434 ms.

Consoante o quão conhecido é o item: 3/3 muito conhecidos, 2/4 intermédios, 2/3 pouco conhecidos .

Acessibilidade medida a 2026-08-22. Pesquisa verificada em 2026-08-22. Execução do benchmark a 2026-08-22.

Acesso

Acesso programático por API (pode exigir chave, veja a etiqueta API).

Página inicial

https://commoncrawl.org/

Arquivos relacionados