web-archive
Common Crawl (CDX index)
Um projeto sem fins lucrativos que rastreia a web aberta em escala de petabytes e publica tudo o que coleta, com cerca de 2,2 bilhões de páginas por rastreamento e um novo rastreamento divulgado regularmente. Cada rastreamento tem uma API de índice gratuita e sem chave que informa se e quando uma URL foi capturada, e o conteúdo armazenado da página pode então ser extraído do conjunto de dados público. Trata-se de uma série de instantâneos de rastreamento, e não de um arquivo sob demanda, por isso serve para verificar como um site estava nas janelas de rastreamento recentes ou para fazer pesquisa web em massa.
Por que é útil e como funciona
O Common Crawl é o melhor recurso quando se quer saber se uma URL foi capturada em um rastreamento amplo e recente da web aberta, ou quando se faz pesquisa em massa sobre muitos sites ao mesmo tempo. Cada rastreamento mensal publica uma API de índice gratuita e sem chave: basta informar uma URL e ela retorna se e quando aquele endereço foi capturado, junto com um ponteiro para o conteúdo armazenado no conjunto de dados público. Por ser uma série de instantâneos periódicos de rastreamento, e não um arquivo sob demanda, serve mais para verificar o estado de um site nos últimos meses do que para recuperar versões históricas arbitrárias.
O que há dentro
Cada rastreamento abrange cerca de 2,2 bilhões de páginas web. O rastreamento de abril de 2026 (CC-MAIN-2026-17) contém aproximadamente 2,19 bilhões de páginas em 379 terabytes de conteúdo não comprimido. O acervo acumulado de todos os rastreamentos desde 2008 ultrapassa 300 bilhões de páginas.
Acesso via API
https://index.commoncrawl.org/CC-MAIN-2026-25-index?url= <url>&output=json ; collection list https://index.commoncrawl.org/collinfo.json ; WARC on s3://commoncrawl/ and https://data.commoncrawl.org/
O que medimos
As nossas próprias sondagens, não o que o arquivo afirma. Repetidas periodicamente; cada valor tem data.
Acessibilidade
- Pedido direto
- Respondeu HTTP 200 827 ms
- Através de um proxy de centro de dados
- Respondeu HTTP 200 869 ms
- API, direta
- Respondeu HTTP 200 487 ms
- API, através de proxy
- Respondeu HTTP 200 784 ms
Uma pesquisa real devolveu alguma coisa?
Devolveu resultados · 20 resultados para a consulta de teste · mediana 1,2 s · estável entre execuções
Consulta de teste: https://www.example.com/
Cobertura no benchmark
Encontrou 7 de 10 itens de teste (70%) no cluster Páginas e sites. Resposta mediana 434 ms.
Consoante o quão conhecido é o item: 3/3 muito conhecidos, 2/4 intermédios, 2/3 pouco conhecidos .
Acessibilidade medida a 2026-08-22. Pesquisa verificada em 2026-08-22. Execução do benchmark a 2026-08-22.
Acesso
Acesso programático por API (pode exigir chave, veja a etiqueta API).