web-archive
Archive-It (Internet Archive)
O serviço de arquivamento por assinatura do Internet Archive, usado por mais de mil bibliotecas, governos e universidades para montar coleções web curadas que, somadas, reúnem dezenas de bilhões de documentos. As capturas são vistas por meio de links de reprodução em wayback.archive-it.org, organizados por coleção. Compensa quando a coleção de uma instituição específica cobre o assunto pesquisado; como a cobertura é feita coleção a coleção, não é o lugar para localizar URLs arbitrárias.
Sem verificação programática, abre a própria busca do arquivo.
Por que é útil e como funciona
O Archive-It é onde instituições como universidades, órgãos governamentais e bibliotecas constroem e mantêm suas próprias coleções web temáticas, por isso se destaca quando o assunto pesquisado se encaixa na área de coleta de uma organização específica. Mais de 1.000 instituições parceiras em todo o mundo criaram mais de 10.000 coleções públicas, todas com busca em texto completo em archive-it.org. É possível navegar por organização ou por tema e depois visualizar as capturas em uma interface de reprodução no estilo do Wayback. Como a cobertura é feita coleção a coleção, funciona melhor quando já se identificou uma coleção relevante do que na busca por uma URL arbitrária.
O que há dentro
Em conjunto, os parceiros já arquivaram dezenas de bilhões de documentos. O serviço cresce desde 2006 e o acervo combinado está na escala de petabytes, embora não seja divulgado um número agregado separado do total do Internet Archive.
Acesso via API
Per-collection CDX https://wayback.archive-it.org/ <collId>/timemap/cdx?url= (works) ; replay https://wayback.archive-it.org/ <collId>/<ts>/<url> . Aggregate /all/ CDX is blocked.
O que medimos
As nossas próprias sondagens, não o que o arquivo afirma. Repetidas periodicamente; cada valor tem data.
Acessibilidade
- Pedido direto
- Respondeu HTTP 200 574 ms
- Através de um proxy de centro de dados
- Respondeu HTTP 200 1,1 s
- All CDX, de forma direta
- Bloqueado HTTP 403 325 ms
- All CDX, através de proxy
- Bloqueado HTTP 403 927 ms
- Collection 2950 CDX, de forma direta
- Respondeu HTTP 200 323 ms
- Collection 2950 CDX, através de proxy
- Respondeu HTTP 200 1,1 s
- Collection 2950 replay, de forma direta
- Respondeu HTTP 200 828 ms
- Collection 2950 replay, através de proxy
- Respondeu HTTP 200 1,6 s
Uma pesquisa real devolveu alguma coisa?
Inconclusivo · mediana 840 ms · estável entre execuções
The per-collection CDX endpoint now answers with a "Session Verification" interstitial rather than JSON, so nothing can be counted. Coverage was always collection-specific and empty for arbitrary URLs: treat as link-only unless a collection is known.
Acessibilidade medida a 2026-08-22. Pesquisa verificada em 2026-08-22.
Acesso
Acesso programático por API (pode exigir chave, veja a etiqueta API).