Archivarix

web-archive

Archive-It (Internet Archive)

O serviço de arquivamento por assinatura do Internet Archive, usado por mais de mil bibliotecas, governos e universidades para montar coleções web curadas que, somadas, reúnem dezenas de bilhões de documentos. As capturas são vistas por meio de links de reprodução em wayback.archive-it.org, organizados por coleção. Compensa quando a coleção de uma instituição específica cobre o assunto pesquisado; como a cobertura é feita coleção a coleção, não é o lugar para localizar URLs arbitrárias.

Páginas e sites
Pesquisar neste arquivo

Sem verificação programática, abre a própria busca do arquivo.

Por que é útil e como funciona

O Archive-It é onde instituições como universidades, órgãos governamentais e bibliotecas constroem e mantêm suas próprias coleções web temáticas, por isso se destaca quando o assunto pesquisado se encaixa na área de coleta de uma organização específica. Mais de 1.000 instituições parceiras em todo o mundo criaram mais de 10.000 coleções públicas, todas com busca em texto completo em archive-it.org. É possível navegar por organização ou por tema e depois visualizar as capturas em uma interface de reprodução no estilo do Wayback. Como a cobertura é feita coleção a coleção, funciona melhor quando já se identificou uma coleção relevante do que na busca por uma URL arbitrária.

O que há dentro

Em conjunto, os parceiros já arquivaram dezenas de bilhões de documentos. O serviço cresce desde 2006 e o acervo combinado está na escala de petabytes, embora não seja divulgado um número agregado separado do total do Internet Archive.

Acesso via API

Per-collection CDX https://wayback.archive-it.org/ <collId>/timemap/cdx?url= (works) ; replay https://wayback.archive-it.org/ <collId>/<ts>/<url> . Aggregate /all/ CDX is blocked.

O que medimos

As nossas próprias sondagens, não o que o arquivo afirma. Repetidas periodicamente; cada valor tem data.

Acessibilidade

Pedido direto
Respondeu HTTP 200 574 ms
Através de um proxy de centro de dados
Respondeu HTTP 200 1,1 s
All CDX, de forma direta
Bloqueado HTTP 403 325 ms
All CDX, através de proxy
Bloqueado HTTP 403 927 ms
Collection 2950 CDX, de forma direta
Respondeu HTTP 200 323 ms
Collection 2950 CDX, através de proxy
Respondeu HTTP 200 1,1 s
Collection 2950 replay, de forma direta
Respondeu HTTP 200 828 ms
Collection 2950 replay, através de proxy
Respondeu HTTP 200 1,6 s

Uma pesquisa real devolveu alguma coisa?

Inconclusivo · mediana 840 ms · estável entre execuções

The per-collection CDX endpoint now answers with a "Session Verification" interstitial rather than JSON, so nothing can be counted. Coverage was always collection-specific and empty for arbitrary URLs: treat as link-only unless a collection is known.

Acessibilidade medida a 2026-08-22. Pesquisa verificada em 2026-08-22.

Acesso

Acesso programático por API (pode exigir chave, veja a etiqueta API).

Página inicial

https://archive-it.org/

Arquivos relacionados