web-archive
Archive-It (Internet Archive)
O serviço de arquivamento por assinatura do Internet Archive, usado por mais de mil bibliotecas, governos e universidades para montar coleções web curadas que, somadas, reúnem dezenas de bilhões de documentos. As capturas são vistas por meio de links de reprodução em wayback.archive-it.org, organizados por coleção. Compensa quando a coleção de uma instituição específica cobre o assunto pesquisado; como a cobertura é feita coleção a coleção, não é o lugar para localizar URLs arbitrárias.
Sem verificação programática, abre a própria busca do arquivo.
Por que é útil e como funciona
O Archive-It é onde instituições como universidades, órgãos governamentais e bibliotecas constroem e mantêm suas próprias coleções web temáticas, por isso se destaca quando o assunto pesquisado se encaixa na área de coleta de uma organização específica. Mais de 1.000 instituições parceiras em todo o mundo criaram mais de 10.000 coleções públicas, todas com busca em texto completo em archive-it.org. É possível navegar por organização ou por tema e depois visualizar as capturas em uma interface de reprodução no estilo do Wayback. Como a cobertura é feita coleção a coleção, funciona melhor quando já se identificou uma coleção relevante do que na busca por uma URL arbitrária.
O que há dentro
Em conjunto, os parceiros já arquivaram dezenas de bilhões de documentos. O serviço cresce desde 2006 e o acervo combinado está na escala de petabytes, embora não seja divulgado um número agregado separado do total do Internet Archive.
Acesso via API
Per-collection CDX https://wayback.archive-it.org/ <collId>/timemap/cdx?url= (works) ; replay https://wayback.archive-it.org/ <collId>/<ts>/<url> . Aggregate /all/ CDX is blocked.
Acesso
Acesso programático por API (pode exigir chave, veja a etiqueta API).