Archivarix

web-archive

Library of Congress Web Archives

O programa de arquivamento web curado da Biblioteca do Congresso: mais de cem coleções temáticas de sites selecionados por seus bibliotecários, em escala de petabytes. As coleções são consultadas em loc.gov, e as páginas de coleções e de itens também podem ser obtidas em JSON. Brilha quando o tema pesquisado coincide com um dos eixos curados — eleições, eventos, organizações — e não para localizar URLs arbitrárias.

Páginas e sites API

Por que é útil e como funciona

O arquivo da web da Biblioteca do Congresso compensa os pesquisadores cujo tema coincide com um de seus eixos curados: eleições, grandes eventos, programas governamentais, organizações culturais e assuntos semelhantes selecionados pelos bibliotecários da instituição. As coleções são consultadas em loc.gov, onde cada coleção lista os sites que a integram, e as páginas de coleções e de itens individuais também podem ser obtidas em JSON estruturado bastando acrescentar um parâmetro de consulta. Não foi concebido para localizar URLs arbitrárias; sua força está na profundidade da cobertura dentro de temas cuidadosamente definidos e construídos ao longo de anos.

O que há dentro

O programa mantém mais de 100 coleções temáticas curadas, com aproximadamente quatro petabytes de dados, número que praticamente dobrou desde 2019 à medida que os métodos de coleta se ampliaram.

Acesso via API

loc.gov JSON: append ?fo=json to collection/item URLs.

Acesso

De acesso livre: sem chave, login ou captcha.

Página inicial

https://www.loc.gov/web-archives/

Arquivos relacionados