web-archive
Library of Congress Web Archives
O programa de arquivamento web curado da Biblioteca do Congresso: mais de cem coleções temáticas de sites selecionados por seus bibliotecários, em escala de petabytes. As coleções são consultadas em loc.gov, e as páginas de coleções e de itens também podem ser obtidas em JSON. Brilha quando o tema pesquisado coincide com um dos eixos curados — eleições, eventos, organizações — e não para localizar URLs arbitrárias.
Por que é útil e como funciona
O arquivo da web da Biblioteca do Congresso compensa os pesquisadores cujo tema coincide com um de seus eixos curados: eleições, grandes eventos, programas governamentais, organizações culturais e assuntos semelhantes selecionados pelos bibliotecários da instituição. As coleções são consultadas em loc.gov, onde cada coleção lista os sites que a integram, e as páginas de coleções e de itens individuais também podem ser obtidas em JSON estruturado bastando acrescentar um parâmetro de consulta. Não foi concebido para localizar URLs arbitrárias; sua força está na profundidade da cobertura dentro de temas cuidadosamente definidos e construídos ao longo de anos.
O que há dentro
O programa mantém mais de 100 coleções temáticas curadas, com aproximadamente quatro petabytes de dados, número que praticamente dobrou desde 2019 à medida que os métodos de coleta se ampliaram.
Acesso via API
loc.gov JSON: append ?fo=json to collection/item URLs.
Acesso
De acesso livre: sem chave, login ou captcha.