Archivarix

web-archive

Library of Congress Web Archives

El programa de archivo web curado de la Biblioteca del Congreso: más de un centenar de colecciones temáticas de sitios web seleccionadas por sus bibliotecarios, a escala de petabytes. Las colecciones se exploran en loc.gov, y las páginas de colección y de ítem también pueden obtenerse en JSON. Brilla cuando el tema buscado coincide con alguno de los ejes curados, elecciones, acontecimientos, organizaciones, más que para consultar URL arbitrarias.

Páginas y sitios web API

Por qué es útil y cómo funciona

El archivo web de la Biblioteca del Congreso resulta especialmente provechoso para quienes investigan un tema que coincide con alguno de sus ejes curados: elecciones, grandes acontecimientos, programas gubernamentales, organizaciones culturales y materias similares seleccionadas por los bibliotecarios de la LoC. Las colecciones se exploran en loc.gov, donde cada una enumera los sitios que la integran, y las páginas de colección y de ítem también pueden obtenerse como JSON estructurado añadiendo un parámetro de consulta. No está pensado para consultar URL arbitrarias; su fuerza está en la profundidad de la cobertura dentro de temas cuidadosamente definidos y construidos a lo largo de años.

Qué contiene

El programa reúne más de 100 colecciones temáticas curadas que suman aproximadamente cuatro petabytes de datos, una cifra que se ha duplicado más o menos desde 2019 a medida que se ampliaron los métodos de recopilación.

Acceso por API

loc.gov JSON: append ?fo=json to collection/item URLs.

Acceso

De acceso libre: sin clave, sin registro y sin captcha.

Página principal

https://www.loc.gov/web-archives/

Archivos relacionados