web-archive
Library of Congress Web Archives
El programa de archivo web curado de la Biblioteca del Congreso: más de un centenar de colecciones temáticas de sitios web seleccionadas por sus bibliotecarios, a escala de petabytes. Las colecciones se exploran en loc.gov, y las páginas de colección y de ítem también pueden obtenerse en JSON. Brilla cuando el tema buscado coincide con alguno de los ejes curados, elecciones, acontecimientos, organizaciones, más que para consultar URL arbitrarias.
Por qué es útil y cómo funciona
El archivo web de la Biblioteca del Congreso resulta especialmente provechoso para quienes investigan un tema que coincide con alguno de sus ejes curados: elecciones, grandes acontecimientos, programas gubernamentales, organizaciones culturales y materias similares seleccionadas por los bibliotecarios de la LoC. Las colecciones se exploran en loc.gov, donde cada una enumera los sitios que la integran, y las páginas de colección y de ítem también pueden obtenerse como JSON estructurado añadiendo un parámetro de consulta. No está pensado para consultar URL arbitrarias; su fuerza está en la profundidad de la cobertura dentro de temas cuidadosamente definidos y construidos a lo largo de años.
Qué contiene
El programa reúne más de 100 colecciones temáticas curadas que suman aproximadamente cuatro petabytes de datos, una cifra que se ha duplicado más o menos desde 2019 a medida que se ampliaron los métodos de recopilación.
Acceso por API
loc.gov JSON: append ?fo=json to collection/item URLs.
Acceso
De acceso libre: sin clave, sin registro y sin captcha.