web-archive
Library of Congress Web Archives
Le programme d'archivage du web éditorialisé de la Library of Congress : plus d'une centaine de collections thématiques de sites sélectionnées par ses bibliothécaires, à l'échelle du pétaoctet. Les collections se parcourent sur loc.gov, et les pages de collection comme de notice peuvent aussi être récupérées en JSON. Il donne toute sa mesure lorsque votre sujet correspond à l'un des thèmes retenus, élections, événements, organisations, plutôt que pour rechercher des URL quelconques.
Son utilité et son fonctionnement
L'archive du web de la Library of Congress est particulièrement utile aux chercheurs dont le sujet correspond à l'un de ses thèmes éditorialisés : élections, grands événements, programmes gouvernementaux, organisations culturelles et sujets analogues, choisis par les bibliothécaires de la LoC. Les collections se parcourent sur loc.gov, où chaque collection énumère les sites qui la composent ; les pages de collection et de notice peuvent également être récupérées en JSON structuré en ajoutant un paramètre de requête. L'outil n'est pas conçu pour rechercher des URL quelconques : sa force réside dans la profondeur de couverture au sein de thèmes soigneusement définis et construits au fil des ans.
Ce qu’elle contient
Le programme compte plus de 100 collections thématiques éditorialisées, représentant environ quatre pétaoctets de données, un volume qui a approximativement doublé depuis 2019 à mesure que les méthodes de collecte se sont élargies.
Accès API
loc.gov JSON: append ?fo=json to collection/item URLs.
Accès
Librement accessible : sans clé, sans compte ni captcha.