Archivarix

web-archive

Arquivo.pt (Portuguese Web Archive)

L'archive du web nationale du Portugal, qui conserve des milliards de fichiers depuis 1996, y compris de nombreux sites non portugais. Fait rare parmi les archives du web, elle propose une recherche en texte intégral sur les pages conservées en plus de la consultation par URL, à la fois depuis son site et via des API gratuites. Tournez-vous vers elle lorsque vous devez chercher à l'intérieur du texte des pages archivées plutôt que simplement récupérer une adresse connue, ou lorsque vous étudiez l'histoire du web portugais et européen.

Pages et sites web API

Son utilité et son fonctionnement

Arquivo.pt se distingue de la plupart des archives du web parce qu'il offre une véritable recherche en texte intégral sur les pages conservées, et pas seulement une consultation par URL. Vous pouvez saisir une expression ou un sujet dans son interface de recherche et obtenir des passages de pages telles qu'elles existaient il y a des années, ce qui est précieux pour retracer la manière dont un sujet a été traité sur le web lusophone au fil du temps. La consultation par URL et la recherche en texte intégral sont toutes deux accessibles depuis son site et via des API gratuites et sans clé qui renvoient les résultats en JSON. Sa couverture dépasse largement les seuls sites portugais, ce qui en fait un excellent choix pour des recherches plus générales sur l'histoire des débuts du web.

Ce qu’elle contient

Début 2025, l'archive comptait plus de 21 milliards de pages web provenant d'environ 47 millions de sites, soit près de 1,4 pétaoctet de données. La préservation a commencé en 1996 et inclut plus de 1,8 milliard d'images.

Accès API

CDX https://arquivo.pt/wayback/cdx?url=&output=json ; full-text https://arquivo.pt/textsearch?q= ; replay https://arquivo.pt/wayback/ <ts>/<url>

Accès

Accès programmatique via une API (une clé peut être requise, voir l’étiquette API).

Page d’accueil

https://arquivo.pt/

Archives similaires