Archivarix

web-archive

Arquivo.pt (Portuguese Web Archive)

Portugals nationales Web-Archiv, das seit 1996 Milliarden von Dateien bewahrt, darunter viele nicht-portugiesische Websites. Ungewöhnlich für ein Web-Archiv bietet es neben der URL-Abfrage auch eine Volltextsuche über die bewahrten Seiten, sowohl über die Website als auch über kostenlose APIs. Greifen Sie darauf zurück, wenn Sie im archivierten Seitentext suchen möchten, statt nur eine bekannte Adresse abzurufen, oder wenn Sie zur portugiesischen und europäischen Web-Geschichte forschen.

Webseiten und Websites API

Warum es nützlich ist & wie es funktioniert

Arquivo.pt hebt sich von den meisten Web-Archiven ab, weil es eine echte Volltextsuche über die bewahrten Seiten bietet und nicht nur eine URL-Abfrage. Sie können eine Wendung oder ein Thema in die Suchoberfläche eingeben und erhalten Textstellen aus Seiten in dem Zustand, den sie vor Jahren hatten – unschätzbar wertvoll, um nachzuvollziehen, wie ein Gegenstand im portugiesischsprachigen Web im Lauf der Zeit behandelt wurde. URL-Abfrage und Volltextsuche stehen sowohl über die Website als auch über kostenlose APIs ohne Schlüssel zur Verfügung, die Ergebnisse als JSON zurückgeben. Das Archiv deckt weit mehr ab als nur portugiesische Websites und ist damit eine gute Wahl für breiter angelegte Recherchen zur frühen Web-Geschichte.

Was drinsteckt

Anfang 2025 umfasste das Archiv über 21 Milliarden Webseiten von etwa 47 Millionen Websites mit einem Volumen von rund 1,4 Petabyte. Die Bewahrung begann 1996 und schließt über 1,8 Milliarden Bilder ein.

API-Zugang

CDX https://arquivo.pt/wayback/cdx?url=&output=json ; full-text https://arquivo.pt/textsearch?q= ; replay https://arquivo.pt/wayback/ <ts>/<url>

Zugang

Programmatischer Zugriff über eine API (ggf. mit Schlüssel, siehe API-Kennzeichnung).

Startseite

https://arquivo.pt/

Ähnliche Archive