web-archive
Webrecorder / Browsertrix
Der Hersteller von Browsertrix und der Nachfolge-Toolchain von Conifer: selbst hostbare oder gehostete Crawling-Software, die Web-Archivdateien im Format WACZ/WARC erzeugt. Es gibt keinen zentralen öffentlichen Korpus zum Durchsuchen – jede Installation hält ihre eigenen Captures. Relevant, wenn Sie selbst originalgetreue Archive von Websites erstellen statt vorhandene durchsuchen möchten.
Keine programmatische Prüfung, öffnet die eigene Suche des Archivs.
Warum es nützlich ist & wie es funktioniert
Webrecorder ist das Open-Source-Projekt hinter Browsertrix und dem Dateiformat WACZ, das Conifer als Toolchain für originalgetreue Web-Archivierung abgelöst hat. Es ist eine Plattform zum Erstellen von Archiven, keine durchsuchbare öffentliche Sammlung. Wenn Sie vorhandene archivierte Seiten nachschlagen möchten, ist Webrecorder selbst nicht die richtige Adresse. Echo verlinkt Sie auf die Website als Ressource für alle, die die Technik verstehen oder eigene Crawls betreiben möchten.
Was drinsteckt
Kein zentraler öffentlicher Korpus. Jede Organisation und jede Einzelperson, die Browsertrix betreibt, hält ein eigenes privates oder institutionelles Archiv; eine gemeinsame durchsuchbare Sammlung existiert nicht.
API-Zugang
Per-deployment REST API (token).
Ein API-Schlüssel ist erforderlich (meist kostenlos); siehe die Endpunkte oben, wo du einen bekommst.
Zugang
Nur Katalog-Link – öffnen Sie das Archiv und suchen Sie dort selbst.