Archivarix

web-archive

Common Crawl (CDX index)

Ein gemeinnütziges Projekt, das das offene Web im Petabyte-Maßstab crawlt und alles Gesammelte veröffentlicht – mit rund 2,2 Milliarden Seiten pro Crawl und regelmäßig erscheinenden neuen Crawls. Jeder Crawl verfügt über eine kostenlose Index-API ohne Schlüssel, die meldet, ob und wann eine URL erfasst wurde; der gespeicherte Seiteninhalt lässt sich anschließend aus dem öffentlichen Datensatz abrufen. Es ist eine Reihe von Crawl-Snapshots und kein Archiv auf Abruf, eignet sich also dafür, zu prüfen, wie eine Website in den letzten Crawl-Zeitfenstern aussah, oder für Web-Recherchen in großem Umfang.

Webseiten und Websites API

Warum es nützlich ist & wie es funktioniert

Common Crawl ist die beste Ressource, wenn Sie wissen möchten, ob eine URL in einem aktuellen breiten Crawl des offenen Webs erfasst wurde, oder wenn Sie Massenrecherchen über viele Websites hinweg durchführen. Jeder monatliche Crawl veröffentlicht eine kostenlose Index-API ohne Schlüssel: Sie übergeben eine URL und erhalten zurück, ob und wann diese Adresse erfasst wurde, samt Verweis auf den gespeicherten Inhalt im öffentlichen Datensatz. Da es sich um eine Reihe periodischer Crawl-Snapshots und nicht um ein Archiv auf Abruf handelt, eignet es sich eher dafür, den Zustand einer Website in den vergangenen Monaten zu prüfen, als beliebige historische Fassungen abzurufen.

Was drinsteckt

Jeder Crawl umfasst rund 2,2 Milliarden Webseiten. Der Crawl vom April 2026 (CC-MAIN-2026-17) enthält etwa 2,19 Milliarden Seiten mit 379 Terabyte unkomprimierten Inhalts. Das kumulierte Archiv aller Crawls seit 2008 umfasst über 300 Milliarden Seiten.

API-Zugang

https://index.commoncrawl.org/CC-MAIN-2026-25-index?url= <url>&output=json ; collection list https://index.commoncrawl.org/collinfo.json ; WARC on s3://commoncrawl/ and https://data.commoncrawl.org/

Zugang

Programmatischer Zugriff über eine API (ggf. mit Schlüssel, siehe API-Kennzeichnung).

Startseite

https://commoncrawl.org/

Ähnliche Archive