web-archive
Common Crawl (CDX index)
Ein gemeinnütziges Projekt, das das offene Web im Petabyte-Maßstab crawlt und alles Gesammelte veröffentlicht – mit rund 2,2 Milliarden Seiten pro Crawl und regelmäßig erscheinenden neuen Crawls. Jeder Crawl verfügt über eine kostenlose Index-API ohne Schlüssel, die meldet, ob und wann eine URL erfasst wurde; der gespeicherte Seiteninhalt lässt sich anschließend aus dem öffentlichen Datensatz abrufen. Es ist eine Reihe von Crawl-Snapshots und kein Archiv auf Abruf, eignet sich also dafür, zu prüfen, wie eine Website in den letzten Crawl-Zeitfenstern aussah, oder für Web-Recherchen in großem Umfang.
Warum es nützlich ist & wie es funktioniert
Common Crawl ist die beste Ressource, wenn Sie wissen möchten, ob eine URL in einem aktuellen breiten Crawl des offenen Webs erfasst wurde, oder wenn Sie Massenrecherchen über viele Websites hinweg durchführen. Jeder monatliche Crawl veröffentlicht eine kostenlose Index-API ohne Schlüssel: Sie übergeben eine URL und erhalten zurück, ob und wann diese Adresse erfasst wurde, samt Verweis auf den gespeicherten Inhalt im öffentlichen Datensatz. Da es sich um eine Reihe periodischer Crawl-Snapshots und nicht um ein Archiv auf Abruf handelt, eignet es sich eher dafür, den Zustand einer Website in den vergangenen Monaten zu prüfen, als beliebige historische Fassungen abzurufen.
Was drinsteckt
Jeder Crawl umfasst rund 2,2 Milliarden Webseiten. Der Crawl vom April 2026 (CC-MAIN-2026-17) enthält etwa 2,19 Milliarden Seiten mit 379 Terabyte unkomprimierten Inhalts. Das kumulierte Archiv aller Crawls seit 2008 umfasst über 300 Milliarden Seiten.
API-Zugang
https://index.commoncrawl.org/CC-MAIN-2026-25-index?url= <url>&output=json ; collection list https://index.commoncrawl.org/collinfo.json ; WARC on s3://commoncrawl/ and https://data.commoncrawl.org/
Zugang
Programmatischer Zugriff über eine API (ggf. mit Schlüssel, siehe API-Kennzeichnung).