Archivarix

web-archive

Common Crawl (CDX index)

Ein gemeinnütziges Projekt, das das offene Web im Petabyte-Maßstab crawlt und alles Gesammelte veröffentlicht: mit rund 2,2 Milliarden Seiten pro Crawl und regelmäßig erscheinenden neuen Crawls. Jeder Crawl verfügt über eine kostenlose Index-API ohne Schlüssel, die meldet, ob und wann eine URL erfasst wurde; der gespeicherte Seiteninhalt lässt sich anschließend aus dem öffentlichen Datensatz abrufen. Es ist eine Reihe von Crawl-Snapshots und kein Archiv auf Abruf, eignet sich also dafür, zu prüfen, wie eine Website in den letzten Crawl-Zeitfenstern aussah, oder für Web-Recherchen in großem Umfang.

Webseiten und Websites API

Warum es nützlich ist & wie es funktioniert

Common Crawl ist die beste Ressource, wenn Sie wissen möchten, ob eine URL in einem aktuellen breiten Crawl des offenen Webs erfasst wurde, oder wenn Sie Massenrecherchen über viele Websites hinweg durchführen. Jeder monatliche Crawl veröffentlicht eine kostenlose Index-API ohne Schlüssel: Sie übergeben eine URL und erhalten zurück, ob und wann diese Adresse erfasst wurde, samt Verweis auf den gespeicherten Inhalt im öffentlichen Datensatz. Da es sich um eine Reihe periodischer Crawl-Snapshots und nicht um ein Archiv auf Abruf handelt, eignet es sich eher dafür, den Zustand einer Website in den vergangenen Monaten zu prüfen, als beliebige historische Fassungen abzurufen.

Was drinsteckt

Jeder Crawl umfasst rund 2,2 Milliarden Webseiten. Der Crawl vom April 2026 (CC-MAIN-2026-17) enthält etwa 2,19 Milliarden Seiten mit 379 Terabyte unkomprimierten Inhalts. Das kumulierte Archiv aller Crawls seit 2008 umfasst über 300 Milliarden Seiten.

API-Zugang

https://index.commoncrawl.org/CC-MAIN-2026-25-index?url= <url>&output=json ; collection list https://index.commoncrawl.org/collinfo.json ; WARC on s3://commoncrawl/ and https://data.commoncrawl.org/

Was wir gemessen haben

Unsere eigenen Messungen, nicht die Angaben des Archivs. Sie werden regelmäßig wiederholt; jeder Wert ist datiert.

Erreichbarkeit

Direkte Anfrage
Hat geantwortet HTTP 200 827 ms
Über einen Rechenzentrums-Proxy
Hat geantwortet HTTP 200 869 ms
API, direkt
Hat geantwortet HTTP 200 487 ms
API, über Proxy
Hat geantwortet HTTP 200 784 ms

Hat eine echte Suche etwas geliefert?

Lieferte Ergebnisse · 20 Treffer für die Testabfrage · Median 1,2 s · über Läufe hinweg stabil

Testabfrage: https://www.example.com/

Benchmark-Abdeckung

Fand 7 von 10 Testobjekten (70%) im Cluster Webseiten und Websites. Antwortzeit im Median 434 ms.

Nach Bekanntheit des Objekts: 3/3 sehr bekannt, 2/4 mittel, 2/3 wenig bekannt .

Erreichbarkeit gemessen am 2026-08-22. Suche geprüft am 2026-08-22. Benchmark-Lauf vom 2026-08-22.

Zugang

Programmatischer Zugriff über eine API (ggf. mit Schlüssel, siehe API-Kennzeichnung).

Startseite

https://commoncrawl.org/

Ähnliche Archive