web-archive
Common Crawl (CDX index)
Un projet à but non lucratif qui moissonne le web ouvert à l'échelle du pétaoctet et publie tout ce qu'il collecte, avec environ 2,2 milliards de pages par moissonnage et de nouveaux moissonnages diffusés régulièrement. Chaque moissonnage dispose d'une API d'index gratuite et sans clé qui indique si et quand une URL a été capturée, le contenu de la page stockée pouvant ensuite être extrait du jeu de données public. Il s'agit d'une série d'instantanés de moissonnage et non d'une archive à la demande : l'outil convient donc pour vérifier l'aspect d'un site lors des dernières fenêtres de moissonnage ou pour mener des recherches web en masse.
Son utilité et son fonctionnement
Common Crawl est la meilleure ressource lorsque vous voulez savoir si une URL a été capturée lors d'un moissonnage large et récent du web ouvert, ou lorsque vous menez des recherches en masse sur de nombreux sites à la fois. Chaque moissonnage mensuel publie une API d'index gratuite et sans clé : fournissez une URL et elle indique si et quand cette adresse a été capturée, avec un pointeur vers le contenu stocké dans le jeu de données public. Comme il s'agit d'une série d'instantanés de moissonnage périodiques et non d'une archive à la demande, l'outil convient pour vérifier l'état d'un site au cours des derniers mois plutôt que pour récupérer une version historique quelconque.
Ce qu’elle contient
Chaque moissonnage couvre environ 2,2 milliards de pages web. Celui d'avril 2026 (CC-MAIN-2026-17) contient approximativement 2,19 milliards de pages, soit 379 téraoctets de contenu décompressé. L'archive cumulée de tous les moissonnages depuis 2008 dépasse 300 milliards de pages.
Accès API
https://index.commoncrawl.org/CC-MAIN-2026-25-index?url= <url>&output=json ; collection list https://index.commoncrawl.org/collinfo.json ; WARC on s3://commoncrawl/ and https://data.commoncrawl.org/
Accès
Accès programmatique via une API (une clé peut être requise, voir l’étiquette API).