web-archive
Common Crawl (CDX index)
Un projet à but non lucratif qui moissonne le web ouvert à l'échelle du pétaoctet et publie tout ce qu'il collecte, avec environ 2,2 milliards de pages par moissonnage et de nouveaux moissonnages diffusés régulièrement. Chaque moissonnage dispose d'une API d'index gratuite et sans clé qui indique si et quand une URL a été capturée, le contenu de la page stockée pouvant ensuite être extrait du jeu de données public. Il s'agit d'une série d'instantanés de moissonnage et non d'une archive à la demande : l'outil convient donc pour vérifier l'aspect d'un site lors des dernières fenêtres de moissonnage ou pour mener des recherches web en masse.
Son utilité et son fonctionnement
Common Crawl est la meilleure ressource lorsque vous voulez savoir si une URL a été capturée lors d'un moissonnage large et récent du web ouvert, ou lorsque vous menez des recherches en masse sur de nombreux sites à la fois. Chaque moissonnage mensuel publie une API d'index gratuite et sans clé : fournissez une URL et elle indique si et quand cette adresse a été capturée, avec un pointeur vers le contenu stocké dans le jeu de données public. Comme il s'agit d'une série d'instantanés de moissonnage périodiques et non d'une archive à la demande, l'outil convient pour vérifier l'état d'un site au cours des derniers mois plutôt que pour récupérer une version historique quelconque.
Ce qu’elle contient
Chaque moissonnage couvre environ 2,2 milliards de pages web. Celui d'avril 2026 (CC-MAIN-2026-17) contient approximativement 2,19 milliards de pages, soit 379 téraoctets de contenu décompressé. L'archive cumulée de tous les moissonnages depuis 2008 dépasse 300 milliards de pages.
Accès API
https://index.commoncrawl.org/CC-MAIN-2026-25-index?url= <url>&output=json ; collection list https://index.commoncrawl.org/collinfo.json ; WARC on s3://commoncrawl/ and https://data.commoncrawl.org/
Ce que nous avons mesuré
Nos propres sondes, pas les promesses de l’archive. Relancées régulièrement ; chaque valeur est datée.
Accessibilité
- Requête directe
- A répondu HTTP 200 827 ms
- Via un proxy de centre de données
- A répondu HTTP 200 869 ms
- API, en direct
- A répondu HTTP 200 487 ms
- API, via un proxy
- A répondu HTTP 200 784 ms
Une vraie recherche a-t-elle renvoyé quelque chose ?
A renvoyé des résultats · 20 résultats pour la requête de test · médiane 1,2 s · stable d’une exécution à l’autre
Requête de test: https://www.example.com/
Couverture au banc d’essai
A trouvé 7 des 10 éléments de test (70 %) dans le cluster Pages et sites web. Temps de réponse médian 434 ms.
Selon la notoriété de l’élément: 3/3 très connus, 2/4 intermédiaires, 2/3 peu connus .
Accessibilité mesurée le 2026-08-22. Recherche vérifiée le 2026-08-22. Banc d’essai exécuté le 2026-08-22.
Accès
Accès programmatique via une API (une clé peut être requise, voir l’étiquette API).