web-archive
Common Crawl (CDX index)
Un proyecto sin ánimo de lucro que rastrea la web abierta a escala de petabytes y publica todo lo que recopila, con unos 2.200 millones de páginas por rastreo y un rastreo nuevo publicado con regularidad. Cada rastreo dispone de una API de índice gratuita y sin clave que informa de si una URL fue capturada y cuándo, y el contenido almacenado de la página puede obtenerse después del conjunto de datos público. Es una serie de instantáneas de rastreo y no un archivo a demanda, por lo que sirve para comprobar cómo se veía un sitio en las ventanas de rastreo recientes o para hacer investigación web masiva.
Por qué es útil y cómo funciona
Common Crawl es el mejor recurso cuando se quiere saber si una URL fue capturada en un rastreo amplio y reciente de la web abierta, o cuando se lleva a cabo una investigación masiva sobre muchos sitios a la vez. Cada rastreo mensual publica una API de índice gratuita y sin clave: se le proporciona una URL y devuelve si esa dirección fue capturada y cuándo, junto con un puntero al contenido almacenado en el conjunto de datos público. Al tratarse de una serie de instantáneas periódicas de rastreo y no de un archivo a demanda, resulta adecuado para comprobar el estado de un sitio en los últimos meses más que para recuperar versiones históricas arbitrarias.
Qué contiene
Cada rastreo abarca unos 2.200 millones de páginas web. El rastreo de abril de 2026 (CC-MAIN-2026-17) contiene aproximadamente 2.190 millones de páginas repartidas en 379 terabytes de contenido sin comprimir. El archivo acumulado de todos los rastreos desde 2008 supera los 300.000 millones de páginas.
Acceso por API
https://index.commoncrawl.org/CC-MAIN-2026-25-index?url= <url>&output=json ; collection list https://index.commoncrawl.org/collinfo.json ; WARC on s3://commoncrawl/ and https://data.commoncrawl.org/
Acceso
Acceso programático mediante API (puede requerir clave, consulte la etiqueta API).