Archivarix

web-archive

Common Crawl (CDX index)

Некоммерческий проект, который обходит открытый веб в петабайтных масштабах и публикует всё собранное: около 2,2 миллиарда страниц на обход, причём новые обходы выходят регулярно. У каждого обхода есть бесплатный индексный API без ключа, который сообщает, был ли URL сохранён и когда, после чего сохранённое содержимое страницы можно выгрузить из публичного набора данных. Это серия снимков обхода, а не архивация по запросу, поэтому сервис подходит для проверки того, как выглядел сайт в последних окнах обхода, или для массовых веб-исследований.

Веб-страницы и сайты API

Чем полезен и как работает

Common Crawl — лучший ресурс, когда нужно узнать, попал ли URL в один из недавних широких обходов открытого веба, или когда вы ведёте массовое исследование сразу по множеству сайтов. Каждый ежемесячный обход публикует бесплатный индексный API без ключа: вы передаёте URL, а он сообщает, был ли адрес сохранён и когда, а также даёт указатель на сохранённое содержимое в публичном наборе данных. Поскольку это серия периодических снимков обхода, а не архивация по запросу, сервис подходит для проверки состояния сайта в последние месяцы, а не для получения произвольных исторических версий.

Что внутри

Каждый обход охватывает примерно 2,2 миллиарда веб-страниц. Обход за апрель 2026 года (CC-MAIN-2026-17) содержит около 2,19 миллиарда страниц и 379 терабайт несжатого содержимого. Совокупный архив всех обходов с 2008 года превышает 300 миллиардов страниц.

Доступ по API

https://index.commoncrawl.org/CC-MAIN-2026-25-index?url= <url>&output=json ; collection list https://index.commoncrawl.org/collinfo.json ; WARC on s3://commoncrawl/ and https://data.commoncrawl.org/

Доступ

Программный доступ через API (может потребоваться ключ — см. метку API).

Сайт

https://commoncrawl.org/

Похожие архивы