Archivarix

Руководство

Archivarix Echo ищет сразу по 200+ веб-архивам. Вместо того чтобы открывать Wayback Machine, затем archive.today, затем десяток научных и книжных архивов один за другим, вы вставляете в Echo что-то одно, и он сам разбирается, где искать. Это руководство объясняет, что можно искать, как работает поиск и как читать результаты.

Главная страница Archivarix Echo: одно поле поиска, принимающее URL, DOI, ISBN, социальный хэндл, хэш файла или название

Что можно искать

Это сердце Echo. Вы не выбираете архив или категорию — вы вставляете что-то, а Echo распознаёт, что это, и направляет это в каждый архив, созданный для ответа на такой вид ввода. Вам никогда не нужно знать, в каком из 200+ архивов оно может быть; именно эту работу Echo делает за вас. Ниже — всё, что Echo понимает, с примерами.

Вставьте точный идентификатор

Echo распознаёт эти формы ввода с первого взгляда. Чем конкретнее ваш ввод, тем точнее маршрутизация — но вам никогда не нужно его помечать, просто вставьте.

  • URL веб-страницыhttps://www.spacejam.com/ Находит сохранённые снимки этой страницы по крупным веб-архивам: Wayback Machine (1+ триллион страниц), archive.today, Common Crawl, Perma.cc, Ghostarchive, Software Heritage и национальные веб-архивы (UK Government Web Archive, португальский Arquivo.pt, исландский Vefsafn, австралийский Trove, Library of Congress). Вы видите страницу такой, какой она была в разные моменты времени — даже если сегодня её больше нет.

  • Целый сайт или доменnokia.com Вставьте «голый» домен, чтобы получить все захваченные страницы сайта, а не только один адрес. Echo добавляет представление «показать все захваченные файлы» по веб-архивам и направляет домен в crt.sh (Certificate Transparency), чтобы раскрыть поддомены и историю SSL-сертификатов сайта — способ составить карту сайта, которого больше не существует.

  • Видео с YouTubehttps://youtu.be/dQw4w9WgXcQ — или просто идентификатор dQw4w9WgXcQ Восстанавливает метаданные, субтитры и миниатюры удалённых видео через Tube Archivarix и Filmot (поиск по субтитрам сотен миллионов видео), а также архивные копии страницы просмотра в Wayback Machine, archive.today, Common Crawl и Ghostarchive. Миниатюра также отправляется в обратный поиск по изображению для охоты за повторными загрузками.

  • Изображение для обратного поиска — прямая ссылка на изображение вроде https://upload.wikimedia.org/wikipedia/commons/7/78/The_Blue_Marble.jpg Echo замечает URL изображений (.jpg, .png, .gif, .webp, .avif…) и отправляет их в системы обратного поиска по изображению: Yandex Images (многомиллиардный индекс), Google Lens, Bing Visual Search, TinEye (70+ миллиардов изображений), а также SauceNAO и IQDB для иллюстраций. Найдите, где ещё встречается картинка, оригинал в более высоком разрешении или её истинный источник.

  • DOI10.1145/3292500.3330701 Разрешает статью по научному графу — Crossref (165M+ DOI), DataCite, OpenAlex (480M работ), Semantic Scholar, Europe PMC, IA Scholar — и ищет полный текст в открытом доступе через Anna's Archive и Sci-Hub.

  • ISBN9780451524935 Находит книгу в Open Library (40M+ изданий), HathiTrust (18M+ томов), Google Books и теневых библиотеках Anna's Archive и Library Genesis — каталожные записи, сканы и полный текст.

  • Социальный хэндл@nasa Извлекает архивные профили и публикации: профили Twitter/X и отдельные твиты через Wayback Machine и archive.today, превью каналов Telegram, архивные страницы Facebook и историю пользователей Reddit через Pullpush и Arctic Shift.

  • Хэш содержимого файла44d88612fea8a8f36de82e1278abb02f (md5, sha1 или sha256) Ищет файл по его отпечатку содержимого в VirusTotal — данные о файле и угрозах для файла, который вы можете идентифицировать, но не можете назвать.

Или просто опишите словами

Нет идентификатора? Введите название, имя или несколько ключевых слов, и Echo разошлёт запрос по всем архивам с текстовым поиском сразу — их 75+ — а затем упорядочит результаты по тому, на что похожи ваши слова. Именно здесь раскрывается вся широта каталога:

  • Книги и электронные книгиFrankenstein → Open Library, Project Gutenberg, Standard Ebooks, HathiTrust, Internet Archive Texts, Wikisource, DOAB, а также Anna's Archive и Library Genesis.
  • Видеоapollo 11 landing → Tube Archivarix и Filmot для удалённого YouTube, а также Dailymotion, RuTube, Odysee, Rumble, BitChute, Bilibili, VK Video, OK.ru и Internet Archive Video.
  • Музыка и живые записиGrateful Dead 1977 → MusicBrainz и Live Music Archive (etree) от Internet Archive с записями тейперов, а также IA Audio.
  • Теле- и радионовости — субтитры эфиров в Internet Archive TV News Archive.
  • Статьи, препринты и патентыattention is all you need → arXiv, PubMed, bioRxiv, medRxiv, DOAJ, DBLP, OpenAIRE, CyberLeninka, Semantic Scholar и Google Patents.
  • ПО, приложения и заброшенное ПОreact (npm), requests (PyPI), а также F-Droid, APKMirror, Software Heritage (20B+ исходных файлов), Sourcegraph, MyAbandonware и играбельные MS-DOS-игры из Internet Archive.
  • Торренты — The Pirate Bay, Nyaa, 1337x, Torrents-CSV, SolidTorrents, BTDigg и Academic Torrents (петабайты исследовательских данных).
  • Исследовательские наборы данных — Harvard Dataverse, Figshare, Zenodo, OSF и Hugging Face Datasets.
  • Изображения и медиа со свободной лицензией — Wikimedia Commons (110M+ файлов), Openverse и GifCities с анимированными GIF эпохи GeoCities.
  • Форумы, Usenet, имиджборды и фанфики — Google Groups (история Usenet), Desuarchive и 4plebs (архивы 4chan) и Archive of Our Own.
  • Старый и малый веб — Wiby и Marginalia, поисковики по независимому, докорпоративному вебу.
  • Культурное наследие — открытая коллекция искусства The Met, OldMapsOnline с историческими картами и CourtListener с прецедентным правом США.
  • Файлы со старых дисков и мёртвых вики — DiscMaster индексирует файлы внутри винтажных образов дисков; WikiTeam сохраняет вики, которые закрылись.

Вам никогда не нужно сообщать Echo, какой это вид ввода — он считывает форму и маршрутизирует соответственно. Имя вроде Richard Feynman поднимает выше архивы авторов и профилей; фраза в кавычках "phrase" отдаёт предпочтение полнотекстовым системам; одно слово склоняет к именам пользователей и программным пакетам. Но ничего никогда не скрывается: каждый релевантный архив всё равно появляется в ваших результатах, так что вы никогда не пропустите совпадение.

Как работает поиск

  1. Вставьте и ищите. Введите или вставьте ваш URL, DOI, ISBN, хэндл, хэш или название в поле и нажмите Поиск.
  2. Echo определяет тип. Он классифицирует ввод и выбирает каждый архив в своём каталоге, способный ответить на такой вид запроса.
  3. Запрашивает их вместе. Echo рассылает запрос в релевантные архивы параллельно и собирает то, что приходит обратно.
  4. Результаты приходят сгруппированными. Совпадения группируются, чтобы вы могли с первого взгляда увидеть, у каких архивов есть копия и что каждый из них нашёл.

Если ничего не совпадает, Echo прямо сообщает об этом и предлагает попробовать другую форму того же — например, название вместо URL.

Чтение результатов

Каждый результат ведёт прямо к архиву, который хранит копию, так что вы можете открыть снимок, статью, книгу или профиль у источника. Архивы различаются по тому, что они показывают: одни возвращают богатые метаданные, другие — только ссылку. Откройте любой архив из каталога, чтобы увидеть заметки о том, что внутри него, как он работает и как получить к нему доступ.

Просмотрите полный каталог

Помимо живого поиска, Echo ведёт каталог каждого известного нам архива — включая те, по которым мы пока не можем запрашивать программно. Откройте каталог и фильтруйте по категории, кластеру, API или типу доступа, чтобы исследовать весь ландшафт и узнать, что охватывает каждый архив.

Каталог Archivarix Echo: фильтрация 200+ архивов по категории, кластеру, API и типу доступа

Фильтры соответствуют тому, как организованы архивы:

  • Категория — тематика архива (web-archive, scholarly-metadata, books, social, science-articles, image-archive, code-archive и многие другие).
  • Кластер — широкое семейство, к которому принадлежит архив (веб-страницы, полный текст, научные статьи, ПО, книги, соцсети, изображения, видео/аудио/музыка, торренты, наборы данных, культурное наследие, нишевый текст, файл-по-хэшу).
  • API — есть ли у архива программный интерфейс, который Echo может запрашивать.
  • Доступ — насколько он достижим: open, API, captcha, IP-blocked или link-only.

Что Echo ищет вживую, а что — только по ссылке

Не каждый архив можно запросить машиной. Echo работает с двумя уровнями:

  • Живые архивы. Там, где архив предлагает открытый поисковый API, Echo запрашивает его напрямую и возвращает результаты в ваш поиск. Это те архивы, которые отвечают, когда вы вставляете что-то в поле.
  • Архивы только по ссылке. У некоторых архивов нет пригодного API, они требуют captcha или блокируют автоматизированный доступ. Echo не может выполнить поиск за вас, но перечисляет их в каталоге с прямой ссылкой и заметками о том, как искать в них вручную. Это честный подход — когда мы не можем что-то открыть для вас, мы говорим об этом и указываем, где оно находится.

Аккаунты и лимиты

Вы можете искать в Echo без регистрации. У анонимного использования есть дневной лимит, чтобы сервис оставался честным и предотвращались злоупотребления. Бесплатный аккаунт повышает этот лимит и сохраняет вашу историю поиска, чтобы вы могли вернуться к прошлым запросам. Создание аккаунта требует email и пароля — без оплаты, без выбора тарифа. Создайте бесплатный аккаунт, чтобы начать.

Часто задаваемые вопросы

Бесплатен ли Archivarix Echo?

Да. Вы можете искать без аккаунта. Бесплатный аккаунт просто повышает ваш дневной лимит и запоминает вашу историю.

Как это работает?

Echo не хранит сам архивный контент. Он определяет, что вы вставили, запрашивает публичные архивы, которые хранят такой вид данных, и ссылается на то, что у них есть. Архивы — Wayback Machine, archive.today, Common Crawl, научные индексы, книжные библиотеки и другие — захватывают веб уже много лет.

Почему некоторые вещи не находятся?

Архивы хранят только то, что было захвачено до того, как оно исчезло. Если ни один публичный архив никогда не собирал и не депонировал копию, восстанавливать нечего. Покрытие лучше всего для материалов, которые были публичными, популярными или широко цитируемыми.

Может ли Echo искать по каждому архиву автоматически?

Нет — и мы не делаем вид, что может. Архивы без пригодного API или блокирующие автоматизированный доступ перечислены в каталоге как доступные только по ссылке, с прямой ссылкой, чтобы вы могли искать в них самостоятельно.

Откуда берутся результаты?

Полностью из публичных архивов и открытых наборов данных. Echo — это индекс и маршрутизатор над ними; он никогда не размещает исходный контент, и каждый результат ведёт обратно к своему источнику. Смотрите О проекте, чтобы увидеть полную картину.