Archivarix

Guide

Archivarix Echo interroge plus de 200 archives web à la fois. Au lieu d'ouvrir la Wayback Machine, puis archive.today, puis une douzaine d'archives universitaires et de livres une par une, vous collez une seule chose dans Echo et il détermine où chercher. Ce guide explique ce que vous pouvez rechercher, comment fonctionne une recherche et comment lire vos résultats.

La page d'accueil d'Archivarix Echo : une seule barre de recherche qui accepte une URL, un DOI, un ISBN, un identifiant social, un hash de fichier ou un titre

Ce que vous pouvez rechercher

C'est le cœur d'Echo. Vous ne choisissez ni une archive ni une catégorie — vous collez une chose, et Echo reconnaît de quoi il s'agit et l'oriente vers chaque archive conçue pour répondre à ce type d'entrée. Vous n'avez jamais à savoir laquelle des plus de 200 archives pourrait la détenir ; c'est tout le travail qu'Echo fait pour vous. Voici tout ce qu'Echo comprend, avec des exemples.

Collez un identifiant exact

Echo reconnaît ces formes d'entrée du premier coup d'œil. Plus votre entrée est précise, plus elle est orientée avec exactitude — mais vous n'avez jamais à l'étiqueter, il suffit de la coller.

  • L'URL d'une page webhttps://www.spacejam.com/ Trouve des captures enregistrées de cette page à travers les grandes archives web : la Wayback Machine (plus de 1 billion de pages), archive.today, Common Crawl, Perma.cc, Ghostarchive, Software Heritage et des archives web nationales (le UK Government Web Archive, l'Arquivo.pt du Portugal, le Vefsafn d'Islande, le Trove d'Australie, la Library of Congress). Vous voyez la page telle qu'elle était à différents moments — même si elle a disparu aujourd'hui.

  • Un site web ou un domaine entiernokia.com Collez un domaine nu pour récupérer toutes les pages capturées d'un site, et pas seulement une adresse. Echo ajoute une vue « lister tous les fichiers capturés » sur les archives web, et oriente le domaine vers crt.sh (Certificate Transparency) pour révéler les sous-domaines et l'historique du certificat SSL du site — un moyen de cartographier un site qui n'existe plus.

  • Une vidéo YouTubehttps://youtu.be/dQw4w9WgXcQ — ou simplement l'identifiant dQw4w9WgXcQ Récupère les métadonnées, les sous-titres et les vignettes de vidéos supprimées ou retirées via Tube Archivarix et Filmot (recherche de sous-titres sur des centaines de millions de vidéos), ainsi que des copies archivées de la page de visionnage sur la Wayback Machine, archive.today, Common Crawl et Ghostarchive. La vignette est aussi envoyée à la recherche d'image inversée pour traquer les réuploads.

  • Une image, pour une recherche inversée — un lien direct vers une image comme https://upload.wikimedia.org/wikipedia/commons/7/78/The_Blue_Marble.jpg Echo repère les URL d'images (.jpg, .png, .gif, .webp, .avif…) et les envoie aux moteurs de recherche d'image inversée : Yandex Images (index de plusieurs milliards), Google Lens, Bing Visual Search, TinEye (plus de 70 milliards d'images), ainsi que SauceNAO et IQDB pour les illustrations. Trouvez où une image apparaît ailleurs, un original en plus haute résolution ou sa véritable source.

  • Un DOI10.1145/3292500.3330701 Résout un article à travers le graphe scientifique — Crossref (plus de 165 M de DOIs), DataCite, OpenAlex (480 M de travaux), Semantic Scholar, Europe PMC, IA Scholar — et recherche le texte intégral en libre accès via Anna's Archive et Sci-Hub.

  • Un ISBN9780451524935 Trouve un livre dans Open Library (plus de 40 M d'éditions), HathiTrust (plus de 18 M de volumes), Google Books et les bibliothèques fantômes Anna's Archive et Library Genesis — notices de catalogue, scans et texte intégral.

  • Un identifiant social@nasa Récupère les profils et publications archivés : profils et tweets individuels Twitter/X via la Wayback Machine et archive.today, aperçus de chaînes Telegram, pages Facebook archivées et historique d'utilisateurs Reddit via Pullpush et Arctic Shift.

  • Un hash de contenu de fichier44d88612fea8a8f36de82e1278abb02f (md5, sha1 ou sha256) Recherche un fichier par son empreinte de contenu sur VirusTotal — renseignement sur les fichiers et les menaces pour un fichier que vous pouvez identifier mais pas nommer.

Ou décrivez-la simplement avec des mots

Pas d'identifiant ? Tapez un titre, un nom ou quelques mots-clés et Echo diffuse la requête à toutes les archives consultables par texte à la fois — plus de 75 d'entre elles — puis classe les résultats selon ce à quoi vos mots ressemblent. C'est là que toute l'ampleur du catalogue se déploie :

  • Livres et ebooksFrankenstein → Open Library, Project Gutenberg, Standard Ebooks, HathiTrust, Internet Archive Texts, Wikisource, DOAB, plus Anna's Archive et Library Genesis.
  • Vidéosapollo 11 landing → Tube Archivarix et Filmot pour YouTube supprimé, plus Dailymotion, RuTube, Odysee, Rumble, BitChute, Bilibili, VK Video, OK.ru et Internet Archive Video.
  • Musique et enregistrements liveGrateful Dead 1977 → MusicBrainz et la Live Music Archive (etree) de l'Internet Archive avec ses enregistrements de tapers, plus IA Audio.
  • Actualités TV et radio — les sous-titres de diffusion dans l'Internet Archive TV News Archive.
  • Articles, prépublications et brevetsattention is all you need → arXiv, PubMed, bioRxiv, medRxiv, DOAJ, DBLP, OpenAIRE, CyberLeninka, Semantic Scholar et Google Patents.
  • Logiciels, applications et abandonwarereact (npm), requests (PyPI), plus F-Droid, APKMirror, Software Heritage (plus de 20 milliards de fichiers source), Sourcegraph, MyAbandonware et les jeux MS-DOS jouables de l'Internet Archive.
  • Torrents — The Pirate Bay, Nyaa, 1337x, Torrents-CSV, SolidTorrents, BTDigg et Academic Torrents (pétaoctets de données de recherche).
  • Jeux de données de recherche — Harvard Dataverse, Figshare, Zenodo, OSF et Hugging Face Datasets.
  • Images et médias sous licence libre — Wikimedia Commons (plus de 110 M de fichiers), Openverse et GifCities pour les GIF animés de l'ère GeoCities.
  • Forums, Usenet, imageboards et fanfiction — Google Groups (historique Usenet), Desuarchive et 4plebs (archives de 4chan) et Archive of Our Own.
  • Le web ancien et minuscule — Wiby et Marginalia, des moteurs de recherche pour le web indépendant, pré-corporate.
  • Patrimoine culturel — la collection d'art ouverte du Met, OldMapsOnline pour les cartes historiques et CourtListener pour la jurisprudence américaine.
  • Fichiers de vieux disques et de wikis morts — DiscMaster indexe les fichiers à l'intérieur d'images de disques anciens ; WikiTeam préserve les wikis qui ont fermé.

Vous n'avez jamais à dire à Echo de quel type d'entrée il s'agit — il en lit la forme et oriente en conséquence. Un nom comme Richard Feynman fait remonter les archives d'auteurs et de profils ; une "phrase" entre guillemets favorise les moteurs de texte intégral ; un mot seul penche vers les noms d'utilisateurs et les paquets logiciels. Mais rien n'est jamais caché : chaque archive pertinente apparaît tout de même dans vos résultats, pour que vous ne manquiez jamais une correspondance.

Comment fonctionne une recherche

  1. Collez et cherchez. Tapez ou collez votre URL, DOI, ISBN, identifiant, hash ou titre dans la barre et appuyez sur Rechercher.
  2. Echo détecte le type. Il classe l'entrée et sélectionne toutes les archives de son catalogue capables de répondre à ce type de requête.
  3. Il les interroge ensemble. Echo diffuse la requête vers les archives pertinentes en parallèle et rassemble ce qui revient.
  4. Les résultats arrivent groupés. Les correspondances sont regroupées pour que vous voyiez, d'un coup d'œil, quelles archives possèdent une copie et ce que chacune a trouvé.

Si rien ne correspond, Echo le dit clairement et suggère d'essayer une autre forme de la même chose — par exemple un titre plutôt qu'une URL.

Lire vos résultats

Chaque résultat renvoie directement vers l'archive qui détient la copie, pour que vous puissiez ouvrir la capture, l'article, le livre ou le profil à sa source. Les archives diffèrent dans ce qu'elles exposent : certaines renvoient de riches métadonnées, d'autres seulement un lien. Ouvrez n'importe quelle archive depuis le catalogue pour voir des notes sur son contenu, son fonctionnement et la façon d'y accéder.

Parcourez le catalogue complet

Au-delà de la recherche en direct, Echo tient un catalogue de toutes les archives que nous connaissons — y compris celles que nous ne pouvons pas encore interroger par programme. Ouvrez le catalogue et filtrez par catégorie, cluster, API ou type d'accès pour explorer l'ensemble du paysage et apprendre ce que couvre chaque archive.

Le catalogue d'Archivarix Echo : filtrez plus de 200 archives par catégorie, cluster, API et type d'accès

Les filtres correspondent à la façon dont les archives sont organisées :

  • Catégorie — le sujet de l'archive (web-archive, scholarly-metadata, books, social, science-articles, image-archive, code-archive et bien d'autres).
  • Cluster — la grande famille à laquelle appartient une archive (pages web, texte intégral, articles universitaires, logiciels, livres, social, images, vidéo/audio/musique, torrents, jeux de données, patrimoine culturel, texte de niche, fichier-par-hash).
  • API — si l'archive dispose d'une interface programmatique qu'Echo peut interroger.
  • Accès — son degré d'accessibilité : open, API, captcha, IP-blocked ou link-only.

Ce qu'Echo cherche en direct vs. en lien seul

Toutes les archives ne peuvent pas être interrogées par une machine. Echo gère deux niveaux :

  • Archives en direct. Lorsqu'une archive offre une API de recherche ouverte, Echo l'interroge directement et ramène les résultats dans votre recherche. Ce sont les archives qui répondent lorsque vous collez quelque chose dans la barre.
  • Archives en lien seul. Certaines archives n'ont pas d'API utilisable, exigent un captcha ou bloquent l'accès automatisé. Echo ne peut pas lancer la recherche pour vous, mais il les répertorie dans le catalogue avec un lien direct et des notes sur la façon de les fouiller à la main. C'est le constat honnête — quand nous ne pouvons pas vous ouvrir quelque chose, nous le disons et vous indiquons où cela se trouve.

Comptes et limites

Vous pouvez utiliser Echo sans vous inscrire. L'usage anonyme a une limite quotidienne pour garder le service équitable et prévenir les abus. Un compte gratuit augmente cette limite et enregistre votre historique de recherche afin que vous puissiez revenir à vos recherches passées. Créer un compte demande une adresse e-mail et un mot de passe — aucun paiement, aucune formule à choisir. Créez un compte gratuit pour commencer.

Foire aux questions

Archivarix Echo est-il gratuit ?

Oui. Vous pouvez chercher sans compte. Un compte gratuit augmente simplement votre limite quotidienne et mémorise votre historique.

Comment ça marche ?

Echo ne stocke pas lui-même le contenu archivé. Il détecte ce que vous avez collé, interroge les archives publiques qui détiennent ce type de données et vous renvoie vers ce qu'elles ont. Les archives — la Wayback Machine, archive.today, Common Crawl, des index universitaires, des bibliothèques de livres et d'autres — capturent le web depuis des années.

Pourquoi certaines choses ne sont-elles pas trouvées ?

Les archives ne contiennent que ce qui a été capturé avant que cela ne disparaisse. Si aucune archive publique n'en a jamais indexé ou déposé une copie, il n'y a rien à récupérer. La couverture est la meilleure pour les contenus qui étaient publics, populaires ou largement cités.

Echo peut-il interroger automatiquement toutes les archives ?

Non — et nous ne prétendons pas le contraire. Les archives sans API utilisable, ou qui bloquent l'accès automatisé, sont répertoriées dans le catalogue comme en lien seul, avec un lien direct pour que vous puissiez les fouiller vous-même.

D'où proviennent les résultats ?

Entièrement d'archives publiques et de jeux de données ouverts. Echo est un index et un routeur posé au-dessus d'elles ; il n'héberge jamais le contenu sous-jacent, et chaque résultat renvoie vers sa source. Consultez À propos pour le tableau complet.