Parcourir le catalogue d’archives
Toutes les sources que nous connaissons : filtrez par catégorie, cluster, API ou accès, puis ouvrez n’importe quelle archive pour en savoir plus.
- Wayback Machine (Internet Archive) L'archive de pages web phare d'Internet Archive et la plus vaste de son genre, qui conserve plus de mille milliards de captures d'URL telles qu'elles se présentaient au fil du temps. Saisissez n'importe quelle adresse web pour parcourir son historique d'instantanés dans l'interface web ; des API gratuites permettent également de vérifier si une page est archivée et de lister chaque capture. C'est le premier réflexe lorsqu'il vous faut une version ancienne ou supprimée de presque n'importe quelle page web. Le service a connu des interruptions intermittentes en 2026 et bride les usages intensifs, mais les captures existantes restent consultables. Pages et sites web API
- archive.today (.ph / .is / .md / .li / .vn / .fo) Un archiveur à la demande où chacun peut soumettre une URL et obtenir un instantané permanent ; il aplatit les pages dynamiques en copies statiques et franchit souvent les barrières payantes, avec des dizaines de millions d'instantanés accumulés. Les captures existantes se retrouvent via sa timemap Memento et s'ouvrent sous forme de liens directs vers l'instantané sur archive.ph et ses domaines miroirs ; l'enregistrement d'une nouvelle page se fait sur le site et peut exiger la résolution d'un CAPTCHA. Recourez-y lorsqu'une page a changé ou disparu trop récemment pour les autres archives, ou lorsqu'un article payant doit être conservé sous une forme lisible. Pages et sites web API captcha
- Common Crawl (CDX index) Un projet à but non lucratif qui moissonne le web ouvert à l'échelle du pétaoctet et publie tout ce qu'il collecte, avec environ 2,2 milliards de pages par moissonnage et de nouveaux moissonnages diffusés régulièrement. Chaque moissonnage dispose d'une API d'index gratuite et sans clé qui indique si et quand une URL a été capturée, le contenu de la page stockée pouvant ensuite être extrait du jeu de données public. Il s'agit d'une série d'instantanés de moissonnage et non d'une archive à la demande : l'outil convient donc pour vérifier l'aspect d'un site lors des dernières fenêtres de moissonnage ou pour mener des recherches web en masse. Pages et sites web API
- Arquivo.pt (Portuguese Web Archive) L'archive du web nationale du Portugal, qui conserve des milliards de fichiers depuis 1996, y compris de nombreux sites non portugais. Fait rare parmi les archives du web, elle propose une recherche en texte intégral sur les pages conservées en plus de la consultation par URL, à la fois depuis son site et via des API gratuites. Tournez-vous vers elle lorsque vous devez chercher à l'intérieur du texte des pages archivées plutôt que simplement récupérer une adresse connue, ou lorsque vous étudiez l'histoire du web portugais et européen. Pages et sites web API
- Library of Congress Web Archives Le programme d'archivage du web éditorialisé de la Library of Congress : plus d'une centaine de collections thématiques de sites sélectionnées par ses bibliothécaires, à l'échelle du pétaoctet. Les collections se parcourent sur loc.gov, et les pages de collection comme de notice peuvent aussi être récupérées en JSON. Il donne toute sa mesure lorsque votre sujet correspond à l'un des thèmes retenus, élections, événements, organisations, plutôt que pour rechercher des URL quelconques. Pages et sites web API
- Perma.cc Un service d'archivage permanent du Library Innovation Lab de Harvard, conçu pour que les liens cités dans les écrits juridiques et universitaires ne se périment jamais ; il conserve des millions de liens permanents. Chaque page archivée reçoit un code perma.cc court qui rejoue la capture, et une API publique gratuite permet de consulter les enregistrements existants. Surtout utile lorsque vous suivez un lien Perma depuis un document judiciaire ou un article, ou lorsque vous vérifiez qu'une page a bien été conservée à titre de citation. Pages et sites web API
- Archive-It (Internet Archive) Le service d'archivage sur abonnement d'Internet Archive, utilisé par plus d'un millier de bibliothèques, d'administrations et d'universités pour constituer des collections web éditorialisées qui réunissent ensemble des dizaines de milliards de documents. Les captures se consultent via des liens de relecture sur wayback.archive-it.org, organisés par collection. Il s'avère payant lorsque la collection d'une institution précise couvre votre sujet ; la couverture s'organisant collection par collection, ce n'est pas l'endroit où rechercher une URL quelconque. Pages et sites web
- UK Government Web Archive (The National Archives) L'archive publique des sites de l'administration centrale britannique tenue par The National Archives, avec des milliards d'enregistrements remontant à environ 2003. Les pages archivées s'ouvrent via des liens de relecture dans son interface de type Wayback sur webarchive.nationalarchives.gov.uk. C'est là qu'il faut chercher les anciennes versions de gov.uk et des sites ministériels, en particulier tant que la UK Web Archive principale est hors ligne. Le serveur a rejeté nos vérifications automatisées : son comportement peut donc être irrégulier, passez directement par le site. Pages et sites web
- Vefsafn.is (Icelandic Web Archive) L'archive du web nationale de l'Islande, gérée par la Bibliothèque nationale et universitaire, qui moissonne l'intégralité du domaine .is environ trois fois par an depuis 2004 et conserve des sites liés à l'Islande depuis 1996. Les listes d'instantanés proviennent de sa timemap Memento, et les captures individuelles s'ouvrent sous forme de liens de relecture sur vefsafn.is, où l'interface peut vous soumettre un CAPTCHA. La source naturelle pour l'histoire des sites islandais. Pages et sites web API captcha
- Trove / Australian Web Archive (NLA) L'archive du web de la National Library of Australia. PANDORA, l'Australian Government Web Archive et les moissonnages du domaine .au réunis, soit des milliards de fichiers interrogeables via le portail Trove. Les captures s'ouvrent sous forme de liens de relecture sur webarchive.nla.gov.au ; l'API de Trove ne couvrant pas les sites archivés, la recherche se fait sur le site lui-même. La source principale pour l'histoire des sites australiens. Pages et sites web
- DNB Webarchiv (German National Library) L'archive du web sélective de la Bibliothèque nationale allemande, qui collecte des instantanés thématiques de sites allemands depuis 2012. Il n'existe pas d'API de recherche : les collections thématiques, consultables gratuitement depuis le monde entier, se parcourent depuis le portail, tandis que les contenus plus complets sont réservés aux salles de lecture de la bibliothèque. À consulter lorsque vous retracez des sites ou des sujets allemands couverts par ses collections.
- Ghostarchive Un petit archiveur à la demande indépendant, remarquable par sa capacité à traiter les vidéos YouTube et les publications Twitter au même titre que les pages web ordinaires. Les instantanés s'atteignent par des liens directs vers chaque page d'archive ; il n'existe pas d'API de recherche. À consulter lorsque vous recherchez des copies conservées de contenus issus des réseaux sociaux, que les archives du web classiques capturent généralement mal. Pages et sites web
- Conifer (Rhizome, ex-Webrecorder.io) Un service de capture hébergé par Rhizome (anciennement Webrecorder.io), destiné aux enregistrements interactifs haute fidélité de pages web, rassemblés dans des milliers de collections créées par les utilisateurs. Vous parcourez les collections et ouvrez les enregistrements individuels sur le site ; il n'existe pas d'API de recherche publique. Attention : le service ferme progressivement, la capture et l'édition s'arrêtent en mai 2026 et, à partir de juin 2026, il passe en lecture seule, même si les collections existantes restent consultables.
- Webrecorder / Browsertrix L'éditeur de Browsertrix et de la chaîne d'outils qui succède à Conifer : un logiciel de moissonnage auto-hébergeable ou hébergé qui produit des fichiers d'archive web WACZ/WARC. Il n'existe aucun corpus public central à interroger, chaque déploiement conservant ses propres captures. Pertinent lorsque vous voulez créer vous-même des archives haute fidélité de sites plutôt que rechercher des archives existantes.
- Stanford Web Archive Portal (SWAP) Le portail d'accès des bibliothèques de Stanford à ses collections d'archives du web éditorialisées, stockées via le service Archive-It. Le portail ne propose pas d'API de recherche : vous parcourez et ouvrez les captures sur le site. Surtout utile lorsque les collections éditorialisées de Stanford couvrent votre sujet, sachant que les mêmes contenus sont également accessibles via Archive-It.
- EU Web Archive (Publications Office) L'archive de l'Office des publications de l'UE consacrée aux sites des institutions, agences et organes européens, collectés depuis 2018. Elle se parcourt depuis le portail, sans API de recherche documentée. C'est là qu'il faut chercher des versions antérieures d'europa.eu et d'autres sites institutionnels ; notez que l'accès est bloqué depuis certains réseaux et que le portail peut donc ne pas s'afficher sur toutes les connexions. bloqué par IP
- KB Netherlands Web Archive L'archive du web de la Bibliothèque royale des Pays-Bas (« Websites van Nederland »), qui conserve environ 25 000 sites néerlandais éditorialisés, dont plusieurs milliers ont déjà disparu du web vivant. Il n'existe pas d'API de recherche publique, et l'accès approfondi aux contenus archivés est largement limité aux salles de lecture de la bibliothèque. À utiliser surtout comme indice qu'un site néerlandais disparu est peut-être conservé, la consultation complète se faisant sur place. bloqué par IP
- US NARA Web Harvests (webharvest.gov) La collection des Archives nationales des États-Unis regroupant les moissonnages web périodiques des sites du Congrès et de la présidence. La consultation se fait uniquement par navigation sur webharvest.gov, sans API de recherche. Recourez-y lorsque vous devez voir l'aspect des sites officiels du gouvernement américain à la clôture d'un Congrès ou d'une administration présidentielle.
- Kiwix / Zimit Un écosystème d'archivage hors ligne plutôt qu'un service de consultation : Kiwix conditionne des sites entiers. Wikipédia, StackExchange et des milliers d'autres, en fichiers ZIM téléchargeables, et Zimit permet de convertir d'autres sites dans le même format. Vous parcourez la bibliothèque de paquets et téléchargez des copies complètes de sites pour les lire hors ligne ; il n'y a pas de recherche d'instantané par URL. Utile lorsque vous voulez une copie complète et fonctionnelle d'un site plutôt qu'une capture datée d'une page isolée.
- PADICAT (Catalonia) L'archive du web nationale de la Catalogne, qui combine des sélections éditorialisées et des moissonnages du domaine .cat. Tout passe par son propre portail web, sans API confirmée : la recherche et la consultation des captures se font sur padicat.cat. La source de référence pour l'histoire des sites catalans, même si le site peut être lent à répondre.
- Croatian Web Archive (HAW) L'archive du web nationale croate, gérée par la Bibliothèque nationale et universitaire de Zagreb, qui conserve les sites en .hr par sélection éditorialisée et moissonnages annuels du domaine. L'accès se fait en parcourant le site de HAW ; aucune API n'est documentée. Elle couvre l'histoire du web croate, mais le site était inaccessible lors de nos dernières vérifications : sa disponibilité est donc actuellement incertaine.
- Bibliotheca Alexandrina Web Archive Le volet archive du web de la Bibliothèque d'Alexandrie, en Égypte, qui a historiquement hébergé un miroir de la collection d'Internet Archive antérieure à 2007, aux côtés de contenus régionaux. L'accès se fait en parcourant le site ; il n'existe pas d'API. Ses fonds actuels sont incertains, la page se charge, mais rien ne prouve récemment que le miroir fonctionne encore : vérifiez donc les contenus avant de vous y fier.
- Yandex (cache / SERP) Le moteur de recherche russe, mentionné ici parce qu'il est le dernier grand moteur à encore proposer des copies en cache de pages web. Il n'existe pas d'API stable : vous lancez une recherche ordinaire sur yandex.com et cherchez le lien « copie enregistrée » à côté d'un résultat. Cela vaut la peine d'essayer lorsqu'une page a disparu trop récemment pour que les archives du web l'aient captée. Attendez-vous à des vérifications anti-robots, le site soumettant fréquemment ses visiteurs à un contrôle avant d'afficher les résultats. Texte intégral du web captcha
- Crossref REST API Le registre faisant autorité pour les métadonnées de DOI dans l'édition scientifique, couvrant environ 165 millions de notices. Recherchez n'importe quel DOI pour obtenir sa notice bibliographique, ou effectuez une recherche par titre et auteur, depuis le site ou via une API ouverte gratuite. C'est la référence de base pour vérifier des citations et découvrir ce qu'un DOI identifie réellement. Articles scientifiques API
- Unpaywall Une base de données qui associe les DOI aux copies légales en libre accès des articles, en suivant le statut OA d'environ 150 millions de DOI. Donnez-lui un DOI et elle indique s'il existe une copie légitime et gratuite en texte intégral, et où, via une API gratuite et simple. La façon standard de répondre à la question « puis-je lire cet article payant gratuitement quelque part de manière légitime ? » API
- OpenAlex Un index ouvert du paysage de la recherche mondiale : environ 480 millions de travaux scientifiques reliés à des auteurs, des institutions et des thématiques. Vous pouvez l'explorer sur openalex.org ou interroger son API, qui exige depuis février 2026 une clé de compte gratuite (assortie d'un quota quotidien gratuit conséquent). Solide pour la cartographie large de la littérature, avec les travaux, les auteurs et la production institutionnelle réunis au même endroit. L'accès sans clé se limite désormais à un petit quota de démonstration quotidien. Articles scientifiques API · key
- Semantic Scholar (Academic Graph) Un moteur de recherche universitaire et un graphe de citations de l'Allen Institute for AI, couvrant environ 220 millions d'articles avec le contexte des citations. Faites vos recherches sur le site web, ou utilisez l'API Graph gratuite, qui n'exige aucune clé mais fonctionne sur un pool anonyme partagé et fortement bridé. Particulièrement pratique pour suivre les pistes de citations et voir comment les articles se rattachent les uns aux autres. En cas de charge, l'API sans clé est fréquemment limitée en débit : le site web est donc la voie la plus fiable. Articles scientifiques API
- DataCite REST API Le registre de DOI pour les productions de recherche autres que les articles de revues : jeux de données, logiciels et préprints, couvrant des dizaines de millions de DOI. Les notices peuvent être consultées ou recherchées via une API gratuite ne nécessitant aucune clé. C'est le complément de Crossref lorsque l'objet que vous recherchez est un jeu de données ou un logiciel de recherche plutôt qu'un article. Articles scientifiques API
- OpenCitations Un index ouvert des liens de citation scientifiques, comptant plus de deux milliards de connexions de DOI à DOI lors de son actualisation de février 2026. Le nombre de citations, les citations entrantes et les listes de références de n'importe quel DOI sont accessibles via une API gratuite ; la page de recherche du site web se trouve derrière un CAPTCHA, mais l'API répond proprement. Utilisez-le pour voir qui cite un article ou pour reconstituer des pistes de citations à partir de données entièrement ouvertes. API
- dblp (CS bibliography) La bibliographie sélective de l'informatique, qui indexe environ sept millions de publications issues des revues et des conférences du domaine, avec des notices d'auteurs soigneusement tenues à jour. Faites vos recherches sur dblp.org ou via son API gratuite. Son périmètre se limite strictement à l'informatique, mais dans ce domaine il constitue souvent le relevé le plus propre et le plus fiable de qui a publié quoi, où et quand. Articles scientifiques API
- arXiv (export API) Le serveur de préprints pour la physique, les mathématiques, l'informatique et les disciplines voisines, qui héberge environ 2,5 millions d'articles en texte intégral gratuit. Cherchez et parcourez le fonds sur arxiv.org, ou interrogez l'API export gratuite. C'est le premier endroit où chercher de nouveaux travaux avant leur publication en revue, ou à la place de celle-ci. Les requêtes automatisées sont plus strictement limitées depuis début 2026 : l'accès machine peut donc devoir ralentir. Articles scientifiques API
- bioRxiv Le serveur de préprints en biologie géré par le Cold Spring Harbor Laboratory, qui héberge plus de 300 000 préprints en texte intégral gratuit. Vous cherchez et lisez sur biorxiv.org ; le site affiche parfois une brève vérification Cloudflare avant de se charger, et les détails de chaque article sont également accessibles via une API gratuite. L'endroit où trouver la recherche en biologie des mois avant sa parution en revue. Articles scientifiques API captcha
- medRxiv Le serveur de préprints jumeau de bioRxiv pour la médecine et les sciences de la santé, avec plus de 60 000 préprints librement consultables. Utilisez le site medrxiv.org pour chercher et lire (il peut d'abord afficher une brève vérification du navigateur) ; les détails des articles sont également exposés via l'API bioRxiv partagée. À privilégier pour suivre la recherche clinique et de santé publique en amont de l'évaluation par les pairs. Articles scientifiques API captcha
- PubMed / PMC (NCBI E-utilities) L'index de la littérature biomédicale des National Institutes of Health des États-Unis, couvrant environ 37 millions de références ainsi qu'environ 10 millions d'articles en texte intégral dans PubMed Central. Vous interrogez le corpus via les E-utilities du NCBI, qui renvoient des résultats sans clé d'API. C'est le premier arrêt standard pour la littérature médicale, clinique et des sciences du vivant. Articles scientifiques API
- Europe PMC Une collection de littérature en sciences du vivant tenue par l'EMBL-EBI, couvrant environ 43 millions de publications ainsi que des contenus ouverts en texte intégral. Une interface de recherche unique et sans clé renvoie à la fois les métadonnées et, lorsqu'il est disponible, le texte intégral d'un article. À privilégier quand vous cherchez des articles biomédicaux et que vous avez besoin du texte même de l'article plutôt que d'une simple référence. Articles scientifiques API
- DOAJ Un répertoire de revues en libre accès vérifiées, accompagné de métadonnées au niveau des articles, couvrant environ 21 000 revues et plus de 10 millions d'articles. Les recherches passent par une interface sans clé sur ses métadonnées publiées sous licence ouverte, ou vous pouvez parcourir le site directement. Utilisez-le pour confirmer qu'une revue est véritablement en libre accès ou pour trouver des articles librement consultables. Articles scientifiques API
- DOAB (Open Access Books) Le pendant livresque du DOAJ : un répertoire de livres universitaires en libre accès évalués par les pairs, au nombre d'environ 95 000 titres. Son catalogue est consultable via une interface sans clé et peut aussi être parcouru sur le web. Tournez-vous vers lui quand vous avez besoin de monographies et d'ouvrages collectifs scientifiques librement consultables. Livres API
- OpenAIRE Graph Un graphe de connaissances européen de la science ouverte qui relie des centaines de millions de produits de recherche : publications, jeux de données, logiciels et notices de financement. Vous pouvez l'interroger via son API ou parcourir le portail Explore sur le web. C'est un bon choix pour retracer les liens entre un article et les données, les logiciels ou le financement qui le sous-tendent, même si le service est en pleine migration vers une nouvelle API de graphe en 2026 et que ses anciens points d'accès de recherche sont progressivement abandonnés. Articles scientifiques API
- CORE (core.ac.uk) Un agrégateur de recherche en libre accès qui moissonne le texte intégral et les métadonnées de plus de 10 000 dépôts, pour un total d'environ 300 millions de notices, dont plus de 40 millions d'éléments en texte intégral. L'accès se fait via une API de recherche qui exige une clé gratuite, l'usage anonyme étant fortement bridé. À privilégier quand vous voulez ratisser le plus largement possible le texte intégral en libre accès plutôt qu'un dépôt unique. API · key
- BASE (Bielefeld) Un moteur de recherche universitaire de l'université de Bielefeld qui indexe plus de 400 millions de documents moissonnés auprès de plus de 12 000 fournisseurs de contenu. Le portail web est librement consultable pour effectuer des recherches dans ce matériel. Son interface programmatique est limitée aux adresses IP préalablement enregistrées : en pratique, vous l'utilisez donc via le site web. bloqué par IP
- The Lens Une plateforme combinée de recherche et d'analyse couvrant les travaux scientifiques comme les brevets, avec plus de 270 millions de notices. L'interface web permet de chercher et de croiser littérature scientifique et littérature de brevets au même endroit. Son API est soumise à approbation et largement payante : la voie pratique reste le site web, utile lorsqu'une question porte à la fois sur les publications universitaires et sur les brevets.
- Dimensions (Digital Science) Une base de données de recherche liée qui connecte publications, financements, brevets, essais cliniques et documents de politique publique, avec plus de 140 millions de publications. Vous l'interrogez via son application web. L'accès programmatique est soumis à abonnement et à approbation : utilisez donc le site directement lorsque vous devez suivre un sujet à travers les financements, les essais et les politiques publiques autant qu'à travers les articles.
- Scite.ai Un service d'analyse des citations qui classe environ 1,6 milliard de citations selon qu'elles confirment une affirmation, la contredisent ou se contentent de la mentionner. Vous accédez au rapport de citations d'un article via des liens directs vers son site web. L'API est tarifée pour les entreprises : l'accès se fait donc par lien, ce qui est utile quand vous voulez savoir non seulement qui a cité un article, mais comment. captcha
- Connected Papers Un outil qui construit un graphe visuel des articles liés par similarité à un travail donné, à partir d'un corpus de dizaines de millions d'articles. Vous l'utilisez en ouvrant la vue en graphe d'un article sur son site web. Il n'existe pas d'interface de consultation ouverte : il fonctionne donc comme un lien direct, à privilégier pour découvrir la littérature adjacente à un article que vous connaissez déjà.
- Open Library Un catalogue ouvert et modifiable de livres, d'éditions et d'auteurs géré par l'Internet Archive, qui contient des notices pour plus de 40 millions d'éditions et d'œuvres, avec des liens vers des exemplaires empruntables. Vous pouvez chercher par titre ou consulter un ISBN précis via son API sans clé, ou parcourir le catalogue sur le web. C'est une étape générale solide pour les détails bibliographiques et pour savoir où un livre peut être lu ou emprunté. Livres API
- Internet Archive Texts La collection de textes et de livres d'archive.org, qui comprend plus de 40 millions de documents numérisés, certains accessibles uniquement par le prêt contrôlé. Une interface de recherche et de métadonnées sans clé permet de trouver des documents et de les ouvrir dans la liseuse. Utilisez-la pour établir qu'un livre ou un document existe et pour lire le matériel du domaine public, en gardant à l'esprit que le texte intégral encore sous droits est soumis au prêt et que le service peut brider les requêtes en cas de forte charge. Livres API
- scholar.archive.org / fatcat Le catalogue scientifique de l'Internet Archive (fatcat), qui offre une recherche en texte intégral dans plus de 25 millions d'articles en libre accès, y compris des copies de préservation d'articles. Vous l'interrogez via le site scholar.archive.org. Il vaut mieux y accéder par l'interface web pour l'instant, son API de consultation s'étant révélée peu fiable lors du dernier contrôle. Articles scientifiques
- HathiTrust Une grande bibliothèque numérique collaborative de plus de 18 millions de volumes numérisés issus de bibliothèques de recherche. Une interface bibliographique sans clé renvoie des notices de catalogue avec des liens directs vers la liseuse ; les volumes du domaine public sont consultables, tandis que le texte intégral sous droits est réservé aux membres affiliés. À privilégier pour vérifier les fonds et accéder aux volumes numérisés, même si son interface de recherche peut afficher une page de vérification depuis certains réseaux. Livres API captcha
- Google Books API L'index des volumes de livres de Google, qui couvre des dizaines de millions de titres avec leurs métadonnées et, lorsque cela est autorisé, des aperçus. Vous pouvez chercher par titre ou par ISBN via son API, et une clé gratuite relève le quota de requêtes autrement très restreint. Il offre une large couverture pour confirmer l'existence d'un livre et les détails d'une édition, ainsi que pour trouver des pages d'aperçu. Livres API
- Project Gutenberg (Gutendex) La collection classique d'environ 75 000 livres numériques gratuits du domaine public, le service Gutendex exposant son catalogue en JSON pour une recherche par titre ou par auteur. Vous pouvez aussi le parcourir et télécharger directement depuis le site de Gutenberg. C'est la référence pour obtenir le texte intégral et gratuit d'œuvres tombées dans le domaine public, même si l'interrogation du catalogue peut être lente ou expirer à l'occasion. Livres API
- Standard Ebooks Une petite collection soigneusement produite d'environ 900 livres numériques du domaine public, polis et mis en forme selon des exigences élevées, avec un flux OPDS. Vous parcourez et téléchargez les titres depuis son site web. À privilégier quand vous voulez une édition propre et bien typographiée d'un classique plutôt qu'une numérisation brute. Livres bloqué par IP
- Wikisource La bibliothèque de Wikimedia consacrée aux textes sources sous licence libre : livres transcrits, documents, discours et matériaux historiques, pour un total de plusieurs millions de pages. La recherche se fait via l'API MediaWiki standard ou sur le site web. Utile pour trouver le texte intégral, transcrit et citable, de documents du domaine public et de sources primaires. Livres API
- WorldCat / OCLC Le plus grand catalogue collectif de fonds de bibliothèques au monde : plus de 550 millions de notices agrégées, indiquant quelles bibliothèques possèdent un document donné. La recherche s'effectue via l'interface web search.worldcat.org. Il n'existe plus d'API gratuite, il faut donc passer par le site web ; celui-ci reste la référence pour localiser un exemplaire physique en bibliothèque.
- Trove books (NLA) Le service de découverte de la Bibliothèque nationale d'Australie pour les livres, les journaux, les images et les documents australiens, portant sur des milliards de documents. La recherche s'effectue sur le site de Trove ou via son API, avec une clé gratuite. C'est la ressource principale pour les publications et les documents historiques australiens ; notez qu'elle couvre des livres et des notices de catalogue, et non des captures d'archives du web. API · key
- Anna's Archive Un index de méta-recherche portant sur plusieurs bibliothèques de l'ombre. LibGen, Sci-Hub, Z-Library, auxquelles s'ajoutent des collections moissonnées, soit environ 64 millions de livres et 96 millions d'articles. Il pointe vers des copies d'œuvres hébergées ailleurs, souvent protégées par le droit d'auteur : il fonctionne donc comme un annuaire de liens plutôt qu'en servant les fichiers lui-même. Les chercheurs l'utilisent comme point de recherche unique sur plusieurs sources de l'ombre, mais ses domaines changent fréquemment et le miroir actif doit être résolu au moment de la requête. Livres captcha
- Library Genesis (LibGen) Une bibliothèque de l'ombre de longue date rassemblant des millions de livres, de manuels et d'articles. Elle indexe des contenus protégés par le droit d'auteur et hébergés ailleurs : elle agit donc comme une source de liens plutôt que comme un hébergeur de contenus. Ses domaines miroirs changent souvent et doivent être résolus au moment de la requête, ce qui rend l'accès intermittent. Livres bloqué par IP
- Sci-Hub Un service qui fournit le PDF en texte intégral d'articles de revues payants, recherchés par DOI, avec un corpus d'environ 88 millions d'articles. Il renvoie vers des contenus protégés par le droit d'auteur hébergés ailleurs plutôt que de les servir directement. La collection est largement figée autour de 2021 : c'est donc une solution au mieux pour les DOI plus anciens, et ses domaines miroirs changent régulièrement. Articles scientifiques captcha
- Z-Library Une vaste bibliothèque de l'ombre de livres numériques et d'articles, forte de dizaines de millions de documents accessibles après connexion à un compte. Elle indexe des contenus protégés par le droit d'auteur hébergés ailleurs et agit donc comme un annuaire de liens ; de nombreux clones d'hameçonnage l'imitent. L'accès est fragile en raison du mur d'authentification et de la rotation fréquente des domaines. captcha
- Bluesky public AppView (AT Protocol) Une interface ouverte et sans clé sur l'ensemble du réseau social Bluesky : profils, publications et fils de dizaines de millions de comptes. Les lectures publiques de profils et de fils passent par son API sans aucune connexion ni clé. C'est le moyen le plus propre d'intégrer directement dans les résultats de recherche des publications et des profils sociaux à jour. API
- Telegram public preview (t.me/s/) L'aperçu web officiel de Telegram, rendu côté serveur, pour n'importe quel canal public : il affiche les publications récentes sans application ni connexion. Il suffit d'ouvrir la page d'aperçu du canal sur t.me. C'est la façon la plus simple de lire et de récupérer les publications des canaux Telegram publics. API
- Wayback, twitter/x URLs La Wayback Machine appliquée aux URL de twitter.com et de x.com, qui restitue les instantanés archivés de tweets et de profils là où ils ont été moissonnés. Vous pouvez vérifier si un tweet précis a été capturé et ouvrir la copie sauvegardée via les liens de rejeu. C'est l'un des moyens les plus fiables de retrouver des tweets supprimés, même si la couverture est lacunaire et surtout fournie pour les comptes très en vue. Réseaux sociaux API
- Wayback Tweets (claromes) Un outil qui interroge l'index de captures de la Wayback Machine pour lister tous les tweets archivés d'un identifiant donné. Il s'appuie sur les mêmes données de capture de la Wayback, restreintes à un compte à la fois. À utiliser pour recenser les tweets archivés survivants d'un utilisateur, sachant que l'application hébergée se met souvent en veille ou expire. Réseaux sociaux API
- archive.today. X / Facebook archive.today employé spécifiquement pour les pages X et Facebook que le robot de la Wayback ne parvient souvent pas à atteindre, avec des dizaines de millions d'instantanés réalisés à la demande. L'existence d'une capture se vérifie via son timemap Memento, et l'instantané sauvegardé s'ouvre par un lien direct. Précieux pour les pages sociales que les autres archives manquent, même si les pages d'instantanés peuvent limiter le débit et que le service a subi des blocages régionaux en 2026. Réseaux sociaux API captcha
- Wayback, facebook.com La Wayback Machine appliquée aux URL de facebook.com, qui fait ressortir les instantanés archivés de pages et de publications Facebook publiques là où elles ont été capturées. Vous vérifiez l'existence d'une capture et ouvrez les copies sauvegardées via ses liens de rejeu. La couverture est clairsemée parce que Facebook bloque les robots et que beaucoup de captures ne contiennent que la page intermédiaire de connexion : les résultats sont donc meilleurs pour les Pages publiques. Réseaux sociaux API
- Wayback, reddit.com La Wayback Machine appliquée aux URL de reddit.com, qui conserve des instantanés archivés de fils et de profils avec une bonne couverture des discussions populaires. Vous vérifiez si un fil a été capturé et ouvrez la copie sauvegardée via les liens de rejeu. Comme elle ne dépend pas de l'API de Reddit, c'est l'un des moyens les plus fiables de récupérer des contenus Reddit retirés ou supprimés. Réseaux sociaux API
- IA Twitter Stream Grab Un ensemble de vidages en masse, réalisés par l'Internet Archive, de l'ancien flux public d'échantillon de Twitter, stockés en fichiers JSON mensuels et couvrant des milliards de tweets d'environ 2011 à 2023. On y accède en téléchargeant les fichiers du jeu de données, listés via l'API de métadonnées de l'item. Il est destiné à l'analyse hors ligne en masse de données Twitter historiques plutôt qu'à la consultation d'un tweet précis ; le jeu de données est figé, le flux source n'existant plus. Réseaux sociaux API
- PullPush.io Un successeur ouvert de Pushshift offrant une recherche en texte intégral sans clé dans les commentaires et les publications Reddit, y compris les contenus retirés ou supprimés par la suite. Vous l'interrogez via son API JSON, par subreddit ou par mot-clé. C'est le principal outil pratique pour explorer l'histoire de Reddit et récupérer des publications retirées. Réseaux sociaux API
- Arctic Shift Un service de données Reddit proposant une API sans clé, des vidages en masse téléchargeables et une interface web, avec des limites plus généreuses que PullPush. Sa recherche en texte intégral porte sur un utilisateur ou un subreddit précis plutôt que sur l'ensemble du site. À utiliser en complément de PullPush lorsque vous avez besoin de données Reddit archivées au sein d'une communauté ou d'un compte particulier. Réseaux sociaux API
- Reddit Data API (official) L'API de données propre à Reddit, où l'ajout de .json à l'URL d'une page en renvoie le contenu sans authentification, OAuth débloquant davantage. Elle sert des données Reddit actuelles et en direct, publications, commentaires et profils, mais n'offre aucune recherche historique profonde. À utiliser pour le contenu Reddit du moment, en l'associant à PullPush ou à Arctic Shift lorsque vous avez besoin du passé. API
- Desuarchive (4chan archive) Une archive fondée sur FoolFuuka couvrant une sélection de forums 4chan (/a/, /int/, /k/, /tg/, /wsg/ et d'autres) avec un long historique. Elle conserve des copies des fils interrogeables en texte intégral, ce qui permet de retrouver d'anciennes publications 4chan après leur disparition de 4chan lui-même, sur le site web ou via son API JSON sans clé. Une source essentielle pour la recherche sur les forums qu'elle couvre ; notez que certains forums comportent des contenus NSFW ou extrêmes. Réseaux sociaux API
- Mastodon per-instance API Chaque serveur Mastodon expose une API REST intégrée, et les lectures publiques telles que la consultation de comptes et les fils publics fonctionnent généralement sans jeton. Il n'existe pas de recherche globale : chaque requête vise une instance précise, la fédération n'offre qu'une portée partielle entre instances, et la recherche en texte intégral exige un jeton sur la plupart des serveurs. À utiliser pour consulter un compte Mastodon particulier ou parcourir les publications publiques d'une instance. API
- Fediverse Observer Un annuaire et un moniteur de disponibilité couvrant des milliers de serveurs du Fédiverse et de Mastodon, adossé à un point d'accès GraphQL. Utilisez le site web pour découvrir quelles instances existent et lesquelles sont actuellement en vie. Il ne conserve aucune publication : c'est la première étape naturelle avant de creuser un serveur Mastodon précis.
- Nitter (xcancel.com et al.) Des interfaces respectueuses de la vie privée pour X/Twitter (xcancel.com et instances Nitter similaires) qui affichent profils et fils sans connexion, avec des flux RSS par utilisateur. Elles n'affichent que des données X en direct, ce ne sont pas des archives, et l'écosystème s'est largement effondré, seules quelques instances subsistant. Utile pour lire un compte X sans en posséder un soi-même, mais attendez-vous à des blocages et à des pannes ; consultez d'abord le moniteur de santé Nitter pour trouver une instance opérationnelle. bloqué par IP
- Nitter health tracker Une page d'état en direct indiquant lesquelles des instances Nitter restantes sont actuellement en ligne. Elle ne contient aucun contenu propre : c'est un utilitaire que vous ouvrez d'abord pour choisir un miroir Nitter opérationnel avant d'essayer de consulter des profils X/Twitter par son intermédiaire. Il suffit de l'ouvrir dans le navigateur ; il n'y a rien à rechercher.
- Thread Reader App Déroule les fils X/Twitter en pages uniques et lisibles ; une fois un fil déroulé, la page subsiste même si les tweets d'origine sont supprimés. Des millions de fils déroulés sont consultables sans aucune connexion, à des adresses prévisibles de la forme /thread/<tweetid>.html. Pratique pour récupérer un fil supprimé que quelqu'un avait déroulé pendant qu'il était en ligne ; créer de nouveaux déroulés exige un compte X pour mentionner le robot.
- Politwoops (ProPublica) L'archive de ProPublica des tweets supprimés par des responsables politiques, qui rassemble environ un million de suppressions collectées entre 2012 et 2023. Vous la parcourez sur le web, sans API, en recherchant un responsable politique pour voir ce qu'il a retiré. La collection est figée : le suivi a cessé en 2023, il s'agit donc strictement d'un témoignage historique de cette période.
- Telegago (Google CSE) Un Google Custom Search configuré pour fouiller les pages publiques de Telegram (t.me), canaux, publications et profils, que Google a indexées. Vous l'utilisez comme un champ de recherche ordinaire dans le navigateur ; la couverture se limite à ce que Google a moissonné de t.me. Un moyen rapide et gratuit de découvrir des canaux Telegram sur un sujet quand vous ne savez pas par où commencer.
- TGStat Le plus grand service de catalogage et d'analytique pour Telegram, couvrant plus de 2,5 millions de canaux et groupes publics, avec recherche dans les publications et statistiques d'audience. Utilisez le site web pour trouver des canaux par thème ou par mot-clé et examiner leur portée ; l'API est payante et soumise à un jeton. La référence pour cartographier l'écosystème Telegram autour d'un sujet ou pour enquêter sur un canal précis. captcha
- Telemetr.io Un vaste index analytique de Telegram, au rôle comparable à celui de TGStat : statistiques de canaux et données de publications pour la sphère publique de Telegram. L'intégralité des données est réservée aux comptes connectés et aux abonnements payants : considérez-le donc comme un site que l'on ouvre et explore plutôt que comme un service à interroger librement. Il était injoignable lors de notre dernier contrôle de disponibilité, attendez-vous donc à d'éventuelles indisponibilités.
- SocialData API Une API commerciale qui renvoie des données X/Twitter : recherche, profils d'utilisateurs et tweets, sans passer par l'API officielle de X. Elle est purement programmatique : les requêtes nécessitent une clé d'API payante, facturée par tweet récupéré, et il n'existe aucune interface de consultation gratuite. Pertinente lorsque vous avez besoin de résultats de recherche X fiables en volume et que vous disposez d'un budget pour cela. API · key
- X API v2 (official) L'interface officielle pour développeurs de X (Twitter), couvrant l'intégralité de la plateforme. Depuis le début de 2026, elle fonctionne selon un modèle de crédits à l'usage, l'offre gratuite ayant été supprimée, et la recherche sur l'archive complète est réservée à des offres supérieures coûteuses. Pour la recherche en archives, c'est désormais un dernier recours, exploitable seulement si vous êtes prêt à payer à la requête ; ce site pointe vers elle plutôt que de l'interroger.
- Meta Content Library L'outil de recherche de Meta pour étudier les contenus publics de Facebook et d'Instagram, successeur de CrowdTangle, qui expose les publications avec plus de 100 champs de données. L'accès est réservé aux chercheurs universitaires et associatifs agréés, qui travaillent dans l'environnement sécurisé de Meta après validation par ICPSR ; il n'existe ni site public ni API ouverte. Répertorié pour que les chercheurs sachent qu'une voie officielle vers les données Facebook/Instagram existe ; adressez votre candidature à ICPSR si vous y êtes éligible. bloqué par IP
- Reveddit Affiche les contenus Reddit supprimés par les modérateurs ou par AutoModerator pour un utilisateur ou un fil donné. Vous l'utilisez sur le web en saisissant un nom d'utilisateur ou le lien d'un fil ; il n'offre pas d'API stable. Depuis la perte de sa source de données Pushshift, sa profondeur est bien moindre, essentiellement des contenus retirés par la modération, et le site est protégé par un test anti-robot : considérez donc les résultats comme fournis au mieux, sans garantie. captcha
- redditsearch.io Une ancienne interface de recherche Reddit alimentée par l'archive Pushshift. L'accès public à Pushshift ayant disparu, elle est de fait non fonctionnelle pour la recherche, même si la page se charge encore. Conservée uniquement par souci d'exhaustivité ; pour les contenus Reddit historiques, utilisez plutôt PullPush ou Arctic Shift.
- twstalker / Sotwe (X viewers) Des visionneuses tierces (twstalker, Sotwe et similaires) qui extraient les données de X/Twitter et réaffichent les tweets récents d'un profil sans connexion. La couverture se limite à un profil et à ses publications récentes, l'accès se faisant en ouvrant le site dans un navigateur. Ces outils d'extraction sont fragiles et fréquemment bloqués : nos vérifications se sont heurtées à des erreurs et à des tests anti-robot, considérez-les donc comme une solution de repli occasionnelle et non comme une source fiable. captcha
- Picuki (IG viewer) Une visionneuse Instagram anonyme pour parcourir profils, publications et stories publics sans compte. Elle fonctionne uniquement comme site web, sans API, dans un bras de fer permanent avec les défenses d'Instagram. Utile pour jeter un coup d'œil rapide à un compte IG public sans connexion, mais elle est protégée par des tests anti-robot et cesse de fonctionner par intermittence. captcha
- Imginn (IG viewer) Une visionneuse et un téléchargeur sans connexion pour les publications et stories Instagram publiques. Elle fonctionne uniquement dans le navigateur, sans API, et comme les autres visionneuses IG, elle repose sur l'extraction et reste fragile. Nos vérifications de disponibilité l'ont trouvée bloquée ou soumise à un test anti-robot : gardez donc des solutions de rechange sous la main si elle ne se charge pas. captcha
- AnonyIG (IG story viewer) L'une des nombreuses visionneuses anonymes de stories et de contenus « à la une » Instagram ne nécessitant aucune connexion. Vous l'utilisez directement dans le navigateur pour consulter les stories d'un compte public ; il n'y a pas d'API. Instagram met activement ces services en échec : nos vérifications se sont heurtées à des blocages juridiques et à des erreurs, attendez-vous donc à essayer plusieurs visionneuses similaires avant qu'une fonctionne. bloqué par IP
- Bluesky Firehose / Jetstream Le flux d'événements en temps réel de Bluesky, couvrant l'ensemble du réseau à mesure qu'il évolue ; Jetstream est le service compagnon qui livre le même flux sous une forme JSON plus simple. C'est un flux WebSocket destiné aux développeurs, sans clé, conçu pour la surveillance en direct et la collecte de données plutôt que pour retrouver d'anciennes publications. Pertinent lorsque vous voulez capturer ou observer l'activité de Bluesky en temps réel. API
- 4plebs (4chan archive) Une archive de longue date de plusieurs forums 4chan (/pol/, /x/, /tv/, /adv/ et d'autres) conservant des années d'historique interrogeable en texte intégral. La recherche se fait via le site web ; son API JSON existe mais des défenses anti-scraping la bloquent depuis de nombreux réseaux, l'accès automatisé est donc peu fiable. Une source clé pour retrouver d'anciens fils 4chan supprimés sur ces forums ; sachez qu'elle contient des contenus NSFW et extrêmes. Réseaux sociaux bloqué par IP
- archived.moe (4chan) Une archive 4chan remarquable par sa couverture multi-forums inhabituellement large et son important historique. Prévoyez d'utiliser directement le site web : une API existe techniquement, mais les défenses anti-robot bloquent les clients automatisés aussi bien sur les pages que sur l'API. À vérifier lorsqu'un fil ne se trouve ni sur Desuarchive ni sur 4plebs, sachant que ses protections anti-extraction peuvent également gêner les visites ordinaires ; à ne pas confondre avec archive.moe, disparu depuis longtemps. captcha
- Software Heritage Une archive universelle du code source, la « bibliothèque d'Alexandrie du code », qui préserve plus de 20 milliards de fichiers sources uniques issus de plus de 350 millions de projets. Vous pouvez y rechercher des projets, retrouver des fichiers par empreinte (sha1/sha256/git) et résoudre des identifiants permanents SWHID, sur le site web ou via son API REST sans clé. L'endroit où aller quand un dépôt a disparu de son hébergeur d'origine, ou quand vous devez identifier un fichier par son empreinte. Logiciels et paquets API
- Wikimedia Commons Le plus grand dépôt de médias sous licence libre, avec plus de 110 millions de fichiers, derrière Wikipédia et ses projets frères. Tout est interrogeable sur le site web, et l'API MediaWiki standard fournit la même recherche sans clé. À privilégier lorsque vous avez besoin d'images et d'autres médias sous licence ouverte, avec des sources et des licences documentées. Images API
- Openverse Un moteur de recherche issu du projet WordPress couvrant plus de 800 millions d'images et de fichiers audio sous licence ouverte ou dans le domaine public, provenant de nombreuses collections sources. Recherche possible sur le site web ou via son API sans clé. Idéal lorsque vous voulez des médias réutilisables et une requête unique sur de nombreuses collections ouvertes plutôt que de les consulter séparément. Images API
- Internet Archive (Video) Le fonds vidéo de l'Internet Archive : des millions d'éléments couvrant films, télévision et documents éphémères. La recherche et les métadonnées sont accessibles via le site web ou l'API de recherche archive.org sans clé. Une source de premier plan pour des séquences anciennes, obscures ou autrement disparues ; elle partage les interruptions intermittentes et les limitations de débit de l'Internet Archive en 2026, quelques nouvelles tentatives peuvent donc être nécessaires. Vidéo, audio, musique API
- Internet Archive (Audio) / Live Music Des millions d'éléments audio ouverts à l'Internet Archive, dont la Live Music Archive et ses plus de 250 000 concerts enregistrés légalement. L'ensemble est interrogeable sur le site web, avec la même API de recherche et de métadonnées sans clé que le reste d'archive.org. La première étape pour les enregistrements en public, les vieilles émissions et tout autre audio introuvable ailleurs. Vidéo, audio, musique API
- YouTube via Wayback Machine Une technique de récupération plutôt qu'un site distinct : consulter d'anciennes captures de pages de visionnage YouTube dans la Wayback Machine pour retrouver les métadonnées, titres et vignettes de vidéos supprimées ou modifiées. Vous vérifiez l'existence d'une capture via l'API de disponibilité de la Wayback Machine, puis vous ouvrez la page archivée elle-même. La couverture se limite aux URL de visionnage que la Wayback Machine a eu l'occasion d'enregistrer, et vous récupérez généralement la page plutôt que le flux lisible : associez-la à Filmot ou Ghostarchive lorsque vous traquez une vidéo perdue. API
- Dailymotion Un grand hébergeur vidéo occidental comptant des centaines de millions de vidéos et une recherche particulièrement stable grâce à son API Graph publique sans clé. Dans nos recherches sur les endroits où réapparaissent les vidéos YouTube disparues, il s'est imposé comme la meilleure source de remise en ligne librement accessible. À consulter lorsque vous cherchez une copie d'une vidéo disparue de YouTube ; il est ici proposé sous la forme d'un lien vers le site. Vidéo, audio, musique
- RuTube Le principal hébergeur vidéo russe, avec des dizaines de millions de vidéos ; nos recherches ont relevé un recoupement d'environ 4 % avec les remises en ligne de YouTube. La recherche fonctionne sur le site web, même si son point de terminaison de recherche informel limite le débit et oppose des captchas aux rafales de trafic automatisé. À consulter lorsqu'une vidéo russophone ou relative à la Russie a disparu de YouTube. Vidéo, audio, musique captcha
- VK Video La branche vidéo de VKontakte, qui héberge des milliards de clips et offre un fort potentiel pour retrouver des remises en ligne russophones. L'essentiel se trouve derrière une barrière de connexion : la recherche web exige un compte et l'API officielle nécessite une application enregistrée et un jeton d'accès. À vérifier lorsque vous cherchez des contenus vidéo de la sphère russophone, mais attendez-vous à devoir vous connecter pour effectuer la recherche. bloqué par IP
- Odysee Une plateforme vidéo bâtie sur le protocole LBRY, hébergeant des dizaines de millions d'éléments avec un accès particulièrement ouvert : ni captcha ni barrière de connexion lors de nos recherches. Vous pouvez y effectuer une recherche directement sur le site web. Un bon candidat à vérifier pour les remises en ligne lorsqu'une vidéo a été retirée des plateformes grand public. Vidéo, audio, musique
- Rumble Un hébergeur vidéo américain comptant des centaines de millions d'éléments. Il n'a pas d'API publique stable et bloque le trafic des centres de données : effectuez donc la recherche directement sur le site web depuis une connexion ordinaire. À inclure lorsque vous passez en revue les hébergeurs vidéo à la recherche de remises en ligne de contenus disparus ailleurs. Vidéo, audio, musique bloqué par IP
- BitChute Un hébergeur vidéo indépendant comptant des millions de vidéos. Il n'existe pas d'API publique stable et la page de recherche est protégée par un hCaptcha contre les visiteurs automatisés : effectuez donc la recherche manuellement dans le navigateur. Une étape classique lorsque l'on passe en revue les plateformes vidéo alternatives à la recherche de copies de séquences retirées ou difficiles à trouver. Vidéo, audio, musique captcha
- OK.ru Video La branche vidéo d'Odnoklassniki, grand réseau social russe hébergeant des centaines de millions de clips. Son intérêt tient surtout au fait que des séquences russophones ou des remises en ligne de vidéos disparues peuvent y survivre. Il n'existe pas de voie d'interrogation ouverte, l'API officielle exigeant une application enregistrée et une clé : vous utilisez donc sa recherche sur site via un lien direct. Actuellement dégradé : le site renvoie des résultats vides aux connexions automatisées, effectuez donc la recherche manuellement dans un navigateur. bloqué par IP
- Bilibili La plus grande plateforme vidéo de Chine, qui héberge des centaines de millions de vidéos. Pour qui fait des recherches en archives, elle compte comme point de chute possible de réuploads et de documents en langue chinoise qui n'existent nulle part ailleurs. Il n'existe pas d'API anglophone sans clé, et la recherche depuis l'extérieur de la Chine est verrouillée par des contrôles géographiques et des captchas : c'est donc une ressource à consulter par lien, ouvrez le site et cherchez-y directement. Vidéo, audio, musique captcha
- Torrents-CSV Un moteur de recherche de torrents ouvert, bâti sur un jeu de données CSV maintenu par la communauté et indexant des millions de torrents ; l'ensemble du service peut également être auto-hébergé. Il expose une API JSON simple et sans clé, de sorte que les recherches s'exécutent automatiquement et renvoient des résultats propres. Utile pour vérifier si un fichier ou une release disparue du web circule encore sur BitTorrent. Il ne fournit que des liens vers des torrents : évaluez donc la légalité de ce que vous téléchargez. Torrents API
- Academic Torrents Une plateforme de diffusion de jeux de données de recherche et de données universitaires via BitTorrent, soit des pétaoctets de contenus partagés légitimement. Vous pouvez chercher et parcourir librement les collections, et la lecture ne demande ni clé ni compte. À privilégier lorsqu'un grand jeu de données public est plus facile à récupérer en torrent que depuis un serveur institutionnel lent ou fragile. Torrents API
- The Pirate Bay (apibay) L'index de torrents généraliste le plus ancien encore en activité, doté d'un très vaste catalogue couvrant tous les types de contenus. La voie d'accès pratique est apibay.org, son backend de recherche JSON sans clé, le site principal étant largement bloqué par les fournisseurs d'accès. Les chercheurs l'utilisent pour vérifier si des logiciels, médias ou documents disparus circulent encore sous forme de torrents. Les résultats pointent en grande partie vers des contenus sous droits d'auteur : traitez-les uniquement comme des liens. Torrents API
- Nyaa L'index de torrents de référence pour l'animation japonaise et les médias d'Asie de l'Est. Son flux RSS fait office d'API de requête simple et sans clé, et les résultats renvoient vers les pages de torrents. L'endroit où chercher d'anciens fansubs, des éditions épuisées et des œuvres japonaises n'ayant jamais eu d'édition occidentale. Comme pour tout index de torrents, considérez les résultats comme des liens à la légalité variable. Torrents API
- SauceNAO La recherche d'image inversée de fait pour l'animation japonaise, le manga et le fan art, indexant des milliards d'images issues de sources telles que Pixiv et Danbooru. Soumettez une image ou l'URL d'une image et le service identifie d'où provient l'œuvre ; une API JSON existe, mais elle exige une clé gratuite obtenue après inscription. Indispensable lorsqu'il faut remonter d'une illustration à son auteur d'origine ou à sa première publication. Images API · key
- VirusTotal La recherche canonique de fichier par empreinte : elle agrège les verdicts antivirus et les analyses en bac à sable pour des milliards de fichiers, d'URL et de domaines. Collez une empreinte ou une URL sur le site pour obtenir un rapport consolidé, ou utilisez son API JSON avec une clé gratuite pour des recherches automatisées. Les chercheurs en archives y ont recours pour identifier un fichier inconnu ou vérifier si une empreinte correspond à un logiciel malveillant connu avant de le manipuler. Fichier par empreinte API · key
- MalwareBazaar (abuse.ch) Un dépôt gratuit d'échantillons de logiciels malveillants proposé par abuse.ch, qui conserve des millions d'échantillons consultables par empreinte, étiquette ou signature de logiciel malveillant. Les requêtes passent par son API, qui exige désormais une Auth-Key abuse.ch gratuite (une seule clé couvre leurs services apparentés). À utiliser lorsque vous disposez de l'empreinte d'un fichier suspect et voulez savoir s'il s'agit d'un échantillon répertorié, ou lorsque vous avez besoin de l'échantillon lui-même pour l'analyser. API · key
- URLhaus (abuse.ch) La base de données d'abuse.ch consacrée aux URL de distribution de logiciels malveillants, qui recense des millions de liens malveillants consultables par URL, par hôte ou par empreinte de charge utile. Les recherches passent par une API simple utilisant la même Auth-Key abuse.ch gratuite que leurs autres services. À consulter lorsque vous voulez savoir si une URL trouvée dans une page archivée ou un ancien jeu de données était connue pour diffuser des logiciels malveillants. API · key
- ThreatFox (abuse.ch) Une plateforme ouverte de partage d'indicateurs de compromission proposée par abuse.ch, qui répertorie des millions d'adresses IP, de domaines, d'empreintes et d'URL liés à des logiciels malveillants nommément identifiés. Elle s'interroge via son API avec l'Auth-Key abuse.ch gratuite. Utile pour replacer un artefact dans son contexte : recherchez une empreinte ou un domaine et découvrez à quelle famille ou à quelle campagne de logiciels malveillants il a été associé. API · key
- Triage (tria.ge) Un bac à sable automatisé d'analyse de logiciels malveillants exploité par Recorded Future, doté d'un vaste corpus public d'échantillons analysés. Les rapports publics sont consultables par empreinte de fichier, et l'accès à l'API utilise un jeton issu d'un compte Researcher gratuit. Une bonne étape suivante après une recherche d'empreinte ailleurs, lorsque vous voulez voir ce que fait réellement un échantillon à l'exécution. API · key
- MalShare Un dépôt public de logiciels malveillants géré par la communauté, riche de millions d'échantillons, offrant la recherche par empreinte et le téléchargement d'échantillons. Son API, simple d'emploi, requiert une clé, mais celle-ci est gratuite : l'inscription en libre-service donne droit à 2 000 appels par jour. Une solution moins contraignante que les dépôts sur invitation lorsque vous devez vérifier ou récupérer un échantillon à partir d'une empreinte. API · key
- Maltiverse Un agrégateur de renseignement sur les menaces permettant de confronter adresses IP, domaines, URL et empreintes de fichiers à un vaste jeu de données d'IOC mutualisé. Les recherches passent par son API JSON, avec des clés disponibles dans une offre gratuite. Utilisez-le pour enrichir un artefact issu de vos recherches, par exemple une empreinte ou un domaine extrait d'une page archivée, avec ce que les flux de menaces en savent collectivement. API · key
- Flickr L'une des plus vastes archives de partage de photos du web, riche de milliards de clichés, un réservoir profond de photographie historique et communautaire. La recherche s'effectue sur le site, et une API REST mature existe pour un accès avec clé. À interroger lorsque vous recherchez des photographies originales de lieux, d'événements ou de communautés du web des débuts. Dégradé pour les nouvelles intégrations : les nouvelles clés d'API exigent désormais un abonnement payant Flickr Pro (les clés existantes continuent de fonctionner), prévoyez donc de passer par l'interface web. API · key
- Imgur Un hébergeur d'images majeur, longtemps utilisé comme back-end d'images par défaut de Reddit et d'innombrables forums. Les anciens dépôts peuvent être récupérés par identifiant d'image, sur le site ou via une API qui nécessite un Client-ID gratuit. Son intérêt tient surtout à la résolution des liens imgur trouvés dans des discussions archivées. Gardez à l'esprit que sa valeur archivistique a chuté après la purge des contenus anonymes de 2023 : beaucoup d'anciens identifiants ne renvoient plus rien, vérifiez donc qu'un lien fonctionne encore avant de vous y fier. API · key
- DeviantArt Une communauté artistique en ligne de longue date, qui héberge des centaines de millions d'œuvres. Vous pouvez chercher et parcourir librement sur le site, et une API fondée sur OAuth couvre la consultation et la recherche publiques pour les applications enregistrées. Les chercheurs viennent ici pour retracer la provenance d'une œuvre, récupérer la galerie publique d'un artiste ou dater un fan art. API · key
- Freesound Une base de données collaborative de plus de 650 000 échantillons et effets sonores sous licence Creative Commons. La recherche fonctionne sur le site, et une API JSON claire est disponible avec un jeton gratuit. L'étape naturelle lorsque vous avez besoin d'un extrait sonore à la licence claire ou voulez retracer l'origine d'un échantillon largement réutilisé. API · key
- Yandex Images La recherche d'image inversée de Yandex, réputée la meilleure de sa catégorie pour les visages et les images visuellement similaires, s'appuyant sur un index de plusieurs milliards d'images. Vous soumettez l'URL d'une image et examinez les correspondances dans l'interface web ; il n'existe pas d'API officielle et l'usage automatisé déclenche des captchas, l'outil fonctionne donc comme un simple lien de redirection. Une étape OSINT classique lorsque la recherche inversée de Google ne donne rien, en particulier pour les photographies de personnes. Images captcha
- Google Images / Lens La plus vaste recherche d'image inversée et visuelle au monde, Lens y ajoutant la reconnaissance d'objets et de texte. Elle est accessible uniquement par le web, sans API publique : vous envoyez donc vous-même une image ou collez une URL. Cela reste le premier réflexe pour identifier l'origine d'une image, son sujet ou les autres endroits où elle apparaît en ligne. Images captcha
- TinEye Le plus ancien moteur dédié à la recherche d'image inversée, indexant plus de 70 milliards d'images et spécialisé dans les copies exactes et retouchées, avec notamment la première apparition indexée d'une image. La recherche web est gratuite en usage manuel ; l'API est payante, il n'existe donc pas de voie automatisée ici. Particulièrement précieux lorsque vous devez dater une image ou établir où elle est apparue pour la première fois. Images
- Bing Visual Search La recherche visuelle et d'image inversée de Microsoft. L'interface web permet toujours de comparer une image à l'index de Bing, mais l'usage est uniquement manuel. Elle sert de second avis à côté de Google et de Yandex lors d'une recherche d'image inversée. Dégradé : l'API programmatique a été retirée en août 2025, en même temps que le reste des API Bing Search. Images
- IQDB Une recherche d'image inversée combinée sur les principaux imageboards booru. Danbooru, Gelbooru, Zerochan et d'autres, couvrant des dizaines de millions d'images étiquetées de style anime. Vous lui fournissez une image ou une URL et il interroge tous les services à la fois ; la sortie est du HTML brut, sans API. Le moyen le plus rapide de retrouver la source répertoriée et étiquetée d'une image d'anime lorsque SauceNAO laisse un doute. Images
- ascii2d Un moteur japonais de recherche d'image inversée fondé sur des signatures de couleur et de caractéristiques, particulièrement performant sur les œuvres issues de Pixiv et de Twitter. Il fonctionne uniquement sur le web, sans API. À essayer pour le fan art japonais lorsque les moteurs de recherche inversée grand public échouent. Son état est incertain : il était injoignable depuis notre infrastructure lors des tests, et les connexions depuis l'extérieur du Japon sont souvent bloquées, attendez-vous donc à des difficultés d'accès. bloqué par IP
- Karma Decay Une recherche d'image inversée entièrement circonscrite à Reddit : donnez-lui une image et il fait remonter les publications antérieures de la même photo sur l'ensemble du site. C'est un simple site web, sans API. Pratique pour retracer quand et où une image a circulé pour la première fois sur Reddit. Actuellement dégradé : le site a expiré lors de nos vérifications, et sa fraîcheur est limitée depuis que Reddit a verrouillé l'accès à ses données, considérez-le donc comme un pari risqué.
- PimEyes Un moteur de recherche par reconnaissance faciale couvrant environ 3,5 milliards d'images de visages issues du web ouvert : envoyez la photo d'un visage et il trouve d'autres images de la même personne. Il fonctionne uniquement via le site web, et consulter réellement les résultats exige un abonnement payant ; il n'existe pas d'API publique. Utilisé dans les recherches d'identification de personnes lorsque la recherche d'image inversée ordinaire ne tient pas assez compte des visages. captcha
- Photobucket Un hébergeur d'images historique qui conserve des milliards d'images du web des débuts, à l'époque où il alimentait d'innombrables messages de forums et billets de blogs. Il n'y a pas d'API, et une grande partie de l'archive est difficile d'accès : les images en lien direct affichent souvent une image de remplacement et les anciens albums sont derrière un mur payant. Malgré tout, c'est parfois le seul refuge survivant d'une vieille image de forum, et une vérification manuelle peut être payante. Dégradé : attendez-vous fréquemment à des contenus brisés ou verrouillés.
- Pinterest Un service de découverte visuelle riche de milliards d'images épinglées, qui préservent souvent des copies d'images dont les sources d'origine ont disparu. Il n'existe pas d'API publique de recherche d'images, l'API officielle étant réservée, via OAuth, aux applications professionnelles validées, et la navigation occasionnelle se heurte à des murs de connexion : utilisez-le donc par lien direct. Parfois utile pour retrouver une copie survivante d'une image perdue sur son site d'origine. bloqué par IP
- Google Arts & Culture Le portail de Google vers des œuvres et des expositions culturelles en haute résolution, offrant des millions d'objets provenant de plus de 2 000 musées et institutions. Tout passe par l'interface web ; il n'existe pas d'API publique. Utile pour la recherche sur des œuvres, des objets ou des expositions, en particulier lorsque l'imagerie haute résolution avec zoom compte. Dégradé au seul sens programmatique : ses outils pour développeurs ont été retirés, la consultation manuelle est donc la voie à suivre.
- Tube Archivarix Le chercheur de vidéos YouTube supprimées d'Archivarix, service frère de ce site. À partir d'un identifiant de vidéo, il traque les réuploads encore en ligne de la vidéo supprimée sur des hébergeurs miroirs, affiche les métadonnées archivées de la vidéo et permet une recherche par titre dans son index de métadonnées YouTube. Développé en interne, il est ici pleinement intégré, sans clé ni configuration. Le premier réflexe lorsqu'un lien YouTube est mort et que vous cherchez soit les informations de la vidéo, soit une copie survivante. Vidéo, audio, musique
- Filmot Un index consultable des métadonnées et des sous-titres YouTube couvrant des centaines de millions de vidéos, y compris celles depuis supprimées ou passées en privé. L'interface web gratuite permet de rechercher dans les métadonnées des vidéos et jusque dans les mots prononcés dans les sous-titres ; l'API informelle requiert une clé délivrée par l'exploitant. Sa valeur unique tient à ce qu'il fait ressortir les informations de vidéos YouTube supprimées, qui souvent ne survivent nulle part ailleurs. Actuellement dégradé : les pages de vidéo sont protégées par un filtre Cloudflare contre les connexions automatisées, prévoyez donc une consultation manuelle. Vidéo, audio, musique captcha
- Ghostarchive (video) Un archiveur à la demande alimenté par les utilisateurs, remarquable en ce qu'il préserve les vidéos YouTube et Twitter autant que les pages ordinaires. Il n'y a pas d'API de recherche : vous ouvrez directement les pages d'archive par identifiant ou vous parcourez sa section YouTube. À consulter dans toute traque de vidéo supprimée, en complément de Filmot et de la Wayback Machine, puisqu'il détient parfois une véritable copie visionnable plutôt que de simples métadonnées. Vidéo, audio, musique
- ANY.RUN Un bac à sable en ligne interactif pour l'analyse de logiciels malveillants, dont le flux public de rapports rend librement consultable un vaste corpus d'analyses. Vous recherchez et lisez les rapports publics sur le site ; l'API est réservée aux formules payantes. À solliciter lorsque vous voulez voir comment se comporte un fichier suspect à l'exécution, sans l'exécuter vous-même.
- Hybrid Analysis Le portail communautaire du Falcon Sandbox de CrowdStrike, avec un vaste corpus public d'analyses de logiciels malveillants consultable par empreinte de fichier. Le site lui-même est protégé par un captcha : la voie praticable est donc son API, dont la clé s'obtient avec un compte gratuit. Une étape solide pour vérifier si une empreinte a déjà été analysée et ce que le bac à sable a observé. API · key captcha
- VirusShare Un dépôt sur invitation regroupant des dizaines de millions d'échantillons de logiciels malveillants, avec recherche par empreinte et téléchargement des échantillons pour les membres. Y entrer suppose d'écrire à l'exploitant pour demander un compte ; l'API exige elle aussi la clé de membre. Les chercheurs s'y tournent lorsqu'il leur faut l'échantillon réel correspondant à une empreinte connue et que les dépôts ouverts ne le possèdent pas. captcha
- BTDigg (btdig.com) Un moteur de recherche de torrents qui moissonne lui-même la DHT de BitTorrent, indexant des centaines de millions de torrents et ne renvoyant que des liens magnet. C'est un site en HTML simple, sans API, promu avant tout comme un service Tor. Utile pour trouver des contenus encore partagés mais référencés sur aucun index de torrents classique. Dégradé : son adresse en clearnet est instable, attendez-vous à une disponibilité intermittente et, comme toujours avec les torrents, les résultats ne sont que des liens. Torrents bloqué par IP
- SolidTorrents Un moteur de recherche fondé sur la DHT, portant sur des dizaines de millions de torrents et leurs métadonnées. Il n'existe que sur le web, sans API officielle, et son domaine change périodiquement. Un autre recours pour vérifier si quelque chose circule encore sur BitTorrent lorsque les grands index ne donnent rien. Son état est incertain : il n'a répondu que via un proxy lors de nos vérifications, et il convient de confirmer le domaine actuellement actif avant de s'y fier. Torrents bloqué par IP
- Snowfl Un outil de métarecherche pour les torrents : plutôt que de détenir son propre index, il interroge simultanément plusieurs index de torrents et agrège les résultats. Il n'y a pas d'API, vous utilisez donc directement son interface web ; depuis ce site, il n'est proposé que sous forme de lien sortant. À consulter lorsque vous voulez qu'une seule requête couvre plusieurs index de torrents plutôt que d'interroger chacun à la main, sachant toutefois qu'il bloque certaines plages d'adresses IP et que le site repose fortement sur JavaScript. bloqué par IP
- TorrentGalaxy Un index de torrents généraliste doublé d'une communauté, couvrant un vaste catalogue de torrents. Il n'a pas d'API officielle ; la recherche se fait sur son propre site, vers lequel nous renvoyons au lieu de l'interroger. Les chercheurs qui suivent des fichiers distribués via BitTorrent peuvent l'utiliser comme l'un des index à consulter. Actuellement dégradé : le site subit des instabilités et des pressions de blocage depuis 2025, vérifiez donc quel domaine est actif avant de vous y fier. bloqué par IP
- 1337x L'un des index de torrents généralistes les plus fréquentés du web, doté d'un très vaste catalogue. Aucune API officielle n'existe, la recherche se fait donc sur le site lui-même ; nous ne fournissons qu'un lien sortant. C'est une première étape courante lorsqu'on cherche un torrent de presque n'importe quel type de fichier, mais gardez à l'esprit qu'il est bloqué par les fournisseurs d'accès dans de nombreuses régions : un miroir ou un proxy peut donc être nécessaire pour l'atteindre. Torrents bloqué par IP
- Bitmagnet (self-host) Contrairement aux autres entrées consacrées aux torrents, il s'agit ici d'un logiciel que vous exécutez vous-même : un robot auto-hébergé qui écoute la DHT de BitTorrent et construit votre propre index de torrents. Son contenu dépend entièrement de votre propre moissonnage ; il n'y a ni site public ni base de données partagée à interroger. Une fois lancé, il expose sur votre machine une interface locale GraphQL et torznab. À adopter si vous voulez une vue indépendante et entièrement maîtrisée de ce qui circule sur la DHT, plutôt que de dépendre des sites d'index publics.
- GH Archive Un relevé continu de l'activité publique sur GitHub : le flux public d'événements est archivé heure par heure depuis 2011, soit des milliards d'événements. C'est un jeu de données en masse plutôt qu'un site de recherche : vous téléchargez des fichiers JSON compressés en gzip par heure, ou vous interrogez le jeu de données public BigQuery ; il n'y a ni API de recherche enregistrement par enregistrement ni formulaire de recherche web. Les chercheurs s'en servent pour analyser ou reconstituer hors ligne l'activité historique de GitHub.
- Sourcegraph (public code search) Une recherche de code portant sur des millions de dépôts publics, qui permet de trouver où un extrait, un identifiant ou une chaîne apparaît dans l'ensemble du code open source. Vous effectuez la recherche depuis l'interface web ; un point d'accès GraphQL répond également aux recherches publiques sans jeton. Utile chaque fois qu'une question porte sur de nombreuses bases de code à la fois plutôt que sur un seul projet. L'avenir de l'offre publique gratuite est incertain depuis le virage propriétaire de l'entreprise : considérez-la comme une commodité susceptible d'évoluer.
- ccMixter Un site communautaire dédié à la musique, aux remix, aux samples et aux a cappella sous licence Creative Commons, de l'ordre de plusieurs dizaines de milliers de morceaux sous licence CC. La recherche et la navigation se font sur le site lui-même ; une ancienne API de requête existe, mais elle a échoué à nos vérifications. C'est l'endroit où chercher des pistes et des remix musicaux réutilisables sous licence ouverte. Son état est actuellement incertain : le site s'est révélé injoignable lors de sondages répétés et pourrait être hors service ; revenez plus tard s'il ne se charge pas.
- GifCities (GeoCities GIFs) Un moteur de recherche dédié aux GIF animés récupérés de GeoCities, reconstruit en 2025 avec une recherche sémantique. Saisissez un terme et il renvoie les GIF correspondants du corpus sauvegardé ; son point d'accès de recherche ouvert permet également à ce site de l'interroger directement. À solliciter pour étudier l'esthétique web des années 1990 ou pour retrouver une image précise des débuts du web. Images API
- OoCities Un miroir et une résurrection des pages GeoCities sauvegardées avant la fermeture du service, navigables par les chemins de quartier d'origine. Il n'y a pas d'API : vous naviguez ou utilisez le formulaire de recherche sur le site lui-même, vers lequel nous renvoyons. Utile lorsque vous devez retrouver une page d'accueil GeoCities précise ou flâner dans l'ancienne structure par quartiers telle qu'elle était.
- GeoCities.ws Un autre miroir de GeoCities, associé à un hébergement gratuit d'inspiration rétro, si bien que des pages archivées côtoient des pages nouvellement hébergées. Il n'a pas d'API : utilisez la navigation et le formulaire de recherche du site via le lien fourni. Pratique comme second endroit à consulter lorsqu'une page GeoCities manque dans les autres miroirs. Actuellement dégradé, et il peut présenter un CAPTCHA avant de vous laisser entrer. captcha
- ReoCities L'un des miroirs de sauvetage d'origine créés lors de la fermeture de GeoCities en 2009, qui préserve les pages sauvegardées à cette occasion. La navigation et la recherche se font sur le site lui-même ; il n'y a pas d'API, nous renvoyons donc vers son formulaire de recherche. En tant que l'un des projets de sauvetage indépendants, il peut détenir des pages que les autres miroirs ont manquées, ce qui le rend intéressant à consulter lorsqu'une page reste introuvable ailleurs.
- IA GeoCities Collection Le moissonnage dédié de GeoCities par l'Internet Archive, le corpus même qui alimente GifCities. On y accède via l'index CDX de la Wayback Machine restreint à geocities.com, si bien que ce site peut l'interroger directement et renvoyer des listes de captures horodatées. La manière la plus systématique de retrouver les copies archivées d'une URL GeoCities précise, même si les requêtes peuvent être lentes. API
- Cameron's World Non pas un outil de recherche, mais une œuvre d'art web : un collage interactif composé à partir des graphismes et des GIF de GeoCities. Il suffit de s'y rendre et de faire défiler ; il n'y a ni API ni fonction de recherche, il est donc répertorié comme un simple lien. À visiter pour saisir la culture visuelle de l'époque GeoCities, ou comme point de départ pour explorer à quoi ressemblait le web amateur des années 1990.
- ProtoWeb Un service pour l'informatique vintage : un proxy HTTP qui sert des sites web des années 1990 restaurés à de vieux navigateurs d'époque. Vous dirigez un navigateur ou un émulateur d'époque vers le proxy et parcourez le web des débuts depuis son cache de sites restaurés ; il n'y a pas d'API et nous ne faisons qu'y renvoyer. Intéressant lorsque vous voulez découvrir d'anciens sites sur les logiciels de leur temps. Actuellement dégradé et susceptible d'afficher un CAPTCHA. captcha
- oldweb.today Permet d'ouvrir des pages web archivées dans des navigateurs d'époque émulés, le tout s'exécutant dans votre navigateur moderne, avec des contenus tirés de Wayback et d'autres archives Memento. L'usage est entièrement interactif sur le site : choisissez un navigateur et une date, saisissez une URL ; il n'y a pas d'API. Les chercheurs s'y tournent lorsque la façon dont une page s'affichait importe autant que son contenu.
- Marginalia Search Un moteur de recherche indépendant doté de son propre robot d'indexation, centré sur le web modeste, ancien, textuel et non commercial. Vous pouvez effectuer une recherche sur le site, et son API publique ouverte permet à ce site de l'interroger directement. À solliciter pour traquer les pages personnelles, les sites de passionnés et les textes de fond issus des recoins plus tranquilles du web, que les moteurs grand public ont tendance à enfouir. Texte intégral du web API
- Wiby Un moteur de recherche consacré aux pages amateurs et aux débuts du web, doté d'un bouton « surprise me » qui propose une vieille page au hasard. Effectuez la recherche sur le site lui-même, ou via son point d'accès de recherche JSON simple, que ce site peut interroger directement. Idéal pour découvrir le web classique par sérendipité et pour dénicher de petites pages artisanales sur un sujet. Texte intégral du web API
- Mojeek Un moteur de recherche indépendant britannique qui exploite son propre robot d'indexation plutôt que de revendre les résultats de Bing ou de Google. Vous effectuez la recherche via son interface web habituelle ; une API commerciale payante existe mais n'est pas utilisée ici, nous renvoyons donc vers le site. Utile lorsque vous voulez un index qui ne se contente pas de refléter la vision du web des grands moteurs.
- Stract Un moteur de recherche open source, financé par NLnet, conçu pour être personnalisable et auto-hébergeable. La recherche s'effectue sur son site web ; son API publique n'étant pas documentée, nous renvoyons vers le formulaire de recherche plutôt que de l'interroger. Une option lorsque vous voulez un index indépendant et transparent, ou votre propre instance.
- Million Short Un moteur de recherche avec une particularité : il écarte délibérément les sites les plus populaires des résultats afin que des pages obscures puissent remonter. Vous utilisez directement son formulaire de recherche web, il n'y a pas d'API. Utile pour creuser au-delà des domaines dominants habituels lorsque vous faites des recherches sur un sujet. Actuellement dégradé, et vous pourriez tomber sur un CAPTCHA. captcha
- Teclis Un index de recherche non commercial dédié au « web créatif » des sites petits et indépendants, qui sert désormais d'index interne à Kagi. La recherche s'effectue sur son propre site ; l'accès programmatique n'existe qu'au travers de l'API payante de Kagi, il est donc proposé ici sous forme de lien plutôt qu'interrogé. À essayer lorsque les moteurs grand public noient les petits sites que vous cherchez réellement.
- Google Groups Usenet L'archive Google des groupes Usenet, bâtie sur la collection DejaNews, dont les discussions remontent à 1981. Elle est figée et en lecture seule depuis 2024, et il n'existe pas d'API : la recherche et la lecture passent par l'interface web de Google Groups vers laquelle nous vous renvoyons. Elle reste l'un des endroits les plus riches pour retrouver des fils de discussion vieux de plusieurs décennies et des échanges historiques en ligne. Textes spécialisés
- Usenet Archives Une archive du web indépendante et gratuite réunissant des centaines de millions de messages Usenet historiques. La recherche et la lecture se font sur le site lui-même ; il n'existe pas d'API, le service est donc présenté ici sous forme de lien. Une solution utile en complément ou en remplacement de Google Groups pour retrouver d'anciennes discussions de groupes.
- Narkive Une archive du web d'Usenet en activité de longue date, qui permet de rechercher et de lire des messages historiques des groupes. Il n'existe pas d'API : vous utilisez le formulaire de recherche du site, vers lequel nous vous renvoyons. À consulter en parallèle des autres archives Usenet, chacune couvrant et restituant le matériau un peu différemment.
- textfiles.com L'archive éditorialisée par Jason Scott de l'époque des BBS : fichiers texte, zines, documents de phreaking et listes de BBS issus du monde en ligne d'avant le web. C'est un site de simple navigation, sans API : vous l'explorez directement via le lien fourni. Un point de référence essentiel pour l'étude de la culture BBS et des premiers textes en ligne.
- DiscMaster (files inside old discs) Un outil remarquable qui cherche à l'intérieur des fichiers : recherche en texte intégral et au niveau des fichiers dans des millions de fichiers anciens contenus dans de vieilles images de disques stockées sur archive.org. Il dispose d'un point d'accès de recherche fonctionnel : ce site peut donc l'interroger directement en plus de vous y renvoyer. À privilégier pour retrouver un shareware, un document ou une image ancienne précis livrés sur CD ou sur disquette — des contenus invisibles pour la recherche web ordinaire. Textes spécialisés API
- MobyGames Un catalogue exhaustif de l'histoire du jeu vidéo, couvrant les jeux de toutes les plateformes. La recherche s'effectue sur le site web ; une API existe mais requiert une clé. C'est la référence lorsque vous avez besoin de la fiche catalographique d'un jeu précis. Actuellement dégradé : le site peut présenter un CAPTCHA. captcha
- IA MS-DOS / Software Library La bibliothèque de jeux MS-DOS et de logiciels historiques d'Internet Archive, jouables dans le navigateur par émulation. Elle est interrogeable via l'interface advancedsearch d'IA, que ce site sollicite directement, et les éléments s'exécutent dans votre navigateur sur archive.org. Le moyen le plus rapide de trouver un logiciel ancien et de le faire réellement tourner sans rien installer. Logiciels et paquets API
- My Abandonware Une vaste base de données d'abandonware : jeux des années 1980 et 1990 pour DOS, Windows, Amiga et consoles, avec des téléchargements en plus des fiches de catalogue. Il n'existe pas d'API : la recherche et la navigation se font sur le site lui-même, via le lien fourni. Une ressource pratique lorsque vous devez identifier ou obtenir un vieux jeu qui n'est plus commercialisé. Logiciels et paquets
- Europeana L'agrégateur du patrimoine culturel européen, qui réunit plus de 50 millions de documents numérisés provenant de galeries, bibliothèques, archives et musées européens. La recherche se fait sur son site web ; une API est également disponible avec une clé gratuite. Le premier réflexe naturel pour chercher du matériel culturel européen numérisé dans de nombreuses institutions à la fois.
- DPLA La Digital Public Library of America agrège dans un index unique et consultable les documents numérisés des bibliothèques, archives et musées des États-Unis. La recherche se fait sur son site web ; une API à clé gratuite est également disponible. À privilégier pour chercher des matériaux historiques américains sans savoir quelle institution les conserve.
- Smithsonian Open Access Les notices en Open Access de l'ensemble des musées du Smithsonian, qui associent métadonnées de collection et médias sous CC0 librement réutilisables. La recherche s'effectue sur le site du Smithsonian ; une API existe, dont les clés passent par api.data.gov. Précieux pour trouver en un seul endroit des images de musée réutilisables et des notices d'objets. Actuellement dégradé : attendez-vous à d'éventuelles interruptions par CAPTCHA. captcha
- Met Museum API Les notices complètes de la collection du Metropolitan Museum of Art, avec métadonnées d'objets et images en accès ouvert. Le musée propose une API publique sans clé : les données de collection peuvent donc être interrogées directement depuis ce site, sans aucun compte. Utile pour la recherche en histoire de l'art ou pour se procurer des images d'objets de musée sous licence ouverte. Nos sondes le classent actuellement comme dégradé : les réponses peuvent manquer de régularité. Patrimoine culturel API
- Rijksmuseum API La collection en ligne du musée national néerlandais, avec métadonnées d'objets et images haute résolution. La recherche dans la collection se fait sur le site du musée ; une API est disponible avec une clé gratuite. Une source de premier plan pour la recherche sur l'art et l'histoire des Pays-Bas ou pour trouver des images de qualité des objets du musée.
- Chronicling America (LoC) La collection de la Library of Congress de pages de journaux américains historiques, des années 1700 aux années 1960, avec un texte intégral issu de l'OCR qui rend les pages elles-mêmes consultables. La recherche passe par le site loc.gov, qui peut aussi renvoyer du JSON brut sans clé. Incontournable pour retrouver la couverture de presse, les noms et les événements d'une époque dans les journaux américains. Notez que l'ancienne adresse chroniclingamerica.loc.gov est obsolète : utilisez loc.gov. API
- crt.sh (Cert Transparency) Une fenêtre interrogeable sur les journaux de Certificate Transparency, le registre public des certificats TLS, ce qui en fait un moyen de retrouver les certificats et les sous-domaines historiques d'un domaine. Vous l'interrogez sur le site web, et la même requête peut renvoyer du JSON sans clé. Les chercheurs s'en servent pour reconstituer l'histoire de l'infrastructure d'un domaine. Il est fréquemment surchargé et renvoie des erreurs en cas de forte charge : réessayez si une requête échoue. Pages et sites web
- Censys Search Un index de balayage des hôtes et des certificats à l'échelle d'Internet, comparable dans son rôle à Shodan. La recherche passe par son interface web ; une API assortie d'une formule gratuite existe mais requiert une clé, le service est donc proposé ici sous forme de lien plutôt qu'interrogé. Pertinent pour enquêter sur ce qu'un hôte ou un domaine expose à l'internet et sur son empreinte en matière de certificats. Actuellement dégradé : le site peut vous opposer un CAPTCHA. captcha
- Shodan Un moteur de recherche des appareils et services connectés à Internet, qui conserve également les bannières de service historiques. Vous l'interrogez via sa propre interface web, vers laquelle nous vous renvoyons ; une API officielle existe mais requiert une clé et reste majoritairement payante. Les chercheurs y ont recours pour retracer les services ou les logiciels qu'un hôte a exposés au fil du temps, dans le cadre de travaux sur l'histoire d'un domaine et de son infrastructure.
- Intelligence X Intelligence X est un service de recherche OSINT couvrant les pastes, les contenus du darkweb, les fuites de données et les enregistrements whois, doté d'une « machine à remonter le temps » pour les documents supprimés depuis. Vous l'utilisez sur son propre site web, via notre lien ; son API nécessite une clé et les données les plus profondes sont réservées aux formules payantes. À consulter lorsque vous recherchez des pastes supprimés ou des documents ayant fuité que les archives du web ordinaires n'ont jamais capturés.
- Have I Been Pwned (pwned passwords) Un index des comptes et des identifiants apparus dans des fuites de données connues. Le point d'accès de plage Pwned Passwords ne nécessite pas de clé : notre recherche peut donc l'interroger directement, tandis que l'API plus complète de consultation des fuites est payante et que la vérification des comptes individuels se fait sur le site lui-même. À utiliser pour confirmer qu'un identifiant est apparu dans une fuite. Nos derniers contrôles signalent le service comme dégradé : l'accès au site peut manquer de régularité. API
- Ahmia (Tor index) Un moteur de recherche du clearnet qui indexe les services cachés .onion de Tor, avec des résultats filtrés des contenus abusifs. Il n'existe pas d'API : vous lancez vos requêtes sur son propre formulaire de recherche, vers lequel nous vous renvoyons. C'est le moyen pratique de découvrir le contenu des sites onion depuis le web ordinaire, ce qui en fait un point de départ pour la recherche autour du darkweb.
- APKMirror Une archive des versions historiques d'APK Android, qui héberge des paquets signés et vérifiés. Il n'existe pas d'API : la navigation et la recherche se font sur le site lui-même, via le lien que nous fournissons. À privilégier lorsque vous avez besoin d'une version ancienne d'une application Android que les magasins actuels ne proposent plus. Logiciels et paquets
- F-Droid Le dépôt d'applications Android libres et open source, qui conserve l'archive complète des versions et compile ses paquets de façon reproductible. Son index de paquets est publié en JSON sans clé : notre recherche peut donc l'interroger directement en plus de vous renvoyer vers le site. La ressource à consulter pour les versions actuelles et anciennes des applications Android libres. Logiciels et paquets API
- PyPI L'index de paquets de la communauté Python, qui conserve chaque version publiée de chaque paquet ainsi que des métadonnées structurées. La recherche est possible sur le site web, et son API JSON sans clé permet à notre recherche d'extraire directement les détails des paquets. Utile pour l'archéologie logicielle : récupérer une ancienne version d'une bibliothèque ou consulter l'historique de versions d'un paquet. Logiciels et paquets API
- npm registry Le registre de paquets de l'écosystème Node.js, avec l'historique complet des versions et des archives tar téléchargeables pour chaque paquet. L'API sous-jacente du registre est sans clé et notre recherche l'interroge directement. À privilégier pour retracer l'historique des versions d'un paquet JavaScript ou récupérer une version ancienne. Notez que le site npmjs.com lui-même soumet actuellement à un contrôle le trafic provenant des réseaux de centres de données : les liens profonds vers les pages de paquets peuvent donc afficher d'abord une étape de vérification. Logiciels et paquets API captcha
- OldMapsOnline Un portail de découverte des cartes historiques géoréférencées conservées par des institutions du monde entier, qui vous oriente vers la collection détentrice de chaque carte. Il propose une API de recherche géographique (par rectangle englobant) ainsi que des points d'accès IIIF, mais nous le présentons sous forme de lien vers son propre formulaire de recherche. Actuellement signalé comme dégradé : le site peut présenter un CAPTCHA avant de vous laisser entrer. Patrimoine culturel captcha
- David Rumsey Maps L'une des principales collections de cartes historiques numérisées, qui propose des numérisations haute résolution, souvent géoréférencées, sur la plateforme Luna. Des API Luna et IIIF partielles existent, mais la voie pratique reste l'interface de recherche du site, vers laquelle nous vous renvoyons. Un premier réflexe lorsque vous avez besoin d'une numérisation de qualité d'une carte ancienne.
- OSM / Overpass OpenStreetMap est la carte du monde éditée de façon collaborative ; l'API Overpass permet d'effectuer des requêtes structurées en lecture seule sur ses données, et les dumps de l'historique complet conservent les états antérieurs de la carte. Overpass fonctionne sans clé (avec des limites d'usage raisonnable), et notre recherche peut l'interroger directement. Utile lorsque vous devez savoir quels objets cartographiés existent à un endroit donné, ou pour explorer l'historique des modifications de la carte. API
- GDELT Un projet mondial de veille médiatique qui suit les événements et la tonalité dans les médias du monde entier, y compris les journaux télévisés. Son API de documents fonctionne sans clé : notre recherche l'interroge donc directement, en plus de proposer un lien vers le site du projet. À utiliser pour trouver d'un seul coup la couverture d'un événement dans de nombreux pays et médias. API
- IA TV News Archive La collection TV News de l'Internet Archive rend interrogeables, via le texte des sous-titres codés, les journaux télévisés américains et internationaux depuis 2009. Elle est interrogée au moyen de l'API de recherche sans clé de l'Internet Archive, que notre site utilise directement. Inestimable lorsqu'il s'agit d'établir quand et où une chose a été dite à la télévision. Vidéo, audio, musique API
- Radio Garden Un globe interactif pour écouter des milliers de radios en direct dans le monde entier. Il existe une API non officielle sans clé, que notre recherche peut interroger en complément du lien vers l'interface du globe. Davantage un outil d'écoute en direct qu'une archive, mais pratique pour repérer des stations par lieu. API
- IA Live Music (etree) La collection de musique live de l'Internet Archive (etree) réunit des enregistrements légaux de concerts réalisés par des tapers. Elle est interrogeable via l'API de recherche sans clé de l'Archive, si bien que les résultats apparaissent directement dans notre recherche comme sur archive.org. L'endroit où chercher les enregistrements des concerts passés d'un groupe. Vidéo, audio, musique API
- Zenodo Le dépôt généraliste du CERN pour les données de recherche et les logiciels, où chaque dépôt reçoit un DOI. Il dispose d'une API de lecture sans clé, mais le service a bloqué les adresses depuis lesquelles nous l'avons testé : pour l'instant, nous renvoyons donc vers sa propre recherche plutôt que de l'interroger. À privilégier pour rechercher des jeux de données, des versions de logiciels ou des matériaux supplémentaires associés à des travaux publiés. Son statut n'est incertain que de notre point de vue ; le service est connu pour être opérationnel par ailleurs, le lien devrait donc fonctionner pour vous. Jeux de données
- Figshare Un dépôt où les chercheurs déposent jeux de données, figures, posters et autres productions supplémentaires. Son API de lecture est sans clé et notre recherche l'interroge directement ; vous pouvez aussi naviguer sur le site. Utile lorsque les données à l'origine d'un article ont été publiées séparément de celui-ci. Jeux de données API
- Harvard Dataverse L'instance Harvard de la plateforme Dataverse, un vaste dépôt de données de recherche. L'API de recherche est sans clé et notre recherche l'interroge directement ; le site web propose la même recherche pour la navigation. Une étape classique lorsque l'on cherche des jeux de données académiques. Jeux de données API
- OSF L'Open Science Framework est une plateforme de collaboration scientifique qui héberge des matériaux de projets, des données et un registre de preprints. Son API de lecture est sans clé, ce qui permet à notre recherche de l'interroger directement. Utile pour trouver des preprints et des matériaux de projets de recherche qui ne sont jamais parus dans une revue. Jeux de données API
- Hugging Face Datasets La plus grande plateforme de jeux de données (et de modèles) d'apprentissage automatique, chacun accompagné de métadonnées riches. Une API sans clé fournit les résultats de recherche, que notre site interroge directement, et tout est consultable sur le site web. L'endroit par défaut lorsque vous avez besoin d'un jeu de données d'apprentissage automatique publié ou de sa documentation. Jeux de données API
- Archive of Our Own Archive of Our Own, gérée par l'Organization for Transformative Works, est la plus grande archive de fanfiction. Elle n'a pas d'API officielle, par principe : nous vous renvoyons donc vers sa propre interface de recherche et de filtrage. Indispensable pour toute recherche sur les œuvres de fans. Actuellement signalée comme dégradée : attendez-vous à une étape de vérification du navigateur avant le chargement du site. Textes spécialisés captcha
- FanFiction.Net Un site de fanfiction historique dont les collections datent de l'époque antérieure à AO3. Il n'y a pas d'API et le site se trouve derrière Cloudflare : il est donc présenté sous la forme d'un lien vers son formulaire de recherche. À consulter pour les œuvres de fans plus anciennes de cette première période. Signalé comme dégradé : vous devrez peut-être passer une épreuve de vérification pour y accéder. captcha
- Fanlore Un wiki géré par l'Organization for Transformative Works, qui documente l'histoire des fans, les fandoms et leur vocabulaire. En tant que site MediaWiki, il dispose d'une API standard sans clé, mais nous le présentons actuellement sous la forme d'un lien vers sa propre recherche. C'est l'ouvrage de référence pour comprendre le contexte de fandom entourant les œuvres de fans archivées. Signalé comme dégradé : le site peut soumettre votre navigateur à une vérification avant de se charger. captcha
- WikiTeam dumps Les dumps préservés de plus de 600 000 wikis, dont des communautés Fandom/Wikia et des sites MediaWiki de niche, conservés sur l'Internet Archive. La collection est interrogeable via l'API de recherche sans clé de l'Archive, que notre site utilise directement. L'endroit où chercher lorsqu'un wiki a disparu et que vous avez besoin d'en récupérer le contenu. Textes spécialisés API
- Discogs Une base de données collaborative des sorties musicales et de leurs pressages physiques, associée à une place de marché. Son API de recherche exige un jeton : nous la présentons donc sous la forme d'un lien vers la recherche du site. La référence pour les discographies et pour identifier un pressage précis d'une sortie. Signalé comme dégradé : un CAPTCHA peut se dresser entre vous et le site. captcha
- MusicBrainz Une encyclopédie musicale ouverte qui attribue des identifiants de référence (MBID) aux artistes et aux sorties. Son API de service web est sans clé, limitée à une requête par seconde, et notre recherche l'interroge directement. La source à privilégier pour des métadonnées musicales propres et structurées. Vidéo, audio, musique API
- Genius Une base de données de paroles de chansons accompagnées d'annotations. Son API de recherche nécessite un jeton OAuth : nous vous renvoyons donc vers la recherche du site plutôt que de l'interroger. Utile pour retrouver précisément des paroles et le contexte annoté qui les entoure.
- CourtListener / RECAP Une archive gratuite de la jurisprudence américaine, de documents judiciaires collectés sur PACER par l'intermédiaire du projet RECAP, et d'enregistrements audio de plaidoiries. Son API REST de recherche fonctionne sans clé (un jeton relève les limites de débit), et notre recherche l'interroge directement. Le premier réflexe pour retrouver gratuitement des archives judiciaires américaines. Patrimoine culturel API
- PatentsView (USPTO) Un service de données sur les brevets de l'USPTO dont la particularité est la désambiguïsation des fiches d'inventeurs et de déposants. L'API de recherche exige une clé gratuite et des requêtes structurées : pour l'instant, nous renvoyons donc vers son interface de recherche plutôt que de l'interroger directement. Utile lorsque vous souhaitez suivre les brevets d'un inventeur ou d'une entreprise en particulier, et pas seulement faire correspondre des mots-clés à des documents.
- Google Patents Une recherche en texte intégral des brevets couvrant les offices du monde entier, ainsi que la littérature non brevet. Il n'existe pas d'API officielle (les données sont disponibles séparément sous forme de jeu de données public BigQuery) : la recherche se fait donc sur le site lui-même, via notre lien. L'une des interfaces uniques les plus commodes pour les recherches de brevets à l'échelle mondiale. Articles scientifiques
- Espacenet / EPO OPS La recherche mondiale de brevets de l'Office européen des brevets, accompagnée de l'API REST Open Patent Services. L'API exige une clé OAuth (une offre gratuite existe) : nous renvoyons donc actuellement vers l'interface de recherche d'Espacenet. À utiliser pour interroger la base mondiale de brevets de l'OEB. Signalé comme dégradé : le site peut présenter une épreuve de vérification avant de se charger. captcha
- FamilySearch La plus grande archive gratuite de documents généalogiques au monde, exploitée par l'Église mormone (LDS). Son API REST exige une clé approuvée ainsi qu'une connexion : nous vous renvoyons donc vers la recherche de documents du site. Le point de départ gratuit par défaut pour la recherche généalogique.
- pouet.net (demoscene) La base de données de référence de la demoscene, qui documente productions, parties et groupes depuis les années 1990. Ses données sont publiées sous forme de dumps JSON périodiques (data.pouet.net) que notre recherche peut exploiter, en complément de la navigation et de la recherche proposées par le site. La source de référence pour toute recherche sur les sorties de la demoscene ou l'histoire des groupes. API
- 16colo.rs (ANSI/ASCII art) Une archive d'artpacks ANSI et ASCII issus de l'artscene BBS, avec des documents remontant au début des années 1990. Une API sans clé est annoncée, mais notre test a échoué : nous renvoyons donc vers la navigation et la recherche du site. Le principal foyer de l'art préservé de l'époque des BBS ; à privilégier pour étudier l'artscene ou localiser un artpack précis.
- ASCII Art Archive Une vaste bibliothèque classée d'art ASCII classique en image unique. Il n'y a pas d'API : vous parcourez les catégories sur le site lui-même, via notre lien. Pratique lorsque vous cherchez des exemples d'œuvres ASCII traditionnelles organisées par sujet.
- CyberLeninka (КиберЛенинка) La plus grande bibliothèque scientifique en libre accès en langue russe : des articles de revues en texte intégral dans toutes les disciplines, consultables gratuitement et sans inscription. La recherche par titre, auteur ou sujet se fait dans l'interface web ; il n'existe pas d'API publique officielle, si bien que ce site vous donne un lien de recherche. Le premier réflexe pour les articles en langue russe que les index occidentaux (Crossref, OpenAlex) manquent souvent. Articles scientifiques
- НЭБ. National Electronic Library (rusneb.ru) La Bibliothèque électronique nationale de Russie agrège les livres, périodiques et thèses numérisés de la Bibliothèque d'État de Russie et d'institutions partenaires. Les numérisations relevant du domaine public se lisent directement dans la visionneuse web ; les œuvres encore sous droits sont réservées aux salles de lecture. La recherche dans la collection se fait sur le site web ; utile pour les imprimés russes prérévolutionnaires et de l'époque soviétique qui n'existent nulle part ailleurs en ligne. Le site était injoignable lors de notre dernière vérification, la disponibilité peut donc varier.
- End of Term Web Archive Un projet conjoint de l'Internet Archive, de la Library of Congress et de partenaires universitaires, qui moissonne les sites web du gouvernement fédéral américain à chaque transition présidentielle. Il préserve les contenus en .gov et .mil qui disparaissent régulièrement lors des changements d'administration : pages, rapports et jeux de données supprimés des sites en ligne. Parcourez le portail du projet pour accéder aux moissonnages de fin de mandat, qui se rejouent via les instances wayback partenaires. À privilégier lorsqu'une page gouvernementale a disparu aux alentours d'une élection.