Archivarix

Guía

Archivarix Echo busca en más de 200 archivos web a la vez. En lugar de abrir la Wayback Machine, luego archive.today, luego una docena de archivos académicos y de libros uno por uno, pegas una sola cosa en Echo y él decide dónde buscar. Esta guía explica qué puedes buscar, cómo funciona una búsqueda y cómo leer tus resultados.

La página de inicio de Archivarix Echo: una casilla de búsqueda que acepta una URL, un DOI, un ISBN, un identificador social, un hash de archivo o un título

Qué puedes buscar

Este es el corazón de Echo. No eliges un archivo ni una categoría: pegas una cosa, y Echo reconoce de qué se trata y la dirige a cada archivo creado para responder ese tipo de entrada. Nunca tienes que saber cuál de los más de 200 archivos podría tenerla; ese es precisamente el trabajo que Echo hace por ti. A continuación está todo lo que Echo entiende, con ejemplos.

Pega un identificador exacto

Echo reconoce estas formas de entrada a simple vista. Cuanto más específica sea tu entrada, con mayor precisión la dirige, pero nunca tienes que etiquetarla: solo pégala.

  • La URL de una página webhttps://www.spacejam.com/ Encuentra instantáneas guardadas de esa página en los grandes archivos web: la Wayback Machine (más de 1 billón de páginas), archive.today, Common Crawl, Perma.cc, Ghostarchive, Software Heritage y archivos web nacionales (el UK Government Web Archive, Arquivo.pt de Portugal, Vefsafn de Islandia, Trove de Australia, la Library of Congress). Ves la página tal como se veía en distintos momentos, incluso si hoy ya no existe.

  • Un sitio web o dominio completonokia.com Pega un dominio a secas para extraer todas las páginas capturadas de un sitio, no solo una dirección. Echo añade una vista de "listar todos los archivos capturados" en los archivos web, y dirige el dominio a crt.sh (Transparencia de Certificados) para revelar subdominios y el historial de certificados SSL del sitio: una forma de cartografiar un sitio que ya no existe.

  • Un vídeo de YouTubehttps://youtu.be/dQw4w9WgXcQ — o simplemente el id dQw4w9WgXcQ Recupera metadatos, subtítulos y miniaturas de vídeos eliminados o retirados mediante Tube Archivarix y Filmot (búsqueda de subtítulos en cientos de millones de vídeos), además de copias archivadas de la página del vídeo en la Wayback Machine, archive.today, Common Crawl y Ghostarchive. La miniatura también se envía a la búsqueda inversa de imágenes para rastrear reediciones.

  • Una imagen, para búsqueda inversa — un enlace directo a la imagen como https://upload.wikimedia.org/wikipedia/commons/7/78/The_Blue_Marble.jpg Echo detecta las URL de imágenes (.jpg, .png, .gif, .webp, .avif…) y las envía a los motores de búsqueda inversa de imágenes: Yandex Images (índice de miles de millones), Google Lens, Bing Visual Search, TinEye (más de 70 000 millones de imágenes), además de SauceNAO e IQDB para obras de arte. Encuentra dónde más aparece una imagen, un original de mayor resolución o su verdadera fuente.

  • Un DOI10.1145/3292500.3330701 Resuelve un artículo en el grafo académico — Crossref (más de 165 millones de DOI), DataCite, OpenAlex (480 millones de obras), Semantic Scholar, Europe PMC, IA Scholar — y busca el texto completo de acceso abierto a través de Anna's Archive y Sci-Hub.

  • Un ISBN9780451524935 Encuentra un libro en Open Library (más de 40 millones de ediciones), HathiTrust (más de 18 millones de volúmenes), Google Books y las bibliotecas en la sombra Anna's Archive y Library Genesis: registros de catálogo, escaneos y texto completo.

  • Un identificador social@nasa Recupera perfiles y publicaciones archivados: perfiles de Twitter/X y tuits individuales a través de la Wayback Machine y archive.today, vistas previas de canales de Telegram, páginas archivadas de Facebook e historial de usuarios de Reddit a través de Pullpush y Arctic Shift.

  • Un hash de contenido de un archivo44d88612fea8a8f36de82e1278abb02f (md5, sha1 o sha256) Busca un archivo por su huella de contenido en VirusTotal: inteligencia sobre archivos y amenazas para un archivo que puedes identificar pero no nombrar.

O simplemente descríbelo con palabras

¿No tienes un identificador? Escribe un título, un nombre o unas pocas palabras clave y Echo distribuye la consulta a todos los archivos con búsqueda de texto a la vez —más de 75 de ellos— y luego ordena los resultados según a qué se parecen tus palabras. Aquí es donde se despliega toda la amplitud del catálogo:

  • Libros y ebooksFrankenstein → Open Library, Project Gutenberg, Standard Ebooks, HathiTrust, Internet Archive Texts, Wikisource, DOAB, además de Anna's Archive y Library Genesis.
  • Vídeosapollo 11 landing → Tube Archivarix y Filmot para YouTube eliminado, además de Dailymotion, RuTube, Odysee, Rumble, BitChute, Bilibili, VK Video, OK.ru e Internet Archive Video.
  • Música y grabaciones en directoGrateful Dead 1977 → MusicBrainz y el Live Music Archive (etree) del Internet Archive de grabaciones de aficionados, además de IA Audio.
  • Noticias de TV y radio — subtítulos de emisiones en el TV News Archive del Internet Archive.
  • Artículos, preprints y patentesattention is all you need → arXiv, PubMed, bioRxiv, medRxiv, DOAJ, DBLP, OpenAIRE, CyberLeninka, Semantic Scholar y Google Patents.
  • Software, apps y abandonwarereact (npm), requests (PyPI), además de F-Droid, APKMirror, Software Heritage (más de 20 000 millones de archivos de código fuente), Sourcegraph, MyAbandonware y los juegos jugables de MS-DOS del Internet Archive.
  • Torrents — The Pirate Bay, Nyaa, 1337x, Torrents-CSV, SolidTorrents, BTDigg y Academic Torrents (petabytes de datos de investigación).
  • Conjuntos de datos de investigación — Harvard Dataverse, Figshare, Zenodo, OSF y Hugging Face Datasets.
  • Imágenes y medios con licencia libre — Wikimedia Commons (más de 110 millones de archivos), Openverse y GifCities para GIF animados de la era GeoCities.
  • Foros, Usenet, imageboards y fanfiction — Google Groups (historia de Usenet), Desuarchive y 4plebs (archivos de 4chan) y Archive of Our Own.
  • La web antigua y pequeña — Wiby y Marginalia, buscadores de la web indie y precorporativa.
  • Patrimonio cultural — la colección de arte abierta del Met, OldMapsOnline para mapas históricos y CourtListener para la jurisprudencia de EE. UU.
  • Archivos de discos antiguos y wikis muertas — DiscMaster indexa archivos dentro de imágenes de discos antiguos; WikiTeam preserva wikis que se han cerrado.

Nunca tienes que decirle a Echo de qué tipo de entrada se trata: lee la forma y la dirige en consecuencia. Un nombre como Richard Feynman impulsa hacia arriba los archivos de autores y perfiles; una "frase" entre comillas favorece los motores de texto completo; una sola palabra se inclina hacia nombres de usuario y paquetes de software. Pero nada queda oculto nunca: cada archivo relevante sigue apareciendo en tus resultados, así que nunca te pierdes una coincidencia.

Cómo funciona una búsqueda

  1. Pega y busca. Escribe o pega tu URL, DOI, ISBN, identificador, hash o título en la casilla y pulsa Buscar.
  2. Echo detecta el tipo. Clasifica la entrada y selecciona todos los archivos de su catálogo que pueden responder ese tipo de consulta.
  3. Los consulta a la vez. Echo distribuye la consulta a los archivos relevantes en paralelo y reúne lo que devuelven.
  4. Los resultados llegan agrupados. Las coincidencias se agrupan para que veas de un vistazo qué archivos tienen una copia y qué encontró cada uno.

Si no hay ninguna coincidencia, Echo lo dice con claridad y sugiere probar una forma distinta de la misma cosa: por ejemplo, un título en lugar de una URL.

Cómo leer tus resultados

Cada resultado enlaza directamente al archivo que conserva la copia, para que puedas abrir la instantánea, el artículo, el libro o el perfil en su origen. Los archivos difieren en lo que exponen: algunos devuelven metadatos ricos, otros solo un enlace. Abre cualquier archivo desde el catálogo para ver notas sobre qué contiene, cómo funciona y cómo acceder a él.

Explora el catálogo completo

Más allá de la búsqueda en vivo, Echo mantiene un catálogo de todos los archivos que conocemos, incluidos aquellos que aún no podemos consultar de forma programática. Abre el catálogo y filtra por categoría, clúster, API o tipo de acceso para explorar todo el panorama y conocer qué cubre cada archivo.

El catálogo de Archivarix Echo: filtra más de 200 archivos por categoría, clúster, API y tipo de acceso

Los filtros se corresponden con la forma en que están organizados los archivos:

  • Categoría — el tema del archivo (web-archive, scholarly-metadata, books, social, science-articles, image-archive, code-archive y muchos más).
  • Clúster — la gran familia a la que pertenece un archivo (páginas web, texto completo, artículos académicos, software, libros, social, imágenes, vídeo/audio/música, torrents, conjuntos de datos, patrimonio cultural, texto especializado, archivo por hash).
  • API — si el archivo tiene una interfaz programática que Echo puede consultar.
  • Acceso — cuán alcanzable es: open, API, captcha, IP-blocked o link-only.

Qué busca Echo en vivo frente a solo de enlace

No todos los archivos pueden ser consultados por una máquina. Echo maneja dos niveles:

  • Archivos en vivo. Cuando un archivo ofrece una API de búsqueda abierta, Echo la consulta directamente y trae los resultados a tu búsqueda. Estos son los archivos que responden cuando pegas algo en la casilla.
  • Archivos solo de enlace. Algunos archivos no tienen una API utilizable, requieren un captcha o bloquean el acceso automatizado. Echo no puede ejecutar la búsqueda por ti, pero los lista en el catálogo con un enlace directo y notas sobre cómo buscar en ellos a mano. Esta es la lectura honesta: cuando no podemos abrir algo por ti, lo decimos y te indicamos dónde se encuentra.

Cuentas y límites

Puedes buscar en Echo sin registrarte. El uso anónimo tiene un límite diario para mantener la equidad del servicio y prevenir abusos. Una cuenta gratuita eleva ese límite y guarda tu historial de búsqueda para que puedas volver a búsquedas anteriores. Crear una cuenta requiere un correo electrónico y una contraseña: sin pagos, sin plan que elegir. Crea una cuenta gratuita para empezar.

Preguntas frecuentes

¿Archivarix Echo es gratis?

Sí. Puedes buscar sin una cuenta. Una cuenta gratuita simplemente eleva tu límite diario y recuerda tu historial.

¿Cómo funciona?

Echo no almacena el contenido archivado en sí. Detecta lo que pegaste, consulta los archivos públicos que conservan ese tipo de datos y te enlaza a lo que tienen. Los archivos —la Wayback Machine, archive.today, Common Crawl, índices académicos, bibliotecas de libros y otros— llevan años capturando la web.

¿Por qué algunas cosas no se encuentran?

Los archivos solo conservan lo que se capturó antes de que desapareciera. Si ningún archivo público llegó a rastrear o depositar una copia, no hay nada que recuperar. La cobertura es mejor para material que fue público, popular o ampliamente citado.

¿Puede Echo buscar en todos los archivos automáticamente?

No, y no pretendemos lo contrario. Los archivos sin una API utilizable, o que bloquean el acceso automatizado, figuran en el catálogo como solo de enlace, con un enlace directo para que puedas buscar en ellos tú mismo.

¿De dónde provienen los resultados?

Enteramente de archivos públicos y conjuntos de datos abiertos. Echo es un índice y un enrutador sobre ellos; nunca aloja el contenido subyacente, y cada resultado remite a su fuente. Consulta Acerca de para ver el panorama completo.