Explorar el catálogo de archivos
Todas las fuentes que conocemos: filtra por categoría, clúster, API o acceso, y luego abre cualquier archivo para ver los detalles.
- Wayback Machine (Internet Archive) El archivo de páginas web insignia de Internet Archive y el mayor de su clase, con más de un billón de capturas de URL tal como se mostraban en cada momento. Basta con introducir cualquier dirección web para consultar su histórico de instantáneas en la interfaz web; también hay API gratuitas que permiten comprobar si una página está archivada y listar todas sus capturas. Es la primera parada por defecto cuando se necesita una versión antigua o eliminada de casi cualquier página web. El servicio ha sufrido caídas intermitentes en 2026 y limita el uso intensivo, aunque las capturas existentes siguen siendo consultables. Páginas y sitios web API
- archive.today (.ph / .is / .md / .li / .vn / .fo) Un archivador a demanda en el que cualquiera puede enviar una URL y obtener una instantánea permanente; aplana las páginas dinámicas en copias estáticas y a menudo sortea los muros de pago, con decenas de millones de instantáneas acumuladas. Las capturas existentes se localizan mediante su timemap de Memento y se abren como enlaces directos a la instantánea en archive.ph y en sus dominios espejo; guardar una página nueva se hace desde el sitio web y puede exigir resolver un CAPTCHA. Conviene recurrir a él cuando una página ha cambiado o ha desaparecido demasiado recientemente para otros archivos, o cuando hace falta una copia legible de un artículo tras muro de pago. Páginas y sitios web API captcha
- Common Crawl (CDX index) Un proyecto sin ánimo de lucro que rastrea la web abierta a escala de petabytes y publica todo lo que recopila, con unos 2.200 millones de páginas por rastreo y un rastreo nuevo publicado con regularidad. Cada rastreo dispone de una API de índice gratuita y sin clave que informa de si una URL fue capturada y cuándo, y el contenido almacenado de la página puede obtenerse después del conjunto de datos público. Es una serie de instantáneas de rastreo y no un archivo a demanda, por lo que sirve para comprobar cómo se veía un sitio en las ventanas de rastreo recientes o para hacer investigación web masiva. Páginas y sitios web API
- Arquivo.pt (Portuguese Web Archive) El archivo web nacional de Portugal, que preserva miles de millones de ficheros desde 1996, incluidos muchos sitios no portugueses. De forma poco habitual entre los archivos web, ofrece búsqueda de texto completo sobre las páginas preservadas además de la consulta por URL, tanto desde su sitio web como mediante API gratuitas. Conviene recurrir a él cuando se necesita buscar dentro del texto de las páginas archivadas en lugar de limitarse a recuperar una dirección conocida, o al investigar la historia de la web portuguesa y europea. Páginas y sitios web API
- Library of Congress Web Archives El programa de archivo web curado de la Biblioteca del Congreso: más de un centenar de colecciones temáticas de sitios web seleccionadas por sus bibliotecarios, a escala de petabytes. Las colecciones se exploran en loc.gov, y las páginas de colección y de ítem también pueden obtenerse en JSON. Brilla cuando el tema buscado coincide con alguno de los ejes curados, elecciones, acontecimientos, organizaciones, más que para consultar URL arbitrarias. Páginas y sitios web API
- Perma.cc Un servicio de archivado permanente del Library Innovation Lab de Harvard, concebido para que los enlaces citados en textos jurídicos y académicos nunca se degraden; alberga millones de enlaces permanentes. Cada página archivada recibe un código corto de perma.cc que reproduce la captura, y una API pública y gratuita permite consultar los registros existentes. Resulta más útil al seguir un enlace Perma desde un documento judicial o un artículo, o al comprobar si una página se preservó como cita. Páginas y sitios web API
- Archive-It (Internet Archive) El servicio de archivado por suscripción de Internet Archive, empleado por más de mil bibliotecas, administraciones y universidades para construir colecciones web curadas que en conjunto reúnen decenas de miles de millones de documentos. Las capturas se consultan mediante enlaces de reproducción en wayback.archive-it.org, organizados por colección. Compensa cuando la colección de una institución concreta cubre el tema buscado; la cobertura va colección por colección, así que no es el lugar donde consultar URL arbitrarias. Páginas y sitios web
- UK Government Web Archive (The National Archives) El archivo público de The National Archives dedicado a los sitios web de la Administración central británica, con miles de millones de registros que se remontan a alrededor de 2003. Las páginas archivadas se abren mediante enlaces de reproducción en su visor al estilo de Wayback, en webarchive.nationalarchives.gov.uk. Es el lugar donde encontrar versiones antiguas de gov.uk y de los sitios ministeriales, sobre todo mientras el UK Web Archive principal siga fuera de servicio. El servidor rechazó nuestras comprobaciones automáticas, por lo que su comportamiento puede ser irregular; conviene usar el sitio web directamente. Páginas y sitios web
- Vefsafn.is (Icelandic Web Archive) El archivo web nacional de Islandia, gestionado por la Biblioteca Nacional y Universitaria, que ha recolectado el dominio .is completo unas tres veces al año desde 2004 y conserva sitios relacionados con Islandia desde 1996. Las listas de instantáneas proceden de su timemap de Memento, y las capturas individuales se abren como enlaces de reproducción en vefsafn.is, donde el visor puede exigir superar un CAPTCHA. La fuente natural para la historia de los sitios web islandeses. Páginas y sitios web API captcha
- Trove / Australian Web Archive (NLA) El archivo web de la Biblioteca Nacional de Australia: PANDORA, el Australian Government Web Archive y los rastreos del dominio .au combinados, con miles de millones de ficheros y consultables a través del portal Trove. Las capturas se abren como enlaces de reproducción en webarchive.nla.gov.au; la API de Trove no cubre los sitios web archivados, de modo que la búsqueda se hace en el propio sitio. La fuente principal para la historia de los sitios web australianos. Páginas y sitios web
- DNB Webarchiv (German National Library) El archivo web selectivo de la Biblioteca Nacional de Alemania, que recopila instantáneas temáticas de sitios web alemanes desde 2012. No hay API de búsqueda: las colecciones temáticas se exploran desde el portal y son de consulta gratuita en todo el mundo, mientras que el contenido más profundo queda restringido a las salas de lectura de la biblioteca. Merece la pena consultarlo al rastrear sitios o temas alemanes que sus colecciones cubran.
- Ghostarchive Un archivador a demanda pequeño e independiente, destacable por manejar vídeos de YouTube y publicaciones de Twitter además de páginas web corrientes. Las instantáneas se alcanzan mediante enlaces directos a cada página del archivo; no hay API de búsqueda. Conviene consultarlo al buscar copias preservadas de contenido de redes sociales, que los archivos web convencionales suelen capturar mal. Páginas y sitios web
- Conifer (Rhizome, ex-Webrecorder.io) Un servicio de captura alojado de Rhizome (antes Webrecorder.io) para grabaciones interactivas de alta fidelidad de páginas web, reunidas en miles de colecciones creadas por usuarios. Las colecciones se exploran y las grabaciones individuales se abren en el sitio web; no hay API pública de búsqueda. Conviene tener en cuenta que el servicio está cerrando: la captura y la edición se detienen en mayo de 2026 y, desde junio de 2026, pasa a ser de solo lectura, aunque las colecciones existentes siguen siendo consultables.
- Webrecorder / Browsertrix Los creadores de Browsertrix y de la cadena de herramientas sucesora de Conifer: software de rastreo autoalojable o alojado que produce ficheros de archivo web WACZ/WARC. No hay un corpus público central en el que buscar, ya que cada despliegue conserva sus propias capturas. Resulta pertinente cuando se quieren crear archivos de alta fidelidad de sitios web por cuenta propia, más que buscar en los ya existentes.
- Stanford Web Archive Portal (SWAP) El portal de acceso de las Bibliotecas de Stanford a sus colecciones curadas de archivo web, que se almacenan mediante el servicio Archive-It. El portal no tiene API de búsqueda; las colecciones se exploran y las capturas se abren en el sitio web. Resulta útil sobre todo cuando las colecciones curadas de Stanford cubren el tema buscado, ya que el mismo material también es accesible a través de Archive-It.
- EU Web Archive (Publications Office) El archivo de la Oficina de Publicaciones de la UE dedicado a los sitios web de las instituciones, agencias y organismos europeos, recopilados desde 2018. Se consulta navegando por el portal, sin ninguna API de búsqueda documentada. Es el lugar donde buscar versiones anteriores de europa.eu y de otros sitios institucionales; conviene tener en cuenta que el acceso está bloqueado desde algunas redes, por lo que puede no cargarse en todas las conexiones. bloqueo por IP
- KB Netherlands Web Archive El archivo web de la Biblioteca Real de los Países Bajos («Websites van Nederland»), que preserva unos 25.000 sitios neerlandeses curados, varios miles de los cuales ya han desaparecido de la web en vivo. No hay API pública de búsqueda y el acceso más profundo al contenido archivado se limita en gran medida a las salas de lectura de la biblioteca. Conviene usarlo como indicio de que un sitio neerlandés desaparecido puede estar preservado, y realizar la consulta completa de forma presencial. bloqueo por IP
- US NARA Web Harvests (webharvest.gov) La colección de los Archivos Nacionales de Estados Unidos con recolecciones web periódicas de los sitios del Congreso y de la Presidencia. Solo permite navegar por webharvest.gov, sin API de búsqueda. Conviene recurrir a ella cuando se necesita ver cómo eran los sitios oficiales del Gobierno estadounidense al cierre de una legislatura o de una administración presidencial.
- Kiwix / Zimit Más que un servicio de consulta, es un ecosistema de archivo sin conexión: Kiwix empaqueta sitios web completos, Wikipedia, StackExchange y miles más, en ficheros ZIM descargables, y Zimit permite convertir otros sitios al mismo formato. Se explora la biblioteca de paquetes y se descargan copias completas de los sitios para leerlas sin conexión; no hay búsqueda de instantáneas por URL. Resulta útil cuando se quiere una copia completa y funcional de un sitio en lugar de una captura fechada de una sola página.
- PADICAT (Catalonia) El archivo web nacional de Cataluña, que combina selecciones curadas con rastreos del dominio .cat. Todo se hace a través de su propio portal web, sin API confirmada, de modo que la búsqueda y la consulta de capturas se realizan en padicat.cat. Es la fuente de referencia para la historia de los sitios web catalanes, aunque el sitio puede tardar en responder.
- Croatian Web Archive (HAW) El archivo web nacional de Croacia, gestionado por la Biblioteca Nacional y Universitaria de Zagreb, que preserva sitios .hr mediante selección curada y rastreos anuales del dominio. El acceso consiste en navegar por el sitio web de HAW; no hay ninguna API documentada. Cubre la historia de la web croata, pero el sitio resultó inaccesible en nuestras comprobaciones recientes, por lo que su disponibilidad es actualmente incierta.
- Bibliotheca Alexandrina Web Archive La rama de archivo web de la Biblioteca de Alejandría, en Egipto, que históricamente alojó un espejo de la colección anterior a 2007 de Internet Archive junto a material regional. El acceso consiste en navegar por el sitio; no hay API. Sus fondos actuales no están claros: la página carga, pero no hay indicios recientes de que el espejo siga funcionando, así que conviene verificar el contenido antes de confiar en él.
- Yandex (cache / SERP) El buscador ruso, incluido aquí por ser el último gran motor que sigue mostrando copias en caché de páginas web. No hay una API estable: se realiza una búsqueda normal en yandex.com y se busca el enlace «saved copy» junto a un resultado. Merece la pena intentarlo cuando una página ha desaparecido demasiado recientemente para que los archivos web la hayan capturado. Cabe esperar comprobaciones antibot: el sitio interpela con frecuencia a los visitantes antes de mostrar los resultados. Texto completo de la web captcha
- Crossref REST API El registro autorizado de metadatos DOI de la edición académica, con unos 165 millones de registros. Permite consultar cualquier DOI para recuperar su ficha bibliográfica, o buscar por título y autor, desde el sitio web o mediante una API abierta y gratuita. Es la referencia fundamental para verificar citas y averiguar qué identifica realmente un DOI. Artículos académicos API
- Unpaywall Base de datos que asocia los DOI a copias legales en acceso abierto de los artículos y que sigue el estado de acceso abierto de unos 150 millones de DOI. A partir de un DOI indica si existe una copia gratuita y legítima a texto completo y dónde está, mediante una API gratuita y sencilla. Es la forma habitual de responder a la pregunta «¿puedo leer gratis y de forma legítima este artículo de pago?». API
- OpenAlex Índice abierto del panorama investigador mundial: unos 480 millones de trabajos académicos vinculados con autores, instituciones y temas. Se puede explorar en openalex.org o consultar su API, que desde febrero de 2026 requiere una clave de cuenta gratuita (con una asignación diaria gratuita considerable). Destaca para el mapeo bibliográfico amplio, ya que reúne trabajos, autores y producción institucional en un mismo lugar. El acceso sin clave se limita ahora a una pequeña cuota diaria de demostración. Artículos académicos API · key
- Semantic Scholar (Academic Graph) Buscador académico y grafo de citas del Allen Institute for AI, con unos 220 millones de artículos y contexto de citación. Se puede buscar en el sitio web o utilizar la Graph API gratuita, que no necesita clave pero funciona sobre un fondo anónimo compartido y muy limitado. Resulta especialmente cómodo para seguir rastros de citas y ver cómo se relacionan los artículos. Con mucha carga, la API sin clave sufre limitaciones de tasa con frecuencia, por lo que el sitio web es la vía más fiable. Artículos académicos API
- DataCite REST API El registro de DOI para resultados de investigación distintos de los artículos de revista —conjuntos de datos, software y preprints—, con decenas de millones de DOI. Los registros se pueden consultar o buscar mediante una API gratuita que no requiere clave. Es el complemento de Crossref cuando el objeto que se rastrea es un conjunto de datos o un software de investigación en lugar de un artículo. Artículos académicos API
- OpenCitations Índice abierto de enlaces de cita académicos, con más de dos mil millones de conexiones de DOI a DOI según su actualización de febrero de 2026. Los recuentos de citas, las citas recibidas y las listas de referencias de cualquier DOI están disponibles mediante una API gratuita; la página de búsqueda del sitio web está protegida por un CAPTCHA, pero la API responde sin problemas. Se utiliza para ver quién cita un artículo o para construir rastros de citas a partir de datos totalmente abiertos. API
- dblp (CS bibliography) La bibliografía curada de informática, que indexa alrededor de siete millones de publicaciones de revistas y congresos del área con registros de autor cuidadosamente mantenidos. Se puede consultar en dblp.org o mediante su API gratuita. Su alcance se limita estrictamente a la informática, pero dentro de ese campo suele ser el registro más limpio y fiable de quién publicó qué, dónde y cuándo. Artículos académicos API
- arXiv (export API) El servidor de preprints de física, matemáticas, informática y campos afines, que aloja unos 2,5 millones de artículos con texto completo gratuito. Se puede buscar y navegar en arxiv.org o consultar la API de exportación gratuita. Es el primer sitio donde buscar investigación reciente antes de su publicación en revistas, o en lugar de ella. Desde principios de 2026 las consultas automatizadas están más limitadas, por lo que el acceso automático puede tener que ralentizarse. Artículos académicos API
- bioRxiv El servidor de preprints de biología gestionado por el Cold Spring Harbor Laboratory, que aloja más de 300.000 preprints con texto completo gratuito. La búsqueda y la lectura se realizan en biorxiv.org; el sitio muestra a veces una breve comprobación de Cloudflare antes de cargar, y los detalles de cada artículo también están disponibles mediante una API gratuita. Es el lugar donde encontrar investigación biológica meses antes de que aparezca en las revistas. Artículos académicos API captcha
- medRxiv El servidor de preprints hermano de bioRxiv dedicado a la medicina y las ciencias de la salud, con más de 60.000 preprints de lectura gratuita. El sitio medrxiv.org permite buscar y leer (puede mostrar antes una breve comprobación del navegador); los detalles de cada artículo también están expuestos mediante la API compartida de bioRxiv. Conviene recurrir a él para seguir la investigación clínica y de salud pública antes de la revisión por pares. Artículos académicos API captcha
- PubMed / PMC (NCBI E-utilities) El índice de literatura biomédica de los Institutos Nacionales de Salud de Estados Unidos, con unos 37 millones de referencias y cerca de 10 millones de artículos a texto completo en PubMed Central. La consulta del corpus se realiza mediante las E-utilities del NCBI, que devuelven resultados sin necesidad de clave de API. Es la primera parada habitual para la literatura médica, clínica y de ciencias de la vida. Artículos académicos API
- Europe PMC Colección de literatura de ciencias de la vida mantenida por el EMBL-EBI, con unos 43 millones de publicaciones junto con contenido abierto a texto completo. Una única interfaz de búsqueda sin clave devuelve tanto los metadatos como, cuando está disponible, el texto completo del artículo. Conviene recurrir a ella cuando se buscan artículos biomédicos y se necesita el texto real y no solo la referencia. Artículos académicos API
- DOAJ Directorio de revistas de acceso abierto verificadas junto con metadatos a nivel de artículo, con unas 21.000 revistas y más de 10 millones de artículos. Las búsquedas se realizan mediante una interfaz sin clave sobre sus metadatos de licencia abierta, o se puede navegar directamente por el sitio. Sirve para confirmar que una revista es realmente de acceso abierto o para encontrar artículos de lectura gratuita. Artículos académicos API
- DOAB (Open Access Books) El equivalente en libros de DOAJ: un directorio de libros académicos de acceso abierto revisados por pares, con unos 95.000 títulos. Su catálogo se puede consultar mediante una interfaz sin clave y también navegar por la web. Conviene recurrir a él cuando se necesitan monografías y volúmenes colectivos académicos de lectura gratuita. Libros API
- OpenAIRE Graph Grafo de conocimiento europeo de ciencia abierta que enlaza cientos de millones de productos de investigación: publicaciones, conjuntos de datos, software y registros de financiación. Se puede consultar mediante su API o navegar por el portal Explore en la web. Es una buena opción para rastrear las conexiones entre un artículo y los datos, el software o la ayuda que lo sustentan, aunque el servicio está en plena migración a una nueva API de grafo en 2026 y sus antiguos puntos de acceso de búsqueda se están retirando. Artículos académicos API
- CORE (core.ac.uk) Agregador de investigación en acceso abierto que recolecta texto completo y metadatos de más de 10.000 repositorios, con un total de unos 300 millones de registros y más de 40 millones de documentos a texto completo. El acceso se realiza mediante una API de búsqueda que necesita una clave gratuita, ya que el uso anónimo está muy limitado. Conviene recurrir a él para lanzar la red más amplia posible sobre el texto completo en acceso abierto, en lugar de consultar un único repositorio. API · key
- BASE (Bielefeld) Buscador académico de la Universidad de Bielefeld que indexa más de 400 millones de documentos recolectados de más de 12.000 proveedores de contenido. El portal web es de acceso libre para buscar en todo ese material. Su interfaz programática está limitada a direcciones IP registradas previamente, por lo que en la práctica se utiliza a través del sitio web. bloqueo por IP
- The Lens Plataforma de búsqueda y analítica que abarca trabajos académicos junto con patentes, con más de 270 millones de registros. La interfaz web permite buscar y cruzar literatura científica y de patentes en un mismo lugar. Su API está sujeta a aprobación y es en su mayor parte de pago, por lo que la vía práctica es el sitio web: resulta útil cuando una consulta abarca tanto publicaciones académicas como patentes.
- Dimensions (Digital Science) Base de datos de investigación enlazada que conecta publicaciones, ayudas, patentes, ensayos clínicos y documentos de políticas, con más de 140 millones de publicaciones. La búsqueda se realiza a través de su aplicación web. El acceso programático está sujeto a suscripción y aprobación, así que conviene usar el sitio directamente cuando se quiere seguir un tema a través de la financiación, los ensayos y las políticas además de los artículos.
- Scite.ai Servicio de análisis de citas que clasifica unos 1.600 millones de citas según si apoyan una afirmación, la contradicen o se limitan a mencionarla. Se accede al informe de citas de un artículo mediante enlaces directos a su sitio web. La API tiene precio empresarial, por lo que el acceso se basa en enlaces: resulta útil cuando se quiere saber no solo quién ha citado un artículo, sino cómo. captcha
- Connected Papers Herramienta que construye un grafo visual de los artículos relacionados con un trabajo determinado por similitud, a partir de un corpus de decenas de millones de artículos. Se utiliza abriendo la vista de grafo de un artículo en su sitio web. No dispone de interfaz de consulta abierta, por lo que funciona como enlace directo: conviene recurrir a ella para descubrir literatura adyacente en torno a un artículo ya conocido.
- Open Library Catálogo abierto y editable de libros, ediciones y autores gestionado por Internet Archive, con registros de más de 40 millones de ediciones y obras y enlaces a copias en préstamo. Se puede buscar por título o consultar un ISBN concreto mediante su API sin clave, o navegar por el catálogo en la web. Es una parada sólida de uso general para obtener datos bibliográficos y averiguar dónde se puede leer o tomar prestado un libro. Libros API
- Internet Archive Texts La colección de textos y libros de archive.org, con más de 40 millones de documentos digitalizados, algunos disponibles únicamente mediante préstamo controlado. Una interfaz de búsqueda y metadatos sin clave permite localizar documentos y abrirlos en el lector. Sirve para constatar que un libro o documento existe y para leer material de dominio público, teniendo en cuenta que el texto completo protegido por derechos de autor está sujeto a préstamo y que el servicio puede aplicar limitaciones cuando hay mucha carga. Libros API
- scholar.archive.org / fatcat El catálogo académico de Internet Archive (fatcat), que ofrece búsqueda de texto completo en más de 25 millones de artículos en acceso abierto, incluidas copias de preservación de artículos. La búsqueda se realiza a través del sitio scholar.archive.org. Por ahora conviene acceder mediante la interfaz web, ya que su API de consulta no resultó fiable en la última comprobación. Artículos académicos
- HathiTrust Gran biblioteca digital colaborativa con más de 18 millones de volúmenes digitalizados procedentes de bibliotecas de investigación. Una interfaz bibliográfica sin clave devuelve registros de catálogo con enlaces directos al lector; los volúmenes de dominio público se pueden leer, mientras que el texto completo protegido por derechos de autor queda restringido a los miembros vinculados. Conviene recurrir a ella para verificar fondos y acceder a volúmenes escaneados, aunque su interfaz de búsqueda puede mostrar una página de comprobación desde algunas redes. Libros API captcha
- Google Books API El índice de volúmenes de libros de Google, que abarca decenas de millones de títulos con metadatos y, cuando está permitido, vistas previas. Se puede buscar por título o ISBN a través de su API, y una clave gratuita eleva una cuota de peticiones que de otro modo es muy estricta. Ofrece una cobertura amplia para confirmar la existencia de un libro y los datos de la edición, así como para encontrar páginas de vista previa. Libros API
- Project Gutenberg (Gutendex) La colección clásica de unos 75.000 libros electrónicos gratuitos de dominio público, con el servicio Gutendex, que expone su catálogo en JSON para buscar por título o autor. También se puede navegar y descargar directamente desde el sitio web de Gutenberg. Es la referencia para conseguir textos completos y gratuitos de obras libres de derechos, aunque la consulta del catálogo puede ser lenta o agotar el tiempo de espera de vez en cuando. Libros API
- Standard Ebooks Colección pequeña y cuidadosamente elaborada de unos 900 libros electrónicos de dominio público, pulidos y maquetados con un alto estándar, con canal OPDS. Los títulos se pueden consultar y descargar desde su sitio web. Conviene recurrir a ella cuando se quiere una edición limpia y bien maquetada de un clásico en lugar de un escaneo en bruto. Libros bloqueo por IP
- Wikisource La biblioteca de Wikimedia de textos originales de contenido libre: libros transcritos, documentos, discursos y material histórico, con millones de páginas. Puede consultarse mediante la API estándar de MediaWiki o en el sitio web. Resulta útil para localizar textos completos, transcritos y citables, de documentos de dominio público y de fuentes primarias. Libros API
- WorldCat / OCLC El mayor catálogo colectivo de fondos bibliotecarios del mundo: agrega más de 550 millones de registros e indica qué bibliotecas poseen un ejemplar determinado. La consulta se realiza a través de la interfaz web de search.worldcat.org. Ya no existe una API gratuita, por lo que conviene usar el sitio web; sigue siendo la referencia estándar para localizar un ejemplar físico en una biblioteca.
- Trove books (NLA) El servicio de descubrimiento de la Biblioteca Nacional de Australia para libros, prensa, imágenes y material australiano, con miles de millones de elementos. Puede consultarse en el sitio web de Trove o a través de su API con una clave gratuita. Es el recurso principal para el material australiano publicado e histórico; conviene tener en cuenta que abarca libros y registros de catálogo, no capturas de archivo web. API · key
- Anna's Archive Un índice de metabúsqueda sobre varias bibliotecas en la sombra: LibGen, Sci-Hub, Z-Library y colecciones obtenidas mediante scraping, con unos 64 millones de libros y 96 millones de artículos. Apunta a copias de obras alojadas externamente, muchas de ellas protegidas por derechos de autor, por lo que funciona como directorio de enlaces y no sirve los archivos por sí mismo. Los investigadores lo utilizan como búsqueda única sobre múltiples fuentes en la sombra, pero sus dominios cambian con frecuencia y el espejo operativo debe resolverse en el momento de la consulta. Libros captcha
- Library Genesis (LibGen) Una veterana biblioteca en la sombra de libros, manuales y artículos que se cuentan por millones. Indexa material protegido por derechos de autor alojado en otros sitios, por lo que actúa como fuente de enlaces y no como alojamiento de contenidos. Sus dominios espejo cambian a menudo y deben resolverse en el momento de la consulta, lo que hace que el acceso sea intermitente. Libros bloqueo por IP
- Sci-Hub Un servicio que proporciona los PDF a texto completo de artículos de revista de pago consultados por DOI, con un corpus de unos 88 millones de artículos. Enlaza a material protegido por derechos de autor alojado en otros sitios en lugar de servirlo directamente. La colección está en gran medida congelada en torno a 2021, por lo que constituye una vía aproximativa para DOI antiguos, y sus dominios espejo rotan. Artículos académicos captcha
- Z-Library Una gran biblioteca en la sombra de libros electrónicos y artículos, con decenas de millones de elementos tras un inicio de sesión. Indexa material protegido por derechos de autor alojado en otros sitios, por lo que actúa como directorio de enlaces, y numerosos clones de phishing la imitan. El acceso es frágil por el muro de inicio de sesión y la rotación frecuente de dominios. captcha
- Bluesky public AppView (AT Protocol) Una interfaz abierta y sin clave a toda la red social Bluesky: perfiles, publicaciones y canales de decenas de millones de cuentas. Las lecturas públicas de perfiles y canales se realizan a través de su API sin ningún inicio de sesión ni clave. Es la vía más limpia para incorporar publicaciones y perfiles sociales actuales directamente en los resultados de búsqueda. API
- Telegram public preview (t.me/s/) La vista previa web renderizada en el servidor por el propio Telegram para cualquier canal público, que muestra las publicaciones recientes sin aplicación ni inicio de sesión. Se accede simplemente abriendo la página de vista previa del canal en t.me. Es la forma más directa de leer y extraer publicaciones de canales públicos de Telegram. API
- Wayback, twitter/x URLs La Wayback Machine aplicada a las URL de twitter.com y x.com, que devuelve instantáneas archivadas de tuits y perfiles allí donde fueron rastreados. Permite comprobar si un tuit concreto fue capturado y abrir la copia guardada mediante enlaces de reproducción. Es una de las vías más fiables para recuperar tuits borrados, aunque la cobertura es irregular y resulta más completa en las cuentas destacadas. Redes sociales API
- Wayback Tweets (claromes) Una herramienta que consulta el índice de capturas de la Wayback Machine para listar todos los tuits archivados de un identificador determinado. Se apoya en los mismos datos de capturas de Wayback, acotados a una cuenta cada vez. Resulta útil para enumerar los tuits archivados que sobreviven de un usuario, aunque la aplicación alojada suele quedarse inactiva o agotar el tiempo de espera. Redes sociales API
- archive.today. X / Facebook archive.today utilizado específicamente para páginas de X y Facebook a las que el rastreador de Wayback suele no llegar, con decenas de millones de instantáneas creadas a demanda. La existencia de capturas se comprueba mediante su timemap de Memento, y la instantánea guardada se abre a través de un enlace directo. Resulta valioso para páginas sociales que otros archivos no recogen, aunque las páginas de instantáneas pueden aplicar límites de peticiones y el servicio ha sufrido bloqueos regionales en 2026. Redes sociales API captcha
- Wayback, facebook.com La Wayback Machine aplicada a las URL de facebook.com, que muestra instantáneas archivadas de páginas y publicaciones públicas de Facebook allí donde fueron capturadas. Permite comprobar la existencia de capturas y abrir las copias guardadas mediante sus enlaces de reproducción. La cobertura es escasa porque Facebook bloquea los rastreadores y muchas capturas contienen solo la pantalla intersticial de inicio de sesión, por lo que los resultados son mejores en el caso de las páginas públicas. Redes sociales API
- Wayback, reddit.com La Wayback Machine aplicada a las URL de reddit.com, con instantáneas archivadas de hilos y perfiles y buena cobertura de las discusiones populares. Permite comprobar si un hilo fue capturado y abrir la copia guardada mediante enlaces de reproducción. Como no depende de la API del propio Reddit, es una de las vías más fiables para recuperar contenido retirado o eliminado de Reddit. Redes sociales API
- IA Twitter Stream Grab Un conjunto de volcados masivos del Internet Archive del antiguo flujo de muestra público de Twitter, almacenados como archivos JSON mensuales y con miles de millones de tuits desde aproximadamente 2011 hasta 2023. Se accede descargando los archivos del conjunto de datos, que aparecen listados a través de la API de metadatos del elemento. Está pensado para el análisis masivo y sin conexión de datos históricos de Twitter, más que para consultar un tuit concreto; el conjunto de datos está congelado, ya que el flujo de origen ya no existe. Redes sociales API
- PullPush.io Un sucesor abierto de Pushshift que ofrece búsqueda de texto completo sin clave en comentarios y publicaciones de Reddit, incluido el contenido retirado o eliminado posteriormente. Se consulta a través de su API JSON por subreddit o por palabra clave. Es la principal herramienta práctica para buscar en el historial de Reddit y recuperar publicaciones retiradas. Redes sociales API
- Arctic Shift Un servicio de datos de Reddit que ofrece una API sin clave, volcados masivos descargables y una interfaz web, con límites más generosos que PullPush. Su búsqueda de texto completo se limita a un usuario o un subreddit concretos, no a todo el sitio. Conviene recurrir a él como complemento de PullPush cuando se necesitan datos archivados de Reddit dentro de una comunidad o cuenta determinadas. Redes sociales API
- Reddit Data API (official) La API de datos del propio Reddit, en la que añadir .json a la URL de una página devuelve su contenido sin autenticación y OAuth desbloquea más posibilidades. Sirve datos de Reddit actuales y en vivo (publicaciones, comentarios y perfiles), pero no ofrece búsqueda histórica profunda. Conviene usarla para el contenido actual de Reddit y combinarla con PullPush o Arctic Shift cuando se necesite el pasado. API
- Desuarchive (4chan archive) Un archivo basado en FoolFuuka de tablones seleccionados de 4chan (/a/, /int/, /k/, /tg/, /wsg/ y otros) con un amplio historial. Conserva copias de los hilos consultables a texto completo, de modo que se pueden encontrar publicaciones antiguas de 4chan después de que desaparezcan del propio 4chan, ya sea desde el sitio web o a través de su API JSON sin clave. Es una fuente esencial para la investigación de foros en los tablones que cubre; conviene tener en cuenta que algunos tablones contienen material NSFW o extremo. Redes sociales API
- Mastodon per-instance API Todo servidor de Mastodon expone una API REST integrada, y las lecturas públicas, como las consultas de cuentas y las líneas de tiempo públicas, funcionan por lo general sin token. No hay búsqueda global: cada consulta se dirige a una instancia concreta, la federación solo ofrece un alcance parcial entre instancias y la búsqueda de texto completo requiere un token en la mayoría de los servidores. Resulta útil para consultar una cuenta concreta de Mastodon o explorar las publicaciones públicas de una instancia. API
- Fediverse Observer Un directorio y monitor de disponibilidad que cubre miles de servidores del Fediverso y de Mastodon, con un punto de acceso GraphQL detrás. Conviene usar el sitio web para descubrir qué instancias existen y cuáles están activas en este momento. No alberga publicaciones; es la primera parada natural antes de profundizar en un servidor de Mastodon concreto.
- Nitter (xcancel.com et al.) Interfaces alternativas centradas en la privacidad para X/Twitter (xcancel.com y otras instancias de Nitter) que muestran perfiles y líneas de tiempo sin iniciar sesión, incluidos canales RSS por usuario. Muestran únicamente datos en vivo de X, no son un archivo, y el ecosistema se ha desmoronado en su mayor parte: solo resisten unas pocas instancias. Resultan útiles para leer una cuenta de X sin tener cuenta propia, pero cabe esperar bloqueos y caídas; conviene consultar antes el monitor de estado de Nitter para encontrar una instancia operativa. bloqueo por IP
- Nitter health tracker Una página de estado en tiempo real que registra cuáles de las instancias de Nitter que quedan están activas. No contiene contenido propio; es una utilidad que se abre primero para elegir un espejo de Nitter operativo antes de intentar consultar perfiles de X/Twitter a través de él. Basta con abrirla en el navegador; no hay nada que buscar.
- Thread Reader App Despliega hilos de X/Twitter en páginas únicas y legibles y, una vez desplegado un hilo, la página se conserva aunque los tuits originales se eliminen. Millones de hilos desplegados pueden leerse sin ningún inicio de sesión en direcciones predecibles del tipo /thread/<tweetid>.html. Resulta práctico para recuperar un hilo eliminado que alguien desplegó mientras estaba activo; crear despliegues nuevos requiere una cuenta de X para mencionar al bot.
- Politwoops (ProPublica) El archivo de ProPublica de tuits eliminados por políticos, con alrededor de un millón de eliminaciones recopiladas entre 2012 y 2023. Se consulta en la web, sin API, buscando a un político para ver qué retiró. La colección está congelada: el seguimiento terminó en 2023, por lo que es estrictamente un registro histórico de ese periodo.
- Telegago (Google CSE) Una búsqueda personalizada de Google configurada para explorar las páginas públicas de Telegram (t.me): canales, publicaciones y perfiles que Google haya indexado. Se utiliza como un cuadro de búsqueda corriente en el navegador; la cobertura es la que Google haya rastreado de t.me. Una forma rápida y gratuita de descubrir canales de Telegram sobre un tema cuando no se sabe por dónde empezar.
- TGStat El mayor servicio de catálogo y analítica de Telegram, con más de 2,5 millones de canales y grupos públicos, búsqueda de publicaciones y estadísticas de audiencia. Conviene usar el sitio web para encontrar canales por tema o palabra clave y examinar su alcance; la API es de pago y requiere token. Es la opción de referencia para cartografiar el ecosistema de Telegram en torno a un asunto o investigar un canal concreto. captcha
- Telemetr.io Un gran índice de analítica de Telegram, con un papel similar al de TGStat: estadísticas de canales y datos de publicaciones del ámbito público de Telegram. Los datos completos están tras un inicio de sesión y una suscripción de pago, por lo que conviene tratarlo como un sitio que se abre y se explora, más que como algo que consultar de forma abierta. En nuestra última comprobación de disponibilidad no estaba accesible, así que cabe esperar posibles caídas.
- SocialData API Una API comercial que devuelve datos de X/Twitter: búsquedas, perfiles de usuario y tuits, sin pasar por la API oficial de X. Es puramente programática: las peticiones necesitan una clave de API de pago, se facturan por tuit recuperado y no existe interfaz de navegación gratuita. Resulta relevante cuando se necesitan resultados fiables de búsqueda en X a gran escala y se dispone de presupuesto para ello. API · key
- X API v2 (official) La interfaz oficial para desarrolladores de X (Twitter), que abarca toda la plataforma. Desde principios de 2026 funciona con un modelo de créditos de pago por uso y el nivel gratuito ha desaparecido, mientras que la búsqueda sobre el archivo completo queda reservada a niveles caros. Para la investigación en archivos es hoy un último recurso, practicable solo si se está dispuesto a pagar por petición; este sitio enlaza a ella en lugar de consultarla.
- Meta Content Library La herramienta de investigación de Meta para estudiar el contenido público de Facebook e Instagram, sucesora de CrowdTangle, que expone las publicaciones con más de 100 campos de datos. El acceso está restringido a investigadores académicos y sin ánimo de lucro acreditados, que trabajan dentro del entorno seguro de Meta tras la validación de ICPSR; no hay sitio web público ni API abierta. Se incluye para que los investigadores sepan que existe una vía oficial de acceso a los datos de Facebook/Instagram; la solicitud se tramita a través de ICPSR si se cumplen los requisitos. bloqueo por IP
- Reveddit Muestra el contenido de Reddit eliminado por moderadores o AutoModerator en un usuario o hilo dados. Se utiliza en la web introduciendo un nombre de usuario o el enlace de un hilo; no tiene una API estable. Desde que perdió su fuente de datos de Pushshift su profundidad se ha reducido mucho, sobre todo a contenido retirado por moderadores, y el sitio está tras un desafío antibot, así que conviene tomar los resultados como orientativos. captcha
- redditsearch.io Una interfaz de búsqueda de Reddit más antigua que funcionaba con el archivo de Pushshift. Desaparecido el acceso público de Pushshift, resulta prácticamente inservible para buscar, aunque la página siga cargando. Se conserva solo por exhaustividad; para contenido histórico de Reddit conviene usar PullPush o Arctic Shift.
- twstalker / Sotwe (X viewers) Visores de terceros (twstalker, Sotwe y similares) que extraen datos de X/Twitter y reexhiben los tuits recientes de un perfil sin necesidad de iniciar sesión. La cobertura se limita a un perfil y a las publicaciones recientes, y se accede abriendo el sitio en un navegador. Estos scrapers son frágiles y con frecuencia están bloqueados: nuestras comprobaciones se toparon con errores y desafíos antibot, así que conviene tomarlos como un recurso ocasional, no como una fuente fiable. captcha
- Picuki (IG viewer) Un visor anónimo de Instagram para consultar perfiles, publicaciones e historias públicas sin cuenta. Funciona únicamente como sitio web, sin API, en un pulso constante con las defensas de Instagram. Resulta útil para echar un vistazo rápido y sin registro a una cuenta pública de IG, pero está tras desafíos antibot y deja de funcionar de forma intermitente. captcha
- Imginn (IG viewer) Un visor y descargador sin registro para publicaciones e historias públicas de Instagram. Funciona solo desde el navegador, sin API y, como otros visores de IG, se basa en scraping y es frágil. Nuestras comprobaciones de disponibilidad lo encontraron bloqueado o con un desafío antibot, así que conviene tener alternativas a mano por si no carga. captcha
- AnonyIG (IG story viewer) Uno de toda una categoría de visores anónimos de historias y destacados de Instagram que no requieren registro. Se usa directamente en el navegador para ver las historias de una cuenta pública; no tiene API. Instagram inutiliza activamente estos servicios y nuestras comprobaciones se toparon con bloqueos legales y errores, así que hay que contar con probar varios visores similares antes de dar con uno que funcione. bloqueo por IP
- Bluesky Firehose / Jetstream El flujo de eventos en tiempo real de Bluesky, que abarca toda la red según sucede; Jetstream es el servicio complementario que entrega ese mismo flujo en un JSON más sencillo. Es un canal WebSocket orientado a desarrolladores y sin clave, pensado para la monitorización en directo y la recopilación de datos, no para consultar publicaciones antiguas. Resulta relevante cuando se quiere capturar o seguir la actividad de Bluesky en tiempo real. API
- 4plebs (4chan archive) Un archivo de larga trayectoria de varios tablones de 4chan (/pol/, /x/, /tv/, /adv/ y otros) que conserva años de historial con búsqueda de texto completo. La búsqueda se hace en el sitio web; su API JSON existe, pero las defensas antiscraping la bloquean desde muchas redes, así que el acceso automatizado no es fiable. Es una fuente clave para rastrear hilos antiguos o eliminados de 4chan en sus tablones; conviene tener presente que contiene material NSFW y extremo. Redes sociales bloqueo por IP
- archived.moe (4chan) Un archivo de 4chan destacable por su cobertura multitablón inusualmente amplia y por su extenso historial. Conviene contar con usar el sitio web directamente: técnicamente existe una API, pero las defensas antibot bloquean a los clientes automatizados tanto en las páginas como en la API. Merece la pena consultarlo cuando un hilo no está en Desuarchive ni en 4plebs, aunque sus protecciones antiscraper también pueden entorpecer las visitas normales; no debe confundirse con el desaparecido archive.moe. captcha
- Software Heritage Un archivo universal de código fuente, la «Biblioteca de Alejandría del código», que preserva más de 20.000 millones de ficheros de código fuente únicos procedentes de más de 350 millones de proyectos. Permite buscar proyectos, consultar ficheros por hash (sha1/sha256/git) y resolver identificadores permanentes SWHID, tanto en el sitio web como a través de su API REST sin clave. Es el lugar al que acudir cuando un repositorio se ha esfumado de su alojamiento original o cuando hay que identificar un fichero por su hash. Software y paquetes API
- Wikimedia Commons El mayor repositorio de material multimedia con licencia libre, más de 110 millones de ficheros, que sustenta Wikipedia y sus proyectos hermanos. Todo se puede buscar en el sitio web, y la API estándar de MediaWiki ofrece la misma búsqueda sin clave. Es la opción a la que recurrir cuando se necesitan imágenes y otros contenidos con licencia abierta, con fuentes y licencias documentadas. Imágenes API
- Openverse Un motor de búsqueda del proyecto WordPress que abarca más de 800 millones de imágenes y ficheros de audio con licencia abierta o de dominio público procedentes de numerosas colecciones de origen. Se puede buscar en el sitio web o a través de su API sin clave. Es la mejor opción cuando se busca material reutilizable y una sola consulta sobre muchas colecciones abiertas en vez de visitar cada una por separado. Imágenes API
- Internet Archive (Video) Los fondos de vídeo de Internet Archive: millones de elementos entre películas, televisión y material efímero. La búsqueda y los metadatos están disponibles a través del sitio web o de la API de búsqueda sin clave de archive.org. Es una fuente primaria para metraje antiguo, poco conocido o desaparecido; comparte las caídas intermitentes y la limitación de peticiones que sufre Internet Archive en 2026, así que puede ser necesario reintentar de vez en cuando. Vídeo, audio y música API
- Internet Archive (Audio) / Live Music Millones de elementos de audio abierto en Internet Archive, incluido Live Music Archive con más de 250.000 conciertos grabados legalmente. Se puede buscar en el sitio web, con la misma API de búsqueda y metadatos sin clave que el resto de archive.org. Es la primera parada para grabaciones en directo, emisiones antiguas y otros audios difíciles de encontrar en cualquier otro sitio. Vídeo, audio y música API
- YouTube via Wayback Machine Más que un sitio aparte, es una técnica de recuperación: consultar en Wayback Machine capturas antiguas de páginas de reproducción de YouTube para recuperar los metadatos, títulos y miniaturas de vídeos eliminados o modificados. Se comprueba si existe una captura mediante la API de disponibilidad de Wayback y después se abre la propia página archivada. La cobertura se limita a las URL de vídeo que Wayback Machine llegó a guardar y lo habitual es recuperar la página y no la reproducción; conviene combinarla con Filmot o Ghostarchive cuando se busca un vídeo perdido. API
- Dailymotion Un importante alojamiento de vídeo occidental con cientos de millones de vídeos y una búsqueda especialmente estable a través de su Graph API pública sin clave. En nuestra investigación sobre dónde reaparecen los vídeos desaparecidos de YouTube, destacó como la mejor fuente de resubidas de acceso abierto. Conviene buscar aquí al perseguir una copia de un vídeo que ha desaparecido de YouTube; de momento se ofrece como enlace externo al sitio. Vídeo, audio y música
- RuTube El principal alojamiento de vídeo de Rusia, con decenas de millones de vídeos; nuestra investigación encontró un solapamiento de aproximadamente el 4 % con resubidas de YouTube. La búsqueda funciona en el sitio web, aunque su endpoint de búsqueda informal limita las peticiones y lanza captchas ante ráfagas de tráfico automatizado. Merece la pena consultarlo cuando un vídeo en ruso o relacionado con Rusia ha desaparecido de YouTube. Vídeo, audio y música captcha
- VK Video La rama de vídeo de VKontakte, con miles de millones de clips y un alto potencial para encontrar resubidas en ruso. La mayor parte está tras un muro de inicio de sesión: la búsqueda web requiere cuenta y la API oficial necesita una aplicación registrada y un token de acceso. Conviene consultarla al buscar contenido de vídeo del ámbito ruso, pero hay que contar con iniciar sesión para poder buscar. bloqueo por IP
- Odysee Una plataforma de vídeo construida sobre el protocolo LBRY que aloja decenas de millones de elementos con un acceso notablemente abierto: sin captchas ni muros de inicio de sesión en nuestra investigación. Se puede buscar directamente en el sitio web. Es una candidata sólida a la hora de comprobar resubidas cuando un vídeo ha sido retirado de las plataformas mayoritarias. Vídeo, audio y música
- Rumble Un alojamiento de vídeo estadounidense con cientos de millones de elementos. No tiene una API pública estable y bloquea el tráfico procedente de centros de datos, así que la búsqueda debe hacerse directamente en el sitio web desde una conexión ordinaria. Merece la pena incluirlo al rastrear alojamientos de vídeo en busca de resubidas de contenido desaparecido en otros lugares. Vídeo, audio y música bloqueo por IP
- BitChute Un alojamiento de vídeo independiente con millones de vídeos. No hay una API pública estable y la página de búsqueda está protegida por un hCaptcha frente a los visitantes automatizados, así que la búsqueda debe hacerse manualmente en el navegador. Es una parada habitual al rastrear plataformas de vídeo alternativas en busca de copias de metraje retirado o difícil de encontrar. Vídeo, audio y música captcha
- OK.ru Video La rama de vídeo de Odnoklassniki, una importante red social rusa que aloja cientos de millones de clips. Interesa sobre todo como lugar donde puede sobrevivir metraje en ruso o resubidas de vídeos desaparecidos. No hay una vía de consulta abierta, ya que la API oficial requiere una aplicación registrada y una clave, así que se recurre a su búsqueda interna mediante un enlace directo. Actualmente está degradada: el sitio devuelve resultados vacíos a las conexiones automatizadas, por lo que la búsqueda debe hacerse manualmente en un navegador. bloqueo por IP
- Bilibili La mayor plataforma de vídeo de China, con cientos de millones de vídeos alojados. Para quien investiga archivos, su interés reside en ser un posible hogar de resubidas y de material en chino que no existe en ningún otro sitio. No hay una API en inglés accesible sin clave y la búsqueda desde fuera de China está condicionada por comprobaciones geográficas y captchas, así que se trata de un recurso al que hay que seguir el enlace: abrir el sitio y buscar allí. Vídeo, audio y música captcha
- Torrents-CSV Un buscador de torrents abierto construido sobre un conjunto de datos CSV mantenido por la comunidad, que indexa millones de torrents; además, todo el servicio puede autoalojarse. Expone una API JSON sencilla y sin clave, por lo que las búsquedas se ejecutan de forma automática y devuelven resultados limpios. Resulta útil para comprobar si un archivo o una publicación desaparecida de la web sigue circulando por BitTorrent. Solo facilita enlaces a torrents, así que conviene sopesar la legalidad de todo lo que se descargue. Torrents API
- Academic Torrents Una plataforma para distribuir conjuntos de datos de investigación y datos académicos por BitTorrent, con petabytes de material compartido legítimamente. Las colecciones se pueden buscar y explorar libremente, y las lecturas no requieren clave ni cuenta. Es el recurso al que acudir cuando resulta más fácil obtener un gran conjunto de datos público como torrent que desde un servidor institucional lento o frágil. Torrents API
- The Pirate Bay (apibay) El índice general de torrents más longevo, con un catálogo muy amplio de todo tipo de contenidos. La vía práctica de acceso es apibay.org, su backend de búsqueda JSON sin clave, ya que el sitio web principal está bloqueado por muchos proveedores de acceso. Quienes investigan lo emplean para comprobar si software, medios o documentos desaparecidos siguen circulando como torrents. Los resultados apuntan en gran medida a material protegido por derechos de autor: conviene tratarlos únicamente como enlaces. Torrents API
- Nyaa El índice de torrents de referencia para el anime y los medios de Asia Oriental. Su canal RSS hace las veces de API de consulta sencilla y sin clave, y los resultados enlazan con las páginas de los torrents. Es el lugar donde buscar fansubs antiguos, publicaciones descatalogadas y medios japoneses que nunca tuvieron edición occidental. Como en cualquier índice de torrents, conviene tratar los resultados como enlaces de legalidad variable. Torrents API
- SauceNAO La búsqueda inversa de imágenes de referencia para anime, manga y fan art, que indexa miles de millones de imágenes procedentes de fuentes como Pixiv y Danbooru. Se envía una imagen o la URL de una imagen e identifica de dónde procede la obra; existe una API JSON, pero requiere una clave gratuita previo registro. Resulta indispensable para rastrear una ilustración hasta su artista original o su primera publicación. Imágenes API · key
- VirusTotal La consulta canónica de archivos por hash: agrega veredictos antivirus y análisis en sandbox de miles de millones de archivos, URL y dominios. Se pega un hash o una URL en el sitio web para obtener un informe consolidado, o se usa su API JSON con una clave gratuita para las consultas automatizadas. Quienes investigan archivos recurren a él para identificar un archivo desconocido o comprobar si un hash coincide con malware conocido antes de manipularlo. Archivo por hash API · key
- MalwareBazaar (abuse.ch) Un repositorio gratuito de muestras de malware de abuse.ch, con millones de muestras consultables por hash, etiqueta o firma de malware. Las consultas se realizan a través de su API, que ahora exige una Auth-Key gratuita de abuse.ch (una sola clave cubre sus servicios relacionados). Se utiliza cuando se dispone del hash de un archivo sospechoso y se quiere saber si corresponde a una muestra catalogada, o cuando se necesita la propia muestra para analizarla. API · key
- URLhaus (abuse.ch) La base de datos de URL de distribución de malware de abuse.ch, con millones de enlaces maliciosos consultables por URL, host o hash del payload. Las consultas se realizan mediante una API sencilla que usa la misma Auth-Key gratuita de abuse.ch que sus otros servicios. Conviene consultarla para saber si una URL encontrada en una página archivada o en un conjunto de datos antiguo era conocida por distribuir malware. API · key
- ThreatFox (abuse.ch) Una plataforma abierta de intercambio de indicadores de compromiso de abuse.ch, que cataloga millones de IP, dominios, hashes y URL vinculados a familias de malware identificadas. Se consulta a través de su API con la Auth-Key gratuita de abuse.ch. Resulta útil para contextualizar un artefacto: se busca un hash o un dominio y se averigua con qué familia o campaña de malware se ha asociado. API · key
- Triage (tria.ge) Un sandbox automatizado de malware operado por Recorded Future, con un amplio corpus público de muestras analizadas. Los informes públicos se pueden consultar por hash de archivo, y el acceso a la API utiliza un token de una cuenta Researcher gratuita. Es un buen paso siguiente tras una consulta de hash en otro servicio, cuando se quiere ver qué hace realmente una muestra al ejecutarse. API · key
- MalShare Un repositorio público de malware gestionado por la comunidad, con millones de muestras, que ofrece búsqueda por hash y descarga de muestras. Su API, sencilla, exige clave pero es gratuita: el registro autogestionado concede 2.000 llamadas al día. Es una alternativa de menor barrera de entrada frente a los repositorios de acceso por invitación cuando hace falta comprobar u obtener una muestra por su hash. API · key
- Maltiverse Un agregador de inteligencia de amenazas para comprobar IP, dominios, URL y hashes de archivo contra un amplio conjunto común de IOC. Las consultas se realizan a través de su API JSON, con claves disponibles en un nivel gratuito. Sirve para enriquecer un artefacto de la investigación —por ejemplo, un hash o un dominio extraído de una página archivada— con lo que las fuentes de amenazas saben colectivamente sobre él. API · key
- Flickr Uno de los mayores archivos de fotografía compartida de la web, con miles de millones de fotos y un fondo profundo de fotografía histórica y comunitaria. La búsqueda funciona en el sitio web y existe una API REST madura para el acceso con clave. Merece la pena consultarlo cuando se buscan fotografías originales de lugares, eventos o comunidades de la web más antigua. Degradado para nuevas integraciones: las claves de API nuevas requieren ahora una suscripción de pago a Flickr Pro (las claves existentes siguen funcionando), así que conviene contar con la interfaz web. API · key
- Imgur Un gran servicio de alojamiento de imágenes que durante mucho tiempo funcionó como soporte gráfico por defecto de Reddit y de innumerables foros. Las subidas antiguas pueden recuperarse por identificador de imagen, en el sitio o mediante una API que necesita un Client-ID gratuito. Importa sobre todo para resolver enlaces de imgur encontrados en discusiones archivadas. Conviene saber que su valor archivístico cayó tras la purga de contenido anónimo de 2023: muchos identificadores antiguos ya no devuelven nada, así que verifique que el enlace sigue resolviéndose antes de confiar en él. API · key
- DeviantArt Una veterana comunidad artística en línea que aloja cientos de millones de obras. Se puede buscar y explorar libremente en el sitio, y una API basada en OAuth cubre la exploración y la búsqueda públicas para las aplicaciones registradas. Quienes investigan acuden aquí para rastrear la procedencia de una obra, recuperar la galería pública de un artista o datar una pieza de fan art. API · key
- Freesound Una base de datos colaborativa con más de 650.000 muestras y efectos de sonido con licencia Creative Commons. La búsqueda funciona en el sitio web y hay disponible una API JSON limpia con un token gratuito. Es la parada natural cuando se necesita un clip de sonido con licencia clara o se quiere rastrear el origen de una muestra muy reutilizada. API · key
- Yandex Images La búsqueda inversa de imágenes de Yandex, considerada la mejor de su categoría para rostros e imágenes visualmente similares, apoyada en un índice de miles de millones de imágenes. Se envía la URL de una imagen y las coincidencias se revisan en la interfaz web; no hay API oficial y el uso automatizado dispara captchas, así que funciona como enlace de traspaso. Es una parada habitual en OSINT cuando la búsqueda inversa de Google no da resultados, sobre todo con fotografías de personas. Imágenes captcha
- Google Images / Lens La mayor búsqueda inversa y visual de imágenes del mundo, a la que Lens añade el reconocimiento de objetos y de texto. Funciona solo en la web, no hay API pública, así que la imagen se sube o se pega la URL manualmente. Sigue siendo el primer movimiento por defecto para identificar el origen de una imagen, su contenido u otros lugares donde aparece en línea. Imágenes captcha
- TinEye El motor especializado más antiguo de búsqueda inversa de imágenes, con más de 70 mil millones de imágenes indexadas y especializado en copias exactas y editadas, incluida la aparición indexada más temprana de una imagen. La búsqueda web es gratuita de forma manual; la API es de pago, así que aquí no hay vía automatizada. Resulta especialmente valioso cuando hace falta datar una imagen o determinar dónde surgió por primera vez. Imágenes
- Bing Visual Search La búsqueda visual e inversa de imágenes de Microsoft. La interfaz web sigue funcionando para comparar una imagen con el índice de Bing, pero el uso es únicamente manual. Sirve como segunda opinión junto a Google y Yandex al hacer una búsqueda inversa de una imagen. Degradado: la API programática se retiró en agosto de 2025 junto con el resto de las API de Bing Search. Imágenes
- IQDB Una búsqueda inversa de imágenes combinada en los principales tablones de imágenes booru: Danbooru, Gelbooru, Zerochan y otros, que abarcan decenas de millones de imágenes de estilo anime etiquetadas. Se le proporciona una imagen o una URL y consulta todos los servicios a la vez; la salida es HTML simple, sin API. Es la forma más rápida de encontrar la fuente catalogada y etiquetada de una imagen de anime cuando SauceNAO deja dudas. Imágenes
- ascii2d Un motor japonés de búsqueda inversa de imágenes que compara por firmas de color y de características, especialmente potente con obras de Pixiv y Twitter. Funciona solo en la web, sin API. Merece la pena probarlo con fan art japonés cuando fallan los motores de búsqueda inversa convencionales. Su estado es incierto: resultó inaccesible desde nuestra infraestructura durante las pruebas y las conexiones desde fuera de Japón suelen estar bloqueadas, así que cabe esperar problemas de acceso. bloqueo por IP
- Karma Decay Una búsqueda inversa de imágenes circunscrita por completo a Reddit: se le da una imagen y muestra publicaciones anteriores de esa misma fotografía en todo el sitio. Es un sitio web simple, sin API. Resulta práctico para rastrear cuándo y dónde circuló por primera vez una imagen en Reddit. Actualmente degradado: el sitio agotó el tiempo de espera en nuestras comprobaciones y su actualidad es limitada desde que Reddit restringió el acceso a los datos, así que conviene considerarlo una posibilidad remota.
- PimEyes Un buscador de reconocimiento facial que cubre unos 3,5 mil millones de imágenes de rostros de la web abierta: se sube la foto de una cara y encuentra otras imágenes de la misma persona. Funciona únicamente a través del sitio web, y ver realmente los resultados exige una suscripción de pago; no hay API pública. Se utiliza en investigaciones de identificación de personas cuando la búsqueda inversa de imágenes corriente no distingue rostros con suficiente precisión. captcha
- Photobucket Un servicio veterano de alojamiento de imágenes con miles de millones de fotos de la web más antigua, cuando sostenía innumerables publicaciones de foros y blogs. No hay API y buena parte del archivo es difícil de alcanzar: las imágenes enlazadas de forma directa suelen mostrar marcadores de posición y los álbumes antiguos están tras un muro de pago. Aun así, en ocasiones es el único hogar superviviente de una imagen antigua de un foro, de modo que una comprobación manual puede dar frutos. Degradado: cabe esperar contenido roto o restringido con frecuencia.
- Pinterest Un servicio de descubrimiento visual con miles de millones de imágenes fijadas, que a menudo conservan copias de fotografías cuyas fuentes originales han desaparecido. No hay API pública de búsqueda de imágenes —la oficial está restringida por OAuth a aplicaciones empresariales aprobadas— y la navegación ocasional topa con muros de inicio de sesión, así que se usa mediante enlace directo. Resulta útil de vez en cuando para encontrar una copia superviviente de una imagen perdida en su sitio original. bloqueo por IP
- Google Arts & Culture El portal de Google a obras de arte y exposiciones culturales en alta resolución, que ofrece millones de piezas de más de 2.000 museos e instituciones. Todo funciona a través de la interfaz web; no hay API pública. Es útil para investigar obras, objetos o exposiciones, sobre todo cuando importa disponer de imágenes ampliables en alta resolución. Degradado solo en el sentido programático: sus herramientas para desarrolladores se retiraron, así que la vía es la exploración manual.
- Tube Archivarix Buscador propio de Archivarix para vídeos de YouTube eliminados y servicio hermano de este sitio. A partir del identificador de un vídeo, rastrea los servidores espejo en busca de copias resubidas y activas del vídeo eliminado, muestra sus metadatos archivados y admite la búsqueda por título en su índice de metadatos de YouTube. Al ser un servicio propio, está totalmente integrado aquí, sin necesidad de clave ni configuración. La primera parada cuando un enlace de YouTube está muerto y se buscan los datos del vídeo o una copia que haya sobrevivido. Vídeo, audio y música
- Filmot Un índice consultable de metadatos y subtítulos de YouTube que abarca cientos de millones de vídeos, incluidos algunos ya eliminados o marcados como privados. Se pueden buscar los metadatos de los vídeos e incluso las palabras pronunciadas en los subtítulos a través de la interfaz web gratuita; la API informal necesita una clave emitida por el operador. Su valor único está en sacar a la luz datos de vídeos de YouTube eliminados, que a menudo no sobreviven en ningún otro sitio. Degradado en la actualidad: las páginas de vídeo están tras una barrera de Cloudflare frente a las conexiones automatizadas, así que conviene contar con navegarlo manualmente. Vídeo, audio y música captcha
- Ghostarchive (video) Un archivador bajo demanda alimentado por los usuarios, destacable por preservar el vídeo de YouTube y de Twitter además de las páginas corrientes. No hay API de búsqueda: las páginas de archivo se abren directamente por identificador o se examina su sección de YouTube. Merece la pena consultarlo en cualquier búsqueda de vídeos eliminados, junto a Filmot y Wayback Machine, ya que a veces conserva una copia reproducible real y no solo metadatos. Vídeo, audio y música
- ANY.RUN Un sandbox de malware interactivo en línea cuyo canal público de informes deja libremente accesible un amplio corpus de análisis. Los informes públicos se buscan y se leen en el sitio web; la API está limitada a los planes de pago. Resulta útil cuando se quiere ver cómo se comporta un archivo sospechoso al ejecutarse, sin tener que ejecutarlo uno mismo.
- Hybrid Analysis El portal comunitario del Falcon Sandbox de CrowdStrike, con un amplio corpus público de análisis de malware que se puede buscar por hash de archivo. El sitio web está protegido por captcha, así que la vía viable es su API, con clave obtenida mediante una cuenta gratuita. Una parada sólida para comprobar si un hash ya se ha analizado y qué observó el sandbox. API · key captcha
- VirusShare Un repositorio solo por invitación con decenas de millones de muestras de malware, con consulta por hash y descarga de muestras para sus miembros. Entrar exige escribir por correo al operador para solicitar una cuenta; la API necesita igualmente la clave de miembro. Los investigadores recurren a él cuando necesitan la muestra real que hay detrás de un hash conocido y los repositorios abiertos no la tienen. captcha
- BTDigg (btdig.com) Un buscador de torrents que rastrea la propia DHT de BitTorrent, indexa cientos de millones de torrents y devuelve únicamente enlaces magnet. Es un sitio de HTML sencillo, sin API, promocionado sobre todo como servicio Tor. Bueno para encontrar contenido que se sigue compartiendo pero que no figura en ningún índice de torrents convencional. Degradado: su dirección en clearnet es inestable, por lo que cabe esperar una disponibilidad intermitente y, como siempre con los torrents, los resultados son solo enlaces. Torrents bloqueo por IP
- SolidTorrents Un buscador basado en la DHT sobre decenas de millones de torrents y sus metadatos. Funciona solo por web, sin API oficial, y su dominio cambia periódicamente. Otra alternativa para comprobar si algo sigue circulando por BitTorrent cuando los grandes índices no devuelven nada. Su estado es incierto: en nuestras comprobaciones solo respondió a través de proxy, y conviene verificar cuál es el dominio activo actual antes de confiar en él. Torrents bloqueo por IP
- Snowfl Una herramienta de metabúsqueda para torrents: en lugar de mantener un índice propio, consulta varios indexadores de torrents a la vez y agrega los resultados. No hay API, así que se utiliza directamente su interfaz web; desde aquí se ofrece únicamente como enlace saliente. Merece una parada cuando se quiere lanzar una sola consulta a varios índices de torrents en vez de revisar cada uno a mano, aunque bloquea algunos rangos de IP y el sitio depende en gran medida de JavaScript. bloqueo por IP
- TorrentGalaxy Un índice de torrents de propósito general con una comunidad asociada, que cubre un amplio catálogo de torrents. No tiene API oficial: la búsqueda se realiza en su propio sitio web, al que enlazamos en lugar de consultarlo. Quienes investigan archivos distribuidos por BitTorrent pueden usarlo como uno más de los índices que conviene revisar. Actualmente degradado: el sitio ha sufrido inestabilidad y presiones de bloqueo desde 2025, así que conviene verificar qué dominio está activo antes de confiar en él. bloqueo por IP
- 1337x Uno de los índices de torrents generalistas con más tráfico de la web, con un catálogo muy amplio. No existe API oficial, así que la búsqueda se hace en el propio sitio; aquí solo se ofrece un enlace saliente. Es una primera parada habitual cuando se busca un torrent de casi cualquier tipo de archivo, pero conviene saber que está bloqueado por los proveedores de acceso en muchas regiones, de modo que puede hacer falta un espejo o un proxy para llegar a él. Torrents bloqueo por IP
- Bitmagnet (self-host) A diferencia de las demás entradas sobre torrents, aquí se trata de software que se ejecuta uno mismo: un rastreador autoalojado que escucha la DHT de BitTorrent y construye un índice de torrents propio. Lo que contenga depende enteramente del rastreo propio: no hay sitio web público ni base de datos compartida que consultar. Una vez en marcha, expone una interfaz GraphQL y torznab locales en el equipo propio. Resulta interesante si se quiere una visión independiente y bajo control propio de lo que circula por la DHT, en lugar de depender de sitios de índice públicos.
- GH Archive Un registro continuo de la actividad pública en GitHub: la línea temporal pública de eventos se archiva cada hora desde 2011 y suma miles de millones de eventos. Es un conjunto de datos masivo, no un sitio de búsqueda: se descargan archivos JSON comprimidos con gzip por hora o se consulta el conjunto de datos público de BigQuery; no hay API de búsqueda por registro ni formulario de búsqueda web. Los investigadores recurren a él para analizar o reconstruir sin conexión la actividad histórica de GitHub.
- Sourcegraph (public code search) Búsqueda de código en millones de repositorios públicos, que permite localizar dónde aparece un fragmento, un identificador o una cadena en cualquier punto del código abierto. La búsqueda se realiza a través de la interfaz web; un punto de acceso GraphQL también responde a consultas públicas sin token. Útil siempre que una pregunta abarque muchos repositorios de código a la vez y no un único proyecto. El futuro del nivel público gratuito es incierto tras el giro de la empresa hacia el código cerrado, así que conviene tratarlo como una comodidad sujeta a cambios.
- ccMixter Un sitio comunitario de música, remezclas, samples y a cappellas con licencia Creative Commons, del orden de decenas de miles de pistas CC. La búsqueda y la navegación se hacen en el propio sitio; existe una API de consulta heredada, pero falló en nuestras comprobaciones. Es el lugar donde buscar pistas y remezclas musicales reutilizables con licencia abierta. Su estado es incierto por ahora: el sitio resultó inaccesible en sondeos repetidos y puede estar caído, así que conviene volver a comprobarlo si no carga.
- GifCities (GeoCities GIFs) Un buscador dedicado a los GIF animados rescatados de GeoCities, reconstruido en 2025 con búsqueda semántica. Se escribe un término y devuelve los GIF coincidentes del corpus rescatado; su punto de acceso de búsqueda abierto permite además que este sitio lo consulte directamente. Útil para investigar la estética web de los años noventa o para dar con una imagen concreta de la web primitiva. Imágenes API
- OoCities Un espejo y resurrección de páginas de GeoCities guardadas antes del cierre del servicio, navegable por las rutas de vecindario originales. No hay API: se navega o se usa el formulario de búsqueda del propio sitio, al que enlazamos. Útil cuando se quiere volver a ver una página personal concreta de GeoCities o recorrer la antigua estructura de vecindarios tal como era.
- GeoCities.ws Otro espejo de GeoCities, combinado con alojamiento gratuito de estilo retro, de modo que las páginas archivadas conviven con otras recién alojadas. No tiene API: se usan la navegación y el formulario de búsqueda del sitio a través del enlace facilitado. Práctico como segundo lugar donde mirar cuando una página de GeoCities falta en otros espejos. Actualmente degradado, y puede presentar un CAPTCHA antes de dar acceso. captcha
- ReoCities Uno de los espejos de rescate originales creados cuando GeoCities cerró en 2009, que preserva las páginas guardadas durante aquella labor. La navegación y la búsqueda se realizan en el propio sitio; no hay API, así que enlazamos a su formulario de búsqueda. Al ser uno de los varios proyectos de rescate independientes, puede conservar páginas que los demás espejos pasaron por alto, lo que hace que merezca la pena consultarlo cuando una página no aparece en ningún otro lugar.
- IA GeoCities Collection El rastreo específico de GeoCities de Internet Archive, el mismo corpus que alimenta GifCities. Se accede a él a través del índice CDX de Wayback Machine acotado a geocities.com, de modo que este sitio puede consultarlo directamente y devolver listas de capturas con sus marcas de tiempo. Es la forma más sistemática de encontrar copias archivadas de una URL concreta de GeoCities, aunque las consultas pueden ser lentas. API
- Cameron's World No es una herramienta de búsqueda, sino una obra de arte web: un collage interactivo curado a partir de gráficos y GIF de GeoCities. Basta con visitarlo y desplazarse; no hay API ni función de búsqueda, por lo que figura como enlace. Merece una visita para captar la cultura visual de la era GeoCities, o como punto de partida para explorar el aspecto que tenía la web amateur de los años noventa.
- ProtoWeb Un servicio para la informática retro: un proxy HTTP que sirve sitios web restaurados de los años noventa a navegadores antiguos de aquella época. Se apunta un navegador o emulador antiguo al proxy y se navega por la web primitiva desde su caché de sitios restaurados; no hay API y solo enlazamos a él. De interés cuando se quiere experimentar los sitios antiguos con el software de su tiempo. Actualmente degradado y puede mostrar un CAPTCHA. captcha
- oldweb.today Permite abrir páginas web archivadas dentro de navegadores antiguos emulados, todo ello ejecutándose en el navegador moderno, con contenido procedente de Wayback y de otros archivos Memento. El uso es enteramente interactivo en el sitio: se elige un navegador y una fecha y se introduce una URL; no hay API. Los investigadores recurren a él cuando cómo se representaba una página importa tanto como lo que decía.
- Marginalia Search Un buscador independiente con rastreador propio, centrado en la web pequeña, antigua, textual y no comercial. Se puede buscar en su sitio, y su API pública abierta permite que este sitio lo consulte directamente. Resulta útil para buscar páginas personales, sitios de aficionados y textos extensos de los rincones más silenciosos de la web que los buscadores convencionales tienden a sepultar. Texto completo de la web API
- Wiby Un buscador dedicado a las páginas de aficionados y de la web primitiva, con un botón «surprise me» que sirve una página antigua al azar. La búsqueda se hace en el propio sitio o a través de su sencillo punto de acceso de búsqueda JSON, que este sitio puede consultar directamente. Bueno para el descubrimiento fortuito de la web clásica y para encontrar pequeñas páginas hechas a mano sobre un tema. Texto completo de la web API
- Mojeek Un buscador británico independiente que opera su propio rastreador en lugar de revender resultados de Bing o Google. La búsqueda se realiza a través de su interfaz web habitual; existe una API comercial de pago, pero aquí no se utiliza, así que enlazamos al sitio. Útil cuando se quiere un índice que no se limite a reflejar la visión de la web de los grandes buscadores.
- Stract Un buscador de código abierto, financiado por NLnet, diseñado para ser personalizable y autoalojable. La búsqueda se realiza en su sitio web; su API pública no está documentada, así que enlazamos al formulario de búsqueda en lugar de consultarlo. Una opción cuando se quiere un índice independiente y transparente, o una instancia propia.
- Million Short Un buscador con un giro particular: elimina deliberadamente de los resultados los sitios más populares para que puedan aflorar páginas poco conocidas. Se utiliza directamente su formulario de búsqueda web; no hay API. Resulta útil para escarbar más allá de los dominios dominantes de siempre al investigar un tema. Actualmente degradado, y puede aparecer un CAPTCHA. captcha
- Teclis Un índice de búsqueda no comercial dedicado a la «web creativa» de sitios pequeños e independientes, que hoy funciona como índice interno de Kagi. La búsqueda se realiza en su propio sitio; el acceso programático solo existe mediante la API de pago de Kagi, por lo que aquí se ofrece como enlace en lugar de consultarse. Resulta útil cuando los buscadores mayoritarios sepultan los sitios pequeños que realmente le interesan.
- Google Groups Usenet El archivo de Google de los grupos de noticias de Usenet, construido sobre la colección DejaNews, con debates que se remontan a 1981. Está congelado y en modo de solo lectura desde 2024 y no dispone de API: la búsqueda y la lectura se hacen en la interfaz web de Google Groups con la que enlazamos. Sigue siendo uno de los lugares más profundos para encontrar hilos de grupos de noticias de hace décadas y debates históricos en línea. Textos especializados
- Usenet Archives Un archivo web independiente y gratuito que conserva cientos de millones de mensajes históricos de Usenet. La búsqueda y la lectura se realizan en el propio sitio; no hay API, por lo que aquí se presenta como enlace. Una alternativa o un complemento útil a Google Groups para rastrear debates antiguos en grupos de noticias.
- Narkive Un archivo web de Usenet de larga trayectoria que permite buscar y leer mensajes históricos de los grupos de noticias. No hay API: se utiliza el formulario de búsqueda del sitio, con el que enlazamos. Conviene revisarlo junto a los demás archivos de Usenet, ya que cada uno cubre y muestra el material de forma algo distinta.
- textfiles.com El archivo curado por Jason Scott de la era de las BBS: archivos de texto, fanzines, documentos de phreaking y listas de BBS del mundo en línea anterior a la web. Es un sitio sencillo y navegable, sin API: se explora directamente a través del enlace facilitado. Una referencia fundamental para investigar la cultura BBS y los primeros textos en línea.
- DiscMaster (files inside old discs) Una herramienta excepcional que busca dentro de los archivos: búsqueda de texto completo y a nivel de fichero en millones de archivos antiguos contenidos en viejas imágenes de disco almacenadas en archive.org. Dispone de un endpoint de búsqueda operativo, de modo que este sitio puede consultarlo directamente además de enlazarle con él. Recurra a él cuando busque un programa shareware, un documento o una imagen concretos que se distribuyeron en CD o disquete, contenido invisible para la búsqueda web habitual. Textos especializados API
- MobyGames Un catálogo exhaustivo de la historia del videojuego que cubre títulos de todas las plataformas. La búsqueda se realiza en el sitio web; existe una API, pero requiere clave. Es la referencia habitual cuando se necesita el registro catalogado de un juego concreto. Actualmente degradado: el sitio puede interponer un CAPTCHA. captcha
- IA MS-DOS / Software Library La biblioteca de Internet Archive de juegos de MS-DOS y software histórico, ejecutable en el navegador mediante emulación. Se puede consultar a través de la interfaz advancedsearch de IA, que este sitio interroga directamente, y los elementos se ejecutan en su propio navegador desde archive.org. La vía más rápida para encontrar y ejecutar realmente una pieza de software antiguo sin instalar nada. Software y paquetes API
- My Abandonware Una gran base de datos de abandonware: juegos de los años ochenta y noventa para DOS, Windows, Amiga y consolas, con descargas junto a las fichas de catálogo. No hay API: la búsqueda y la navegación se hacen en el propio sitio a través del enlace facilitado. Una parada práctica cuando se necesita identificar u obtener un juego antiguo que ya no está a la venta. Software y paquetes
- Europeana El agregador del patrimonio cultural europeo, que reúne más de 50 millones de objetos digitalizados de galerías, bibliotecas, archivos y museos de Europa. La búsqueda se realiza en su sitio web; también hay una API disponible con clave gratuita. La primera parada natural cuando se busca material cultural europeo digitalizado en muchas instituciones a la vez.
- DPLA La Digital Public Library of America agrega en un único índice consultable los objetos digitalizados de bibliotecas, archivos y museos de todo Estados Unidos. La búsqueda se realiza en su sitio web; también hay una API con clave gratuita. Recurra a ella cuando busque material histórico estadounidense sin saber qué institución lo custodia.
- Smithsonian Open Access Registros en acceso abierto de todos los museos del Smithsonian, que combinan metadatos de colección con material CC0 reutilizable libremente. La búsqueda se realiza en el sitio del Smithsonian; existe una API, con claves gestionadas a través de api.data.gov. Muy valiosa para encontrar imágenes y fichas de objetos de museo reutilizables en un solo lugar. Actualmente degradado: cabe esperar interrupciones por CAPTCHA. captcha
- Met Museum API Los registros completos de la colección del Metropolitan Museum of Art, con metadatos de los objetos e imágenes en acceso abierto. Ofrece una API pública sin clave, de modo que los datos de la colección pueden consultarse directamente desde este sitio sin necesidad de cuenta. Útil para la investigación histórico-artística o para obtener imágenes de objetos de museo con licencia abierta. Las sondas lo califican actualmente como degradado, por lo que las respuestas pueden ser irregulares. Patrimonio cultural API
- Rijksmuseum API La colección en línea del museo nacional neerlandés, con metadatos de los objetos e imágenes en alta resolución. La colección se consulta en el sitio web del museo; también hay una API disponible con clave gratuita. Una fuente primaria para investigar el arte y la historia de los Países Bajos o para obtener imágenes de gran calidad de los objetos del museo.
- Chronicling America (LoC) La colección de la Library of Congress de páginas de periódicos históricos de EE. UU., desde el siglo XVIII hasta los años sesenta, con texto completo por OCR que hace consultables las propias páginas. La búsqueda se realiza en el sitio loc.gov, que además puede devolver JSON sin clave. Indispensable para localizar la cobertura periodística de la época, así como nombres y acontecimientos, en la prensa estadounidense. Tenga en cuenta que la antigua dirección chroniclingamerica.loc.gov está obsoleta: utilice loc.gov. API
- crt.sh (Cert Transparency) Una ventana consultable a los registros de Certificate Transparency, el registro público de los certificados TLS, lo que la convierte en una vía para descubrir certificados históricos y subdominios de un dominio. La consulta se hace en el sitio web, y esa misma consulta puede devolver JSON sin clave. Los investigadores la utilizan para reconstruir el historial de infraestructura de un dominio. Se sobrecarga con frecuencia y devuelve errores bajo carga, así que conviene reintentar si una consulta falla. Páginas y sitios web
- Censys Search Un índice de escaneo de hosts y certificados de toda Internet, con un papel similar al de Shodan. La búsqueda se realiza a través de su interfaz web; existe una API con nivel gratuito, pero requiere clave, por lo que aquí se ofrece como enlace en lugar de consultarse. Relevante para investigar qué expone un host o un dominio a Internet y cuál es su huella de certificados. Actualmente degradado: el sitio puede interponer un CAPTCHA. captcha
- Shodan Un buscador de dispositivos y servicios conectados a Internet que además conserva los banners históricos de los servicios. La consulta se hace a través de su propia interfaz web, con la que enlazamos; existe una API oficial, pero requiere clave y es de pago en su mayor parte. Los investigadores recurren a él para rastrear qué servicios o software ha expuesto un host a lo largo del tiempo, dentro del trabajo sobre el historial de dominios e infraestructuras.
- Intelligence X Intelligence X es un servicio de búsqueda OSINT que cubre pastes, contenido de la darkweb, filtraciones de datos y registros whois, con una «máquina del tiempo» para el material posteriormente eliminado. Se utiliza en su propio sitio web a través de nuestro enlace; su API necesita clave y los datos más profundos están tras planes de pago. Merece una visita cuando se persiguen pastes borrados o material filtrado que los archivos web habituales nunca llegaron a capturar.
- Have I Been Pwned (pwned passwords) Un índice de cuentas y credenciales aparecidas en brechas de datos conocidas. El endpoint de rangos de Pwned-Passwords no requiere clave, por lo que nuestra búsqueda puede consultarlo directamente, mientras que la API más completa de consulta de brechas es de pago y las comprobaciones de cuentas individuales se hacen en el propio sitio web. Úselo para confirmar si una credencial ha aparecido en una filtración. El servicio figura como degradado en nuestras últimas comprobaciones, por lo que el acceso al sitio web puede resultar irregular. API
- Ahmia (Tor index) Un buscador de la clearnet que indexa los servicios ocultos .onion de Tor, con resultados filtrados frente a contenidos abusivos. No hay API: las consultas se lanzan en su propio formulario de búsqueda, con el que enlazamos. Es la vía práctica para descubrir contenido de sitios onion desde la web convencional, lo que lo convierte en un punto de partida para la investigación en torno a la darkweb.
- APKMirror Un archivo de versiones históricas de APK de Android que aloja paquetes firmados y verificados. No hay API, así que la navegación y la búsqueda se hacen en el propio sitio a través del enlace que facilitamos. Recurra a él cuando necesite una versión antigua de una aplicación Android que las tiendas actuales ya no ofrecen. Software y paquetes
- F-Droid El repositorio de aplicaciones Android libres y de código abierto, que conserva un archivo completo de versiones y compila los paquetes de forma reproducible. Su índice de paquetes se publica como JSON sin clave, así que nuestra búsqueda puede consultarlo directamente además de enlazarle con el sitio. El lugar donde buscar versiones actuales e históricas de aplicaciones Android FOSS. Software y paquetes API
- PyPI El índice de paquetes de la comunidad Python, que conserva todas las versiones publicadas de cada paquete junto con metadatos estructurados. Se puede buscar en el sitio web, y su API JSON sin clave permite a nuestra búsqueda obtener los detalles de los paquetes directamente. Útil para la arqueología del software: recuperar una versión antigua de una biblioteca o consultar el historial de versiones de un paquete. Software y paquetes API
- npm registry El registro de paquetes que sustenta el ecosistema de Node.js, con el historial completo de versiones y tarballs descargables de cada paquete. La API de registro subyacente no requiere clave y nuestra búsqueda la consulta directamente. Recurra a él para rastrear el historial de publicaciones de un paquete de JavaScript o para obtener una versión antigua. Tenga en cuenta que el propio sitio npmjs.com somete actualmente a verificación el tráfico procedente de redes de centros de datos, por lo que los enlaces directos a las páginas de paquetes pueden mostrar antes un paso de verificación. Software y paquetes API captcha
- OldMapsOnline Un portal para descubrir mapas históricos georreferenciados custodiados por instituciones de todo el mundo, que le remite a la colección depositaria de cada mapa. Ofrece una API de búsqueda geográfica (por marco delimitador) y endpoints IIIF, pero aquí lo presentamos como un enlace a su propio formulario de búsqueda. Actualmente marcado como degradado: el sitio puede mostrar un CAPTCHA antes de darle acceso. Patrimonio cultural captcha
- David Rumsey Maps Una de las colecciones digitalizadas de mapas históricos más destacadas, que ofrece escaneos en alta resolución, muchos de ellos georreferenciados, en la plataforma Luna. Existen APIs parciales de Luna y IIIF, pero la vía práctica es la propia interfaz de búsqueda del sitio, con la que enlazamos. Una primera parada cuando se necesita un escaneo de calidad de un mapa antiguo.
- OSM / Overpass OpenStreetMap es el mapa del mundo editado de forma colaborativa; la API de Overpass ofrece consultas estructuradas de solo lectura sobre sus datos, y los volcados del historial completo conservan los estados pasados del mapa. Overpass no requiere clave (con límites de uso razonable) y nuestra búsqueda puede consultarla directamente. Resulta útil cuando se necesita saber qué elementos cartografiados existen en un lugar o profundizar en el historial de ediciones del mapa. API
- GDELT Un proyecto de monitorización de noticias a escala mundial que hace seguimiento de acontecimientos y tono en los medios de todo el mundo, incluidos los informativos de televisión. Su API de documentos no requiere clave, así que nuestra búsqueda la consulta directamente además de enlazar al sitio del proyecto. Sirve para encontrar la cobertura informativa de un acontecimiento en muchos países y medios a la vez. API
- IA TV News Archive La colección TV News de Internet Archive hace consultables los informativos de televisión estadounidenses e internacionales desde 2009 a través del texto de los subtítulos ocultos. Se consulta mediante la API de búsqueda sin clave de Internet Archive, que nuestro sitio utiliza directamente. Resulta valiosísima cuando hay que establecer cuándo y dónde se dijo algo en televisión. Vídeo, audio y música API
- Radio Garden Un globo terráqueo interactivo para sintonizar miles de emisoras de radio en directo de todo el mundo. Existe una API no oficial sin clave que nuestra búsqueda puede consultar, además de enlazar a la propia interfaz del globo. Es más una herramienta de escucha en directo que un archivo, pero resulta práctica para localizar emisoras por lugar. API
- IA Live Music (etree) La colección de música en directo de Internet Archive (etree) reúne grabaciones legales de conciertos realizadas por aficionados. Es consultable a través de la API de búsqueda sin clave del Archive, de modo que los resultados aparecen directamente en nuestra búsqueda además de en archive.org. El sitio al que acudir para buscar grabaciones de conciertos pasados de un grupo. Vídeo, audio y música API
- Zenodo El repositorio de propósito general del CERN para datos de investigación y software, donde cada depósito recibe un DOI. Dispone de una API de lectura sin clave, pero el servicio bloqueó nuestras direcciones de sondeo, así que por ahora enlazamos a su propia búsqueda en lugar de consultarla. Conviene recurrir a él para buscar conjuntos de datos, versiones de software o materiales complementarios asociados a investigaciones publicadas. Su estado es incierto únicamente desde nuestro punto de observación; consta que funciona con normalidad en otros contextos, así que el enlace debería funcionarle. Conjuntos de datos
- Figshare Un repositorio donde los investigadores depositan conjuntos de datos, figuras, pósteres y otros resultados complementarios. Su API de lectura no requiere clave y nuestra búsqueda la consulta directamente, aunque también se puede explorar en el sitio. Útil cuando los datos que sustentan un artículo se publicaron por separado. Conjuntos de datos API
- Harvard Dataverse La instancia de Harvard de la plataforma Dataverse, un gran repositorio de datos de investigación. La API de búsqueda no requiere clave y nuestra búsqueda la consulta directamente; el sitio web ofrece la misma búsqueda para explorar. Una parada obligada cuando se buscan conjuntos de datos académicos. Conjuntos de datos API
- OSF The Open Science Framework es una plataforma de colaboración en investigación que aloja materiales de proyectos, datos y un registro de preprints. Su API de lectura no requiere clave, lo que permite que nuestra búsqueda la consulte directamente. Útil para encontrar preprints y materiales de proyectos de investigación que nunca llegaron a publicarse en revistas. Conjuntos de datos API
- Hugging Face Datasets El mayor repositorio de conjuntos de datos de aprendizaje automático (y de modelos), cada uno con metadatos abundantes. Una API sin clave sirve los resultados de búsqueda, que nuestro sitio consulta directamente, y todo se puede explorar en la web. El sitio al que acudir por defecto cuando se necesita un conjunto de datos de ML publicado o su documentación. Conjuntos de datos API
- Archive of Our Own Archive of Our Own, gestionado por la Organization for Transformative Works, es el mayor archivo de fanfiction. No dispone de API oficial por decisión expresa, así que enlazamos a su propia interfaz de búsqueda y filtrado. Imprescindible para cualquier investigación sobre obras de fans. Actualmente marcado como degradado: es previsible que aparezca un paso de verificación del navegador antes de que cargue el sitio. Textos especializados captcha
- FanFiction.Net Un sitio veterano de fanfiction cuyos fondos proceden de la época anterior a AO3. No tiene API y está tras Cloudflare, así que se presenta como un enlace a su formulario de búsqueda. Merece la pena consultarlo para obras de fans antiguas de aquel primer periodo. Marcado como degradado: puede que haya que superar una verificación para entrar. captcha
- Fanlore Una wiki gestionada por la Organization for Transformative Works que documenta la historia, los fandoms y la terminología de la cultura fan. Al ser un sitio MediaWiki dispone de la API estándar sin clave, pero por ahora la mostramos como un enlace a su propia búsqueda. Es la obra de referencia para entender el contexto de los fandoms en torno a las obras de fans archivadas. Marcada como degradada: el sitio puede someter el navegador a una verificación antes de cargar. captcha
- WikiTeam dumps Volcados conservados de más de 600.000 wikis, entre ellos comunidades de Fandom/Wikia y sitios MediaWiki de nicho, almacenados en Internet Archive. La colección es consultable a través de la API de búsqueda sin clave del Archive, que nuestro sitio utiliza directamente. El lugar al que acudir cuando una wiki ha desaparecido y se necesita recuperar su contenido. Textos especializados API
- Discogs Una base de datos colaborativa de lanzamientos y prensajes físicos, combinada con un mercado de compraventa. Su API de búsqueda exige un token, así que la mostramos como un enlace a la búsqueda del propio sitio. La referencia estándar para discografías y para identificar un prensaje concreto de un lanzamiento. Marcado como degradado: puede interponerse un CAPTCHA entre usted y el sitio. captcha
- MusicBrainz Una enciclopedia musical abierta que asigna identificadores canónicos (MBID) a artistas y lanzamientos. Su API de servicio web no requiere clave, está limitada a una petición por segundo y nuestra búsqueda la consulta directamente. La fuente de referencia para obtener metadatos musicales limpios y estructurados. Vídeo, audio y música API
- Genius Una base de datos de letras de canciones acompañadas de anotaciones. Su API de búsqueda necesita un token OAuth, así que enlazamos a la búsqueda del propio sitio en lugar de consultarla. Útil para fijar con exactitud una letra y el contexto anotado que la rodea.
- CourtListener / RECAP Un archivo gratuito de jurisprudencia estadounidense, documentos judiciales obtenidos de PACER mediante el proyecto RECAP y audio de vistas orales. Su API REST de búsqueda funciona sin clave (un token eleva los límites de peticiones) y nuestra búsqueda la consulta directamente. La primera parada para localizar expedientes judiciales estadounidenses sin coste alguno. Patrimonio cultural API
- PatentsView (USPTO) Un servicio de datos de patentes de la USPTO cuyo rasgo distintivo son los registros desambiguados de inventores y titulares. La API de búsqueda exige una clave gratuita y consultas estructuradas, así que por ahora enlazamos a su interfaz de búsqueda en lugar de consultarla directamente. Útil cuando se quiere seguir las patentes de un inventor o una empresa concretos, y no solo cotejar documentos por palabra clave.
- Google Patents Búsqueda a texto completo de patentes de oficinas de todo el mundo, además de literatura ajena a las patentes. No hay API oficial (los datos están disponibles por separado como conjunto de datos público en BigQuery), así que la búsqueda se realiza en el propio sitio a través de nuestro enlace. Una de las interfaces únicas más cómodas para consultas de patentes a escala mundial. Artículos académicos
- Espacenet / EPO OPS La búsqueda mundial de patentes de la Oficina Europea de Patentes, acompañada de la API REST Open Patent Services. La API exige una clave OAuth (existe un nivel gratuito), así que por ahora enlazamos a la interfaz de búsqueda de Espacenet. Sirve para buscar en la base de datos mundial de patentes de la EPO. Marcada como degradada: el sitio puede presentar una verificación antes de cargar. captcha
- FamilySearch El mayor archivo gratuito de registros genealógicos del mundo, gestionado por la Iglesia SUD. Su API REST exige una clave aprobada además de inicio de sesión, así que enlazamos a la búsqueda de registros del propio sitio. El punto de partida gratuito por defecto para la investigación genealógica.
- pouet.net (demoscene) La base de datos canónica de la demoscene, que documenta producciones, parties y grupos desde los años noventa. Sus datos se publican como volcados JSON periódicos (data.pouet.net) de los que puede servirse nuestra búsqueda, junto a la navegación y la búsqueda del propio sitio. La fuente de referencia para investigar lanzamientos de la demoscene o la historia de los grupos. API
- 16colo.rs (ANSI/ASCII art) Un archivo de artpacks ANSI y ASCII de la artscene de las BBS, con material que se remonta a principios de los años noventa. Se anuncia una API sin clave, pero nuestro sondeo de la misma falló, así que enlazamos a la navegación y la búsqueda del propio sitio. La sede principal del arte conservado de la era de las BBS; conviene recurrir a él para investigar la artscene o localizar un artpack concreto.
- ASCII Art Archive Una amplia biblioteca categorizada de arte ASCII clásico de una sola imagen. No tiene API; la navegación por las categorías se hace en el propio sitio a través de nuestro enlace. Práctica cuando se buscan ejemplos de arte ASCII tradicional organizados por tema.
- CyberLeninka (КиберЛенинка) La mayor biblioteca científica de acceso abierto en lengua rusa: artículos de revista a texto completo de todas las disciplinas, de lectura gratuita y sin registro. Las búsquedas por título, autor o tema se hacen en la interfaz web; como no existe una API pública oficial, este sitio se ofrece como enlace de búsqueda. La primera parada para artículos en ruso que los índices occidentales (Crossref, OpenAlex) suelen pasar por alto. Artículos académicos
- НЭБ. National Electronic Library (rusneb.ru) La Biblioteca Electrónica Nacional de Rusia agrega libros, publicaciones periódicas y tesis digitalizados de la Biblioteca Estatal Rusa y de instituciones asociadas. Las digitalizaciones de dominio público se pueden leer directamente en el visor web; las obras con derechos vigentes están restringidas a las salas de lectura. La colección se consulta en el sitio web; resulta útil para material impreso ruso prerrevolucionario y de la época soviética que no existe en ningún otro lugar en línea. El sitio no era accesible durante nuestra última comprobación, así que la disponibilidad puede variar.
- End of Term Web Archive Un proyecto conjunto de Internet Archive, la Library of Congress y varias universidades asociadas que rastrea los sitios web del gobierno federal estadounidense en cada transición presidencial. Preserva los contenidos .gov y .mil que desaparecen de forma habitual cuando cambia la administración: páginas, informes y conjuntos de datos borrados de los sitios en producción. El portal del proyecto permite acceder a los rastreos de cada mandato, que se reproducen a través de las instancias wayback de las instituciones asociadas. Conviene recurrir a él cuando una página gubernamental desapareció en torno a unas elecciones.