Archivarix

Guia

O Archivarix Echo busca em mais de 200 arquivos da web ao mesmo tempo. Em vez de abrir o Wayback Machine, depois o archive.today, depois uma dúzia de arquivos acadêmicos e de livros um por um, você cola uma única coisa no Echo e ele descobre onde procurar. Este guia explica o que você pode pesquisar, como funciona uma busca e como ler seus resultados.

A página inicial do Archivarix Echo: um único campo de busca que aceita uma URL, DOI, ISBN, identificador de rede social, hash de arquivo ou título

O que você pode pesquisar

Este é o coração do Echo. Você não escolhe um arquivo nem uma categoria — você cola uma coisa, e o Echo reconhece o que ela é e a direciona para cada arquivo criado para responder àquele tipo de entrada. Você nunca precisa saber qual dos mais de 200 arquivos pode tê-la; esse é exatamente o trabalho que o Echo faz por você. Abaixo está tudo o que o Echo entende, com exemplos.

Cole um identificador exato

O Echo reconhece esses formatos de entrada de imediato. Quanto mais específica for sua entrada, com mais precisão ele direciona — mas você nunca precisa rotulá-la, basta colar.

  • A URL de uma página da webhttps://www.spacejam.com/ Encontra snapshots salvos dessa página nos grandes arquivos da web: o Wayback Machine (mais de 1 trilhão de páginas), o archive.today, o Common Crawl, o Perma.cc, o Ghostarchive, o Software Heritage e arquivos nacionais da web (o UK Government Web Archive, o Arquivo.pt de Portugal, o Vefsafn da Islândia, o Trove da Austrália, a Library of Congress). Você vê a página como ela era em diferentes momentos no tempo — mesmo que tenha desaparecido hoje.

  • Um site ou domínio inteironokia.com Cole um domínio puro para extrair todas as páginas capturadas de um site, não apenas um endereço. O Echo adiciona uma visualização de "listar todos os arquivos capturados" nos arquivos da web e direciona o domínio para o crt.sh (Certificate Transparency) para revelar subdomínios e o histórico do certificado SSL do site — uma forma de mapear um site que não existe mais.

  • Um vídeo do YouTubehttps://youtu.be/dQw4w9WgXcQ — ou apenas o id dQw4w9WgXcQ Recupera metadados, legendas e miniaturas de vídeos excluídos ou removidos através do Tube Archivarix e do Filmot (busca de legendas em centenas de milhões de vídeos), além de cópias arquivadas da página de exibição no Wayback Machine, no archive.today, no Common Crawl e no Ghostarchive. A miniatura também é enviada à busca reversa de imagens para procurar reuploads.

  • Uma imagem, para busca reversa — um link direto de imagem como https://upload.wikimedia.org/wikipedia/commons/7/78/The_Blue_Marble.jpg O Echo identifica URLs de imagem (.jpg, .png, .gif, .webp, .avif…) e as envia aos motores de busca reversa de imagens: Yandex Images (índice de bilhões), Google Lens, Bing Visual Search, TinEye (mais de 70 bilhões de imagens), além de SauceNAO e IQDB para artes. Encontre onde mais uma imagem aparece, um original em resolução mais alta ou sua verdadeira origem.

  • Um DOI10.1145/3292500.3330701 Resolve um artigo no grafo acadêmico — Crossref (mais de 165M de DOIs), DataCite, OpenAlex (480M de trabalhos), Semantic Scholar, Europe PMC, IA Scholar — e procura o texto completo de acesso aberto através do Anna's Archive e do Sci-Hub.

  • Um ISBN9780451524935 Encontra um livro na Open Library (mais de 40M de edições), no HathiTrust (mais de 18M de volumes), no Google Books e nas bibliotecas paralelas Anna's Archive e Library Genesis — registros de catálogo, digitalizações e texto completo.

  • Um identificador de rede social@nasa Extrai perfis e publicações arquivados: perfis do Twitter/X e tweets individuais via Wayback Machine e archive.today, prévias de canais do Telegram, páginas arquivadas do Facebook e o histórico de usuários do Reddit através do Pullpush e do Arctic Shift.

  • O hash de conteúdo de um arquivo44d88612fea8a8f36de82e1278abb02f (md5, sha1 ou sha256) Consulta um arquivo pela sua impressão digital de conteúdo no VirusTotal — inteligência de arquivos e ameaças para um arquivo que você consegue identificar, mas não nomear.

Ou simplesmente descreva em palavras

Sem identificador? Digite um título, um nome ou algumas palavras-chave e o Echo distribui a consulta para todos os arquivos pesquisáveis por texto de uma só vez — mais de 75 deles — e então ordena os resultados pela aparência das suas palavras. É aqui que toda a amplitude do catálogo se abre:

  • Livros e ebooksFrankenstein → Open Library, Project Gutenberg, Standard Ebooks, HathiTrust, Internet Archive Texts, Wikisource, DOAB, além de Anna's Archive e Library Genesis.
  • Vídeosapollo 11 landing → Tube Archivarix e Filmot para YouTube excluído, além de Dailymotion, RuTube, Odysee, Rumble, BitChute, Bilibili, VK Video, OK.ru e Internet Archive Video.
  • Música e gravações ao vivoGrateful Dead 1977 → MusicBrainz e o Live Music Archive (etree) do Internet Archive, com gravações de tapers, além do IA Audio.
  • Notícias de TV e rádio — legendas de transmissões no TV News Archive do Internet Archive.
  • Artigos, preprints e patentesattention is all you need → arXiv, PubMed, bioRxiv, medRxiv, DOAJ, DBLP, OpenAIRE, CyberLeninka, Semantic Scholar e Google Patents.
  • Software, aplicativos e abandonwarereact (npm), requests (PyPI), além de F-Droid, APKMirror, Software Heritage (mais de 20B de arquivos de código-fonte), Sourcegraph, MyAbandonware e os jogos de MS-DOS jogáveis do Internet Archive.
  • Torrents — The Pirate Bay, Nyaa, 1337x, Torrents-CSV, SolidTorrents, BTDigg e Academic Torrents (petabytes de dados de pesquisa).
  • Conjuntos de dados de pesquisa — Harvard Dataverse, Figshare, Zenodo, OSF e Hugging Face Datasets.
  • Imagens e mídias de licença livre — Wikimedia Commons (mais de 110M de arquivos), Openverse e GifCities para GIFs animados da era GeoCities.
  • Fóruns, Usenet, imageboards e fanfiction — Google Groups (histórico da Usenet), Desuarchive e 4plebs (arquivos do 4chan) e Archive of Our Own.
  • A web antiga e pequena — Wiby e Marginalia, motores de busca para a web indie e pré-corporativa.
  • Patrimônio cultural — a coleção de arte aberta do Met, OldMapsOnline para mapas históricos e CourtListener para jurisprudência dos EUA.
  • Arquivos de discos antigos e wikis mortas — o DiscMaster indexa arquivos dentro de imagens de discos antigos; o WikiTeam preserva wikis que foram encerradas.

Você nunca precisa dizer ao Echo que tipo de entrada é — ele lê o formato e direciona de acordo. Um nome como Richard Feynman impulsiona arquivos de autores e perfis; uma "frase" entre aspas favorece os motores de texto completo; uma única palavra tende a nomes de usuário e pacotes de software. Mas nada fica oculto: todo arquivo relevante ainda aparece em seus resultados, então você nunca perde uma correspondência.

Como funciona uma busca

  1. Cole e busque. Digite ou cole sua URL, DOI, ISBN, identificador, hash ou título no campo e pressione Buscar.
  2. O Echo detecta o tipo. Ele classifica a entrada e seleciona todos os arquivos de seu catálogo que podem responder àquele tipo de consulta.
  3. Ele consulta todos juntos. O Echo distribui a consulta para os arquivos relevantes em paralelo e reúne o que retorna.
  4. Os resultados chegam agrupados. As correspondências são agrupadas para que você possa ver, num relance, quais arquivos têm uma cópia e o que cada um encontrou.

Se nada corresponder, o Echo diz isso claramente e sugere tentar uma forma diferente da mesma coisa — por exemplo, um título em vez de uma URL.

Lendo seus resultados

Cada resultado cria um link direto para o arquivo que detém a cópia, para que você possa abrir o snapshot, o artigo, o livro ou o perfil em sua fonte. Os arquivos diferem no que expõem: alguns retornam metadados ricos, outros apenas um link. Abra qualquer arquivo a partir do catálogo para ver observações sobre o que há nele, como funciona e como acessá-lo.

Explore o catálogo completo

Além da busca ao vivo, o Echo mantém um catálogo de todos os arquivos que conhecemos — incluindo os que ainda não conseguimos consultar de forma programática. Abra o catálogo e filtre por categoria, cluster, API ou tipo de acesso para explorar todo o panorama e descobrir o que cada arquivo cobre.

O catálogo do Archivarix Echo: filtre mais de 200 arquivos por categoria, cluster, API e tipo de acesso

Os filtros mapeiam a forma como os arquivos estão organizados:

  • Categoria — o tema do arquivo (web-archive, scholarly-metadata, books, social, science-articles, image-archive, code-archive e muitos outros).
  • Cluster — a grande família à qual um arquivo pertence (páginas da web, texto completo, artigos acadêmicos, software, livros, social, imagens, vídeo/áudio/música, torrents, conjuntos de dados, patrimônio cultural, texto especializado, arquivo por hash).
  • API — se o arquivo tem uma interface programática que o Echo pode consultar.
  • Acesso — quão acessível ele é: open, API, captcha, IP-blocked ou link-only.

O que o Echo busca ao vivo vs. apenas por link

Nem todo arquivo pode ser consultado por uma máquina. O Echo lida com dois níveis:

  • Arquivos ao vivo. Onde um arquivo oferece uma API de busca aberta, o Echo a consulta diretamente e traz os resultados de volta para sua busca. Esses são os arquivos que respondem quando você cola algo no campo.
  • Arquivos apenas por link. Alguns arquivos não têm uma API utilizável, exigem um captcha ou bloqueiam o acesso automatizado. O Echo não consegue executar a busca por você, mas os lista no catálogo com um link direto e observações sobre como pesquisá-los manualmente. Esta é a leitura honesta — quando não conseguimos abrir algo por você, dizemos isso e apontamos onde ele está.

Contas e limites

Você pode usar o Echo sem se registrar. O uso anônimo tem um limite diário para manter o serviço justo e prevenir abusos. Uma conta gratuita amplia esse limite e salva seu histórico de buscas para que você possa retornar a consultas anteriores. Criar uma conta exige um e-mail e uma senha — sem pagamento, sem plano a escolher. Crie uma conta gratuita para começar.

Perguntas frequentes

O Archivarix Echo é gratuito?

Sim. Você pode pesquisar sem uma conta. Uma conta gratuita simplesmente amplia seu limite diário e lembra seu histórico.

Como funciona?

O Echo não armazena o conteúdo arquivado em si. Ele detecta o que você colou, consulta os arquivos públicos que detêm aquele tipo de dado e cria links para o que eles têm. Os arquivos — o Wayback Machine, o archive.today, o Common Crawl, índices acadêmicos, bibliotecas de livros e outros — vêm capturando a web há anos.

Por que algumas coisas não são encontradas?

Os arquivos só guardam o que foi capturado antes de desaparecer. Se nenhum arquivo público jamais rastreou ou depositou uma cópia, não há nada a recuperar. A cobertura é melhor para material que foi público, popular ou amplamente citado.

O Echo pode pesquisar todos os arquivos automaticamente?

Não — e não fingimos o contrário. Arquivos sem uma API utilizável, ou que bloqueiam o acesso automatizado, são listados no catálogo como apenas por link, com um link direto para que você mesmo possa pesquisá-los.

De onde vêm os resultados?

Inteiramente de arquivos públicos e conjuntos de dados abertos. O Echo é um índice e um roteador por cima deles; ele nunca hospeda o conteúdo subjacente, e cada resultado aponta de volta para sua fonte. Veja Sobre para o quadro completo.