Explorar o catálogo de arquivos
Todas as fontes que conhecemos; filtre por categoria, cluster, API ou acesso e abra qualquer arquivo para ver detalhes.
- Wayback Machine (Internet Archive) O principal arquivo de páginas web do Internet Archive e o maior de seu tipo, com mais de um trilhão de capturas de URLs tal como apareceram ao longo do tempo. Informe qualquer endereço web para percorrer seu histórico de instantâneos na interface web; APIs gratuitas também permitem verificar se uma página está arquivada e listar todas as capturas. É a primeira parada padrão quando se precisa de uma versão antiga ou excluída de quase qualquer página web. O serviço teve quedas intermitentes em 2026 e limita o uso intenso, embora as capturas existentes continuem legíveis. Páginas e sites API
- archive.today (.ph / .is / .md / .li / .vn / .fo) Um arquivador sob demanda em que qualquer pessoa pode enviar uma URL e obter um instantâneo permanente; ele achata páginas dinâmicas em cópias estáticas e frequentemente contorna paywalls, com dezenas de milhões de instantâneos acumulados. As capturas existentes são localizadas pelo timemap Memento e abertas como links diretos de instantâneo em archive.ph e em seus domínios espelho; salvar uma nova página é feito no site e pode exigir a resolução de um CAPTCHA. Recorra a ele quando uma página mudou ou desapareceu recentemente demais para os outros arquivos, ou quando um artigo com paywall precisa de uma cópia legível. Páginas e sites API captcha
- Common Crawl (CDX index) Um projeto sem fins lucrativos que rastreia a web aberta em escala de petabytes e publica tudo o que coleta, com cerca de 2,2 bilhões de páginas por rastreamento e um novo rastreamento divulgado regularmente. Cada rastreamento tem uma API de índice gratuita e sem chave que informa se e quando uma URL foi capturada, e o conteúdo armazenado da página pode então ser extraído do conjunto de dados público. Trata-se de uma série de instantâneos de rastreamento, e não de um arquivo sob demanda, por isso serve para verificar como um site estava nas janelas de rastreamento recentes ou para fazer pesquisa web em massa. Páginas e sites API
- Arquivo.pt (Portuguese Web Archive) O arquivo nacional da web de Portugal, que preserva bilhões de arquivos desde 1996, incluindo muitos sites não portugueses. Diferentemente da maioria dos arquivos da web, oferece busca em texto completo nas páginas preservadas além da consulta por URL, tanto pelo site quanto por APIs gratuitas. Recorra a ele quando for preciso buscar dentro do texto das páginas arquivadas, e não apenas recuperar um endereço conhecido, ou ao pesquisar a história da web portuguesa e europeia. Páginas e sites API
- Library of Congress Web Archives O programa de arquivamento web curado da Biblioteca do Congresso: mais de cem coleções temáticas de sites selecionados por seus bibliotecários, em escala de petabytes. As coleções são consultadas em loc.gov, e as páginas de coleções e de itens também podem ser obtidas em JSON. Brilha quando o tema pesquisado coincide com um dos eixos curados — eleições, eventos, organizações — e não para localizar URLs arbitrárias. Páginas e sites API
- Perma.cc Um serviço de arquivamento permanente do Library Innovation Lab de Harvard, concebido para que os links citados em textos jurídicos e acadêmicos nunca deixem de funcionar; mantém milhões de permalinks. Cada página arquivada recebe um código curto perma.cc que reproduz a captura, e uma API pública gratuita permite consultar os registros existentes. É mais útil ao seguir um link Perma de um documento judicial ou de um artigo, ou ao verificar se uma página foi preservada como citação. Páginas e sites API
- Archive-It (Internet Archive) O serviço de arquivamento por assinatura do Internet Archive, usado por mais de mil bibliotecas, governos e universidades para montar coleções web curadas que, somadas, reúnem dezenas de bilhões de documentos. As capturas são vistas por meio de links de reprodução em wayback.archive-it.org, organizados por coleção. Compensa quando a coleção de uma instituição específica cobre o assunto pesquisado; como a cobertura é feita coleção a coleção, não é o lugar para localizar URLs arbitrárias. Páginas e sites
- UK Government Web Archive (The National Archives) O arquivo público de sites do governo central britânico mantido pelo The National Archives, com bilhões de registros que remontam a cerca de 2003. As páginas arquivadas são abertas por links de reprodução em seu visualizador no estilo Wayback, em webarchive.nationalarchives.gov.uk. É o lugar para encontrar versões antigas do gov.uk e de sites ministeriais, sobretudo enquanto o UK Web Archive principal está fora do ar. O servidor rejeitou nossas verificações automatizadas, portanto o comportamento pode ser inconsistente; use o site diretamente. Páginas e sites
- Vefsafn.is (Icelandic Web Archive) O arquivo nacional da web da Islândia, mantido pela Biblioteca Nacional e Universitária, que desde 2004 coleta todo o domínio .is cerca de três vezes por ano e guarda sites relacionados à Islândia desde 1996. As listas de instantâneos vêm de seu timemap Memento, e as capturas individuais abrem como links de reprodução em vefsafn.is, onde o visualizador pode pedir a resolução de um CAPTCHA. A fonte natural para a história dos sites islandeses. Páginas e sites API captcha
- Trove / Australian Web Archive (NLA) O arquivo da web da Biblioteca Nacional da Austrália. PANDORA, o Australian Government Web Archive e os rastreamentos do domínio .au reunidos, com bilhões de arquivos e pesquisa pelo portal Trove. As capturas abrem como links de reprodução em webarchive.nla.gov.au; a API do Trove não cobre sites arquivados, portanto a busca acontece no próprio site. A principal fonte para a história dos sites australianos. Páginas e sites
- DNB Webarchiv (German National Library) O arquivo da web seletivo da Biblioteca Nacional da Alemanha, que coleta instantâneos temáticos de sites alemães desde 2012. Não há API de busca: as coleções temáticas são consultadas pelo portal e podem ser vistas gratuitamente em todo o mundo, enquanto o conteúdo mais profundo fica restrito às salas de leitura da biblioteca. Vale a consulta ao investigar sites ou assuntos alemães abrangidos por suas coleções.
- Ghostarchive Um pequeno arquivador independente sob demanda, notável por lidar com vídeos do YouTube e publicações do Twitter além de páginas web comuns. Os instantâneos são acessados por links diretos para páginas individuais do arquivo; não há API de busca. Vale consultá-lo ao procurar cópias preservadas de conteúdo de redes sociais, que os arquivos da web tradicionais costumam capturar mal. Páginas e sites
- Conifer (Rhizome, ex-Webrecorder.io) Um serviço de captura hospedado da Rhizome (antigo Webrecorder.io) para gravações interativas de alta fidelidade de páginas web, reunidas em milhares de coleções criadas por usuários. As coleções são consultadas e as gravações individuais abertas no site; não há API pública de busca. Atenção: o serviço está sendo encerrado — a captura e a edição param em maio de 2026 e, a partir de junho de 2026, ele passa a ser somente leitura, embora as coleções existentes continuem visíveis.
- Webrecorder / Browsertrix O criador do Browsertrix e do conjunto de ferramentas sucessor do Conifer: software de rastreamento hospedado ou auto-hospedável que produz arquivos de arquivamento web em WACZ/WARC. Não há um corpus público central para pesquisar — cada instalação guarda as próprias capturas. Relevante quando se quer criar arquivos de alta fidelidade de sites por conta própria, e não pesquisar arquivos existentes.
- Stanford Web Archive Portal (SWAP) O portal de acesso da Stanford Libraries às suas coleções curadas de arquivos da web, que ficam armazenadas no serviço Archive-It. O portal não tem API de busca; navega-se e abrem-se as capturas no site. É útil sobretudo quando as coleções curadas de Stanford por acaso cobrem o assunto pesquisado — o mesmo material também é acessível pelo Archive-It.
- EU Web Archive (Publications Office) O arquivo do Serviço das Publicações da UE com os sites das instituições, agências e órgãos europeus, coletados desde 2018. A consulta é feita pelo portal, sem API de busca documentada. É o lugar para procurar versões anteriores do europa.eu e de outros sites institucionais; note que o acesso é bloqueado a partir de algumas redes, portanto ele pode não carregar em todas as conexões. bloqueio por IP
- KB Netherlands Web Archive O arquivo da web da Biblioteca Real dos Países Baixos (“Websites van Nederland”), que preserva cerca de 25.000 sites neerlandeses curados, vários milhares dos quais já desapareceram da web ativa. Não há API pública de busca, e o acesso mais profundo ao conteúdo arquivado limita-se em grande parte às salas de leitura da biblioteca. É mais bem usado como indicação de que um site neerlandês desaparecido pode estar preservado, com a consulta completa feita presencialmente. bloqueio por IP
- US NARA Web Harvests (webharvest.gov) O acervo do Arquivo Nacional dos EUA com coletas web periódicas de sites do Congresso e da Presidência. É apenas navegável em webharvest.gov, sem API de busca. Recorra a ele quando precisar ver como sites oficiais do governo dos EUA se apresentavam ao final de uma legislatura ou de uma administração presidencial.
- Kiwix / Zimit Mais um ecossistema de arquivos off-line do que um serviço de consulta: o Kiwix empacota sites inteiros — Wikipédia, StackExchange e milhares de outros — em arquivos ZIM baixáveis, e o Zimit consegue converter outros sites para o mesmo formato. Navega-se pela biblioteca de pacotes e baixam-se cópias completas de sites para leitura off-line; não há busca de instantâneos por URL. Útil quando se quer uma cópia completa e funcional de um site, e não uma captura datada de uma única página.
- PADICAT (Catalonia) O arquivo nacional da web da Catalunha, que combina seleções curadas com rastreamentos do domínio .cat. Tudo acontece em seu próprio portal web, sem API confirmada, portanto a busca e a visualização das capturas são feitas em padicat.cat. A fonte de referência para a história dos sites catalães, ainda que o site possa responder devagar.
- Croatian Web Archive (HAW) O arquivo nacional da web da Croácia, mantido pela Biblioteca Nacional e Universitária de Zagreb, que preserva sites .hr por seleção curada e rastreamentos anuais do domínio. O acesso se dá navegando pelo site do HAW; nenhuma API está documentada. Ele cobre a história da web croata, mas o site esteve inacessível em nossas verificações recentes, de modo que sua disponibilidade é atualmente incerta.
- Bibliotheca Alexandrina Web Archive O braço de arquivamento web da Biblioteca de Alexandria, no Egito, que historicamente hospedou um espelho do acervo do Internet Archive anterior a 2007 ao lado de material regional. O acesso se dá navegando pelo site; não há API. Seu acervo atual não está claro — a página carrega, mas não há evidência recente de que o espelho ainda funcione, portanto verifique o conteúdo antes de contar com ele.
- Yandex (cache / SERP) O buscador russo, listado aqui por ser o último grande buscador que ainda exibe cópias em cache de páginas web. Não há API estável: faz-se uma busca comum em yandex.com e procura-se o link de “cópia salva” ao lado de um resultado. Vale a tentativa quando uma página desapareceu recentemente demais para que os arquivos da web a tenham capturado. Espere verificações antirrobô — o site frequentemente desafia os visitantes antes de mostrar os resultados. Texto completo da web captcha
- Crossref REST API O registro autoritativo de metadados de DOI da publicação acadêmica, cobrindo cerca de 165 milhões de registros. Consulte qualquer DOI para obter seu registro bibliográfico, ou pesquise por título e autor, no site ou por uma API aberta e gratuita. É a referência de base para verificar citações e descobrir o que um DOI realmente identifica. Artigos acadêmicos API
- Unpaywall Uma base de dados que mapeia DOIs para cópias legais em acesso aberto de artigos, acompanhando o status de acesso aberto de cerca de 150 milhões de DOIs. Informe um DOI e ela indica se existe uma cópia legítima e gratuita em texto completo e onde encontrá-la, por meio de uma API gratuita e simples. É a maneira padrão de responder à pergunta “posso ler este artigo atrás de paywall gratuitamente em algum lugar legítimo?” API
- OpenAlex Um índice aberto do panorama global da pesquisa: cerca de 480 milhões de trabalhos acadêmicos vinculados a autores, instituições e temas. É possível explorá-lo em openalex.org ou consultar sua API, que desde fevereiro de 2026 exige uma chave de conta gratuita (com uma generosa cota diária sem custo). Forte para o mapeamento amplo da literatura, reunindo trabalhos, autores e produção institucional em um só lugar. O acesso sem chave hoje se limita a uma pequena cota diária de demonstração. Artigos acadêmicos API · key
- Semantic Scholar (Academic Graph) Um buscador acadêmico e grafo de citações do Allen Institute for AI, cobrindo cerca de 220 milhões de artigos com o contexto das citações. Pesquise pelo site ou use a Graph API gratuita, que dispensa chave, mas opera em um pool anônimo compartilhado e fortemente limitado. Especialmente prático para seguir trilhas de citação e ver como os artigos se relacionam. Sob carga, a API sem chave é frequentemente limitada por taxa, de modo que o site é a rota mais confiável. Artigos acadêmicos API
- DataCite REST API O registro de DOIs para produtos de pesquisa que não são artigos de periódicos: conjuntos de dados, software e preprints, abrangendo dezenas de milhões de DOIs. Os registros podem ser consultados ou pesquisados por uma API gratuita que não exige chave. É o complemento da Crossref quando o objeto rastreado é um conjunto de dados ou um software de pesquisa, e não um artigo. Artigos acadêmicos API
- OpenCitations Um índice aberto de vínculos de citação acadêmica, com mais de dois bilhões de conexões DOI-para-DOI segundo sua atualização de fevereiro de 2026. Contagens de citações, citações recebidas e listas de referências de qualquer DOI estão disponíveis por uma API gratuita; a página de busca do site fica atrás de um CAPTCHA, mas a API responde sem obstáculos. Use-o para ver quem cita um artigo ou para montar trilhas de citação a partir de dados totalmente abertos. API
- dblp (CS bibliography) A bibliografia curada de ciência da computação, que indexa cerca de sete milhões de publicações de periódicos e conferências da área, com registros de autoria cuidadosamente mantidos. Pesquise em dblp.org ou pela API gratuita. Seu escopo é estritamente ciência da computação, mas, dentro desse campo, costuma ser o registro mais limpo e confiável de quem publicou o quê, onde e quando. Artigos acadêmicos API
- arXiv (export API) O servidor de preprints de física, matemática, ciência da computação e áreas vizinhas, que hospeda cerca de 2,5 milhões de artigos com texto completo gratuito. Pesquise e navegue em arxiv.org ou consulte a export API gratuita. É o primeiro lugar a procurar por pesquisas novas antes da publicação em periódico, ou no lugar dela. As consultas automatizadas passaram a ser limitadas com mais rigor desde o início de 2026, portanto o acesso por máquina pode precisar de um ritmo mais lento. Artigos acadêmicos API
- bioRxiv O servidor de preprints de biologia mantido pelo Cold Spring Harbor Laboratory, que hospeda mais de 300.000 preprints com texto completo gratuito. A busca e a leitura são feitas em biorxiv.org; o site às vezes exibe uma breve verificação da Cloudflare antes de carregar, e os detalhes de cada artigo também estão disponíveis por uma API gratuita. O lugar para encontrar pesquisas de biologia meses antes de elas aparecerem em periódicos. Artigos acadêmicos API captcha
- medRxiv O servidor de preprints irmão do bioRxiv para medicina e ciências da saúde, com mais de 60.000 preprints de leitura gratuita. Use o site medrxiv.org para pesquisar e ler (ele pode exibir antes uma breve verificação do navegador); os detalhes dos artigos também são expostos pela API compartilhada do bioRxiv. Recorra a ele para acompanhar pesquisas clínicas e de saúde pública antes da revisão por pares. Artigos acadêmicos API captcha
- PubMed / PMC (NCBI E-utilities) O índice de literatura biomédica dos National Institutes of Health dos EUA, que cobre cerca de 37 milhões de referências e cerca de 10 milhões de artigos em texto completo no PubMed Central. A busca no acervo é feita pelas E-utilities do NCBI, que retornam resultados sem chave de API. É a primeira parada padrão para literatura médica, clínica e de ciências da vida. Artigos acadêmicos API
- Europe PMC Uma coleção de literatura das ciências da vida mantida pelo EMBL-EBI, que abrange cerca de 43 milhões de publicações junto com conteúdo aberto em texto completo. Uma única interface de busca sem chave retorna tanto os metadados quanto, quando disponível, o texto completo do artigo. Recorra a ela quando quiser artigos biomédicos e precisar do texto em si, e não apenas da referência. Artigos acadêmicos API
- DOAJ Um diretório de periódicos de acesso aberto avaliados, acompanhado de metadados no nível do artigo, cobrindo cerca de 21.000 periódicos e mais de 10 milhões de artigos. As buscas passam por uma interface sem chave sobre seus metadados de licença aberta, ou é possível navegar diretamente pelo site. Use-o para confirmar que um periódico é genuinamente de acesso aberto ou para encontrar artigos de leitura gratuita. Artigos acadêmicos API
- DOAB (Open Access Books) O equivalente do DOAJ para livros: um diretório de livros acadêmicos de acesso aberto revisados por pares, com cerca de 95.000 títulos. Seu catálogo pode ser pesquisado por uma interface sem chave e também navegado na web. Recorra a ele quando precisar de monografias e coletâneas acadêmicas de leitura gratuita. Livros API
- OpenAIRE Graph Um grafo de conhecimento europeu de ciência aberta que vincula centenas de milhões de produtos de pesquisa: publicações, conjuntos de dados, software e registros de financiamento. É possível consultá-lo pela API ou navegar pelo portal Explore na web. É uma boa escolha para rastrear as conexões entre um artigo e os dados, o software ou o financiamento que o sustentam, embora o serviço esteja em meio à migração para uma nova API de grafo em 2026 e seus antigos endpoints de busca estejam sendo desativados. Artigos acadêmicos API
- CORE (core.ac.uk) Um agregador de pesquisa em acesso aberto que coleta texto completo e metadados de mais de 10.000 repositórios, totalizando cerca de 300 milhões de registros e mais de 40 milhões de itens em texto completo. O acesso se dá por uma API de busca que exige uma chave gratuita, já que o uso anônimo é fortemente limitado. Recorra a ele quando quiser lançar a rede mais ampla possível sobre o texto completo em acesso aberto, em vez de consultar um único repositório. API · key
- BASE (Bielefeld) Um buscador acadêmico da Universidade de Bielefeld que indexa mais de 400 milhões de documentos coletados de mais de 12.000 provedores de conteúdo. O portal web é de navegação aberta para pesquisar esse material. Sua interface programática é limitada a endereços IP previamente cadastrados, portanto, na prática, o uso se dá pelo site. bloqueio por IP
- The Lens Uma plataforma combinada de busca e análise que cobre trabalhos acadêmicos ao lado de patentes, com mais de 270 milhões de registros. A interface web permite pesquisar e cruzar a literatura científica e a de patentes em um só lugar. Sua API depende de aprovação e é majoritariamente paga, portanto a rota prática é o site, útil quando uma pergunta abrange tanto publicações acadêmicas quanto patentes.
- Dimensions (Digital Science) Uma base de pesquisa vinculada que conecta publicações, financiamentos, patentes, ensaios clínicos e documentos de política pública, com mais de 140 milhões de publicações. A busca é feita pelo aplicativo web. O acesso programático depende de assinatura e de aprovação, portanto use o site diretamente quando precisar acompanhar um tema também pelo financiamento, pelos ensaios clínicos e pelas políticas públicas, e não apenas pelos artigos.
- Scite.ai Um serviço de análise de citações que classifica cerca de 1,6 bilhão de citações conforme apoiem, contradigam ou apenas mencionem uma afirmação. O relatório de citações de um artigo é acessado por links diretos para o site. A API tem preço corporativo, portanto o acesso é por link, o que ajuda quando se quer saber não apenas quem citou um artigo, mas como. captcha
- Connected Papers Uma ferramenta que monta um grafo visual de artigos relacionados a um determinado trabalho por similaridade, a partir de um acervo de dezenas de milhões de artigos. Seu uso consiste em abrir a visualização em grafo de um artigo no site. Não há interface de consulta aberta, portanto ele funciona como link direto: recorra a ele para descobrir a literatura adjacente a um artigo que você já conhece.
- Open Library Um catálogo aberto e editável de livros, edições e autores mantido pelo Internet Archive, com registros de mais de 40 milhões de edições e obras e links para cópias disponíveis para empréstimo. É possível pesquisar por título ou consultar um ISBN específico pela API sem chave, ou navegar pelo catálogo na web. É uma parada sólida e de uso geral para detalhes bibliográficos e para descobrir onde um livro pode ser lido ou emprestado. Livros API
- Internet Archive Texts A coleção de textos e livros do archive.org, composta por mais de 40 milhões de itens digitalizados, alguns disponíveis apenas por empréstimo controlado. Uma interface de busca e metadados sem chave permite localizar itens e abri-los no leitor. Use-a para verificar que um livro ou documento existe e para ler material em domínio público, lembrando que o texto completo de obras sob direitos autorais depende de empréstimo e que o serviço pode aplicar limitação de taxa sob carga elevada. Livros API
- scholar.archive.org / fatcat O catálogo acadêmico do Internet Archive (fatcat), que oferece busca em texto completo em mais de 25 milhões de artigos em acesso aberto, incluindo cópias de preservação de artigos. A busca é feita pelo site scholar.archive.org. Por ora, é melhor acessá-lo pela interface web, já que sua API de consulta se mostrou instável na última verificação. Artigos acadêmicos
- HathiTrust Uma grande biblioteca digital colaborativa com mais de 18 milhões de volumes digitalizados provenientes de bibliotecas de pesquisa. Uma interface bibliográfica sem chave retorna registros de catálogo com links diretos para o leitor; os volumes em domínio público podem ser lidos, enquanto o texto completo das obras sob direitos autorais é restrito a membros vinculados. Recorra a ela para verificar acervos e acessar volumes digitalizados, embora sua interface de busca possa apresentar uma página de verificação a partir de algumas redes. Livros API captcha
- Google Books API O índice de volumes de livros do Google, que cobre dezenas de milhões de títulos com metadados e, quando permitido, prévias. É possível pesquisar por título ou ISBN pela API, e uma chave gratuita eleva a cota de requisições, que de outro modo é bastante restrita. Oferece ampla cobertura para confirmar a existência de um livro e os detalhes de sua edição e para encontrar páginas de prévia. Livros API
- Project Gutenberg (Gutendex) A coleção clássica de cerca de 75.000 e-books gratuitos em domínio público, com o serviço Gutendex expondo seu catálogo em JSON para buscas por título ou autor. Também é possível navegar e baixar diretamente do site do Gutenberg. É a referência para textos completos e gratuitos de obras fora dos direitos autorais, embora a consulta ao catálogo possa ser lenta ou eventualmente expirar. Livros API
- Standard Ebooks Uma coleção pequena e cuidadosamente produzida de cerca de 900 e-books em domínio público, aprimorados e formatados com alto padrão, com um feed OPDS. Os títulos são navegados e baixados no site. Recorra a ela quando quiser uma edição limpa e bem diagramada de um clássico, e não uma digitalização bruta. Livros bloqueio por IP
- Wikisource Biblioteca de textos-fonte de conteúdo livre da Wikimedia, com livros transcritos, documentos, discursos e material histórico, somando milhões de páginas. A busca pode ser feita pela API padrão do MediaWiki ou no site. É útil para encontrar textos completos, transcritos e citáveis, de documentos em domínio público e de fontes primárias. Livros API
- WorldCat / OCLC O maior catálogo coletivo de acervos de bibliotecas do mundo, agregando mais de 550 milhões de registros e mostrando quais bibliotecas possuem determinado item. A busca é feita pela interface web em search.worldcat.org. Não existe mais uma API gratuita, portanto use o site; ele continua sendo a referência padrão para localizar um exemplar físico em uma biblioteca.
- Trove books (NLA) Serviço de descoberta da Biblioteca Nacional da Austrália para livros, jornais, imagens e material australiano, abrangendo bilhões de itens. A busca pode ser feita no site do Trove ou por sua API, com uma chave gratuita. É o principal recurso para material australiano publicado e histórico; observe que abrange livros e registros de catálogo, não capturas de arquivos da web. API · key
- Anna's Archive Índice de metabusca sobre várias bibliotecas sombra: LibGen, Sci-Hub, Z-Library, além de coleções obtidas por raspagem, abrangendo cerca de 64 milhões de livros e 96 milhões de artigos. Aponta para cópias de obras hospedadas externamente, muitas delas protegidas por direitos autorais, funcionando como um diretório de links e não como servidor de arquivos. Pesquisadores o usam como busca única em várias fontes sombra, mas seus domínios mudam com frequência e o espelho em funcionamento precisa ser resolvido no momento da consulta. Livros captcha
- Library Genesis (LibGen) Biblioteca sombra de longa data com milhões de livros, livros didáticos e artigos. Indexa material protegido por direitos autorais hospedado em outros lugares, atuando como fonte de links e não como hospedeira de conteúdo. Seus domínios espelho mudam com frequência e precisam ser resolvidos no momento da consulta, o que torna o acesso intermitente. Livros bloqueio por IP
- Sci-Hub Serviço que fornece PDFs completos de artigos de periódicos bloqueados por paywall consultados pelo DOI, com um acervo de cerca de 88 milhões de artigos. Aponta para material protegido por direitos autorais hospedado em outros lugares, em vez de servi-lo diretamente. A coleção está em boa medida congelada por volta de 2021, sendo uma alternativa de melhor esforço para DOIs mais antigos, e seus domínios espelho mudam. Artigos acadêmicos captcha
- Z-Library Grande biblioteca sombra de e-books e artigos, com dezenas de milhões de itens atrás de um login de conta. Indexa material protegido por direitos autorais hospedado em outros lugares, atuando como diretório de links, e inúmeros clones de phishing a imitam. O acesso é frágil por causa da barreira de login e da troca frequente de domínios. captcha
- Bluesky public AppView (AT Protocol) Interface aberta e sem chave para toda a rede social Bluesky: perfis, publicações e feeds de dezenas de milhões de contas. Leituras públicas de perfis e feeds passam por sua API sem qualquer login ou chave. É a maneira mais limpa de trazer publicações e perfis sociais atuais diretamente para os resultados de busca. API
- Telegram public preview (t.me/s/) Prévia web renderizada no servidor pelo próprio Telegram para qualquer canal público, mostrando as publicações recentes sem aplicativo nem login. Basta abrir a página de prévia do canal em t.me. É a forma mais direta de ler e extrair publicações de canais públicos do Telegram. API
- Wayback, twitter/x URLs O Wayback Machine aplicado a URLs de twitter.com e x.com, retornando instantâneos arquivados de tweets e perfis onde houve rastreamento. É possível verificar se um tweet específico foi capturado e abrir a cópia salva pelos links de reprodução. Está entre as formas mais confiáveis de recuperar tweets apagados, embora a cobertura seja irregular e mais forte para contas de destaque. Redes sociais API
- Wayback Tweets (claromes) Ferramenta que consulta o índice de capturas do Wayback Machine para listar todos os tweets arquivados de um determinado handle. Baseia-se nos mesmos dados de captura do Wayback, restritos a uma conta por vez. Recorra a ela para enumerar os tweets arquivados que sobreviveram de um usuário, embora o próprio aplicativo hospedado costume hibernar ou esgotar o tempo de resposta. Redes sociais API
- archive.today. X / Facebook O archive.today usado especificamente para páginas do X e do Facebook que o rastreador do Wayback muitas vezes não alcança, com dezenas de milhões de instantâneos sob demanda. A existência é verificada pelo seu timemap Memento, e o instantâneo salvo é aberto por link direto. É valioso para páginas de redes sociais que outros arquivos não capturam, embora as páginas de instantâneo possam aplicar limite de requisições e o serviço tenha enfrentado bloqueios regionais em 2026. Redes sociais API captcha
- Wayback, facebook.com O Wayback Machine aplicado a URLs de facebook.com, revelando instantâneos arquivados de páginas e publicações públicas do Facebook onde houve captura. É possível verificar a existência de capturas e abrir as cópias salvas pelos seus links de reprodução. A cobertura é escassa porque o Facebook bloqueia rastreadores e muitas capturas contêm apenas a tela intersticial de login, de modo que os melhores resultados vêm de Páginas públicas. Redes sociais API
- Wayback, reddit.com O Wayback Machine aplicado a URLs de reddit.com, com instantâneos arquivados de tópicos e perfis e boa cobertura das discussões populares. É possível verificar se um tópico foi capturado e abrir a cópia salva pelos links de reprodução. Como não depende da API do próprio Reddit, é uma das formas mais confiáveis de recuperar conteúdo removido ou apagado do Reddit. Redes sociais API
- IA Twitter Stream Grab Conjunto de despejos em massa do Internet Archive do antigo sample stream público do Twitter, armazenados como arquivos JSON mensais e cobrindo bilhões de tweets de aproximadamente 2011 a 2023. O acesso se dá pelo download dos arquivos do conjunto de dados, listados pela API de metadados do item. Destina-se à análise offline em massa de dados históricos do Twitter, e não à consulta de um tweet individual; o conjunto está congelado, já que a fonte original não existe mais. Redes sociais API
- PullPush.io Sucessor aberto do Pushshift que oferece busca em texto completo, sem chave, em comentários e submissões do Reddit, incluindo conteúdo posteriormente removido ou apagado. A consulta é feita por sua API JSON, por subreddit ou palavra-chave. É a principal ferramenta prática para pesquisar o histórico do Reddit e recuperar publicações removidas. Redes sociais API
- Arctic Shift Serviço de dados do Reddit que oferece uma API sem chave, despejos em massa para download e uma interface web, com limites mais generosos que os do PullPush. Sua busca em texto completo é restrita a um usuário ou subreddit específico, e não ao site inteiro. Recorra a ele como complemento ao PullPush quando precisar de dados arquivados do Reddit dentro de uma comunidade ou conta específica. Redes sociais API
- Reddit Data API (official) A API de dados do próprio Reddit, na qual acrescentar .json à URL de uma página retorna seu conteúdo sem autenticação, e o OAuth libera mais recursos. Ela serve dados ao vivo e atuais do Reddit, publicações, comentários e perfis, mas não oferece busca histórica profunda. Use-a para conteúdo atual do Reddit e combine-a com o PullPush ou o Arctic Shift quando precisar do passado. API
- Desuarchive (4chan archive) Arquivo baseado em FoolFuuka de boards selecionados do 4chan (/a/, /int/, /k/, /tg/, /wsg/ e outros) com um histórico extenso. Mantém cópias dos tópicos pesquisáveis em texto completo, permitindo encontrar publicações antigas do 4chan depois que elas somem do próprio 4chan, seja no site, seja por sua API JSON sem chave. É uma fonte central para pesquisa em fóruns nos boards que cobre; observe que alguns boards trazem conteúdo NSFW ou extremo. Redes sociais API
- Mastodon per-instance API Todo servidor Mastodon expõe uma API REST integrada, e leituras públicas, como consultas de conta e linhas do tempo públicas, geralmente funcionam sem token. Não há busca global: cada consulta se dirige a uma instância específica, a federação oferece apenas alcance parcial entre instâncias e a busca em texto completo exige token na maioria dos servidores. Recorra a ela para verificar uma conta específica do Mastodon ou navegar pelas publicações públicas de uma instância. API
- Fediverse Observer Diretório e monitor de disponibilidade que cobre milhares de servidores do Fediverso/Mastodon, com um endpoint GraphQL por trás. Use o site para descobrir quais instâncias existem e quais estão ativas no momento. Ele não guarda publicações; é a primeira parada natural antes de investigar um servidor Mastodon específico.
- Nitter (xcancel.com et al.) Front-ends de privacidade para o X/Twitter (xcancel.com e instâncias Nitter semelhantes) que exibem perfis e linhas do tempo sem login, incluindo feeds RSS por usuário. Mostram apenas dados ao vivo do X, não são um arquivo, e o ecossistema entrou em colapso quase por completo, com apenas algumas instâncias resistindo. São úteis para ler uma conta do X sem ter conta própria, mas espere bloqueios e indisponibilidades; consulte primeiro o monitor de disponibilidade do Nitter para achar uma instância em funcionamento. bloqueio por IP
- Nitter health tracker Página de status ao vivo que acompanha quais das instâncias Nitter remanescentes estão no ar. Não contém conteúdo próprio; é um utilitário que se abre antes de tudo para escolher um espelho Nitter em funcionamento e então tentar visualizar perfis do X/Twitter por meio dele. Basta abri-la no navegador; não há nada a pesquisar.
- Thread Reader App Desenrola threads do X/Twitter em páginas legíveis únicas e, uma vez desenrolada a thread, a página permanece mesmo que os tweets originais sejam apagados. Milhões de threads desenroladas podem ser lidas sem login em endereços previsíveis do tipo /thread/<tweetid>.html. É prático para recuperar uma thread apagada que alguém desenrolou enquanto ela estava no ar; criar novos desenrolamentos exige uma conta no X para mencionar o bot.
- Politwoops (ProPublica) Arquivo da ProPublica com tweets apagados por políticos, reunindo cerca de um milhão de exclusões coletadas entre 2012 e 2023. A navegação é feita na web, sem API, consultando um político para ver o que ele removeu. A coleção está congelada: o monitoramento terminou em 2023, portanto é estritamente um registro histórico daquele período.
- Telegago (Google CSE) Google Custom Search configurado para vasculhar páginas públicas do Telegram (t.me), canais, publicações e perfis que o Google indexou. Usa-se como uma caixa de busca comum no navegador; a cobertura é aquilo que o Google porventura rastreou do t.me. Uma forma rápida e gratuita de descobrir canais do Telegram sobre um tema quando não se sabe por onde começar.
- TGStat O maior serviço de catálogo e analítica do Telegram, cobrindo mais de 2,5 milhões de canais e grupos públicos, com busca em publicações e estatísticas de audiência. Use o site para encontrar canais por tema ou palavra-chave e avaliar seu alcance; a API é paga e exige token. É a escolha certa para mapear o ecossistema do Telegram em torno de um assunto ou pesquisar um canal específico. captcha
- Telemetr.io Grande índice de analítica do Telegram, com papel semelhante ao do TGStat: estatísticas de canais e dados de publicações da esfera pública do Telegram. Os dados completos ficam atrás de login e assinatura paga, portanto trate-o como um site a ser aberto e explorado, e não como algo a consultar abertamente. Estava inacessível em nossa última verificação de disponibilidade, então espere possível indisponibilidade.
- SocialData API Uma API comercial que retorna dados do X/Twitter — busca, perfis de usuário e tweets — sem passar pela API oficial do X. É puramente programática: as requisições exigem uma chave de API paga, cobrada por tweet obtido, e não há interface gratuita de navegação. Relevante quando são necessários resultados de busca do X confiáveis em volume e existe orçamento para isso. API · key
- X API v2 (official) A interface oficial para desenvolvedores do X (Twitter), cobrindo toda a plataforma. Desde o início de 2026 funciona com um modelo de créditos por uso, sem a camada gratuita, e a busca no arquivo completo está restrita a camadas caras. Para pesquisa em arquivos, é hoje um último recurso, viável apenas para quem estiver disposto a pagar por requisição; este site apenas remete a ela, sem consultá-la.
- Meta Content Library A ferramenta de pesquisa da Meta para estudar conteúdo público do Facebook e do Instagram, sucessora do CrowdTangle, que expõe posts com mais de 100 campos de dados. O acesso é restrito a pesquisadores acadêmicos e de organizações sem fins lucrativos credenciados, que trabalham dentro do ambiente seguro da Meta após a verificação do ICPSR; não há site público nem API aberta. Listada para que pesquisadores saibam que existe uma via oficial de acesso aos dados do Facebook/Instagram; quem se qualificar deve se candidatar pelo ICPSR. bloqueio por IP
- Reveddit Mostra conteúdo do Reddit removido por moderadores ou pelo AutoModerator em um determinado usuário ou tópico. É usado na web, informando um nome de usuário ou o link de um tópico; não tem API estável. Desde a perda da fonte de dados do Pushshift, sua profundidade é muito menor, restrita sobretudo a conteúdo removido por moderadores, e o site fica atrás de um desafio antibot, portanto convém tratar os resultados como de melhor esforço. captcha
- redditsearch.io Uma interface antiga de busca do Reddit alimentada pelo arquivo do Pushshift. Com o fim do acesso público ao Pushshift, ela está praticamente inoperante para buscas, ainda que a página continue carregando. Mantida apenas por completude; para conteúdo histórico do Reddit, use o PullPush ou o Arctic Shift.
- twstalker / Sotwe (X viewers) Visualizadores de terceiros (twstalker, Sotwe e similares) que raspam o X/Twitter e reexibem os tweets recentes de um perfil sem login. A cobertura se limita a um perfil por vez e a posts recentes, acessados abrindo o site em um navegador. Esses raspadores são frágeis e frequentemente bloqueados — nossas verificações encontraram erros e desafios antibot —, portanto convém tratá-los como alternativa ocasional, não como fonte confiável. captcha
- Picuki (IG viewer) Um visualizador anônimo do Instagram para navegar por perfis, posts e stories públicos sem conta. Funciona puramente como site, sem API, em um cabo de guerra constante com as defesas do Instagram. Útil para uma olhada rápida e sem login em uma conta pública do IG, mas fica atrás de desafios antibot e quebra de forma intermitente. captcha
- Imginn (IG viewer) Um visualizador e downloader sem login para posts e stories públicos do Instagram. Funciona apenas pelo navegador, sem API e, como os demais visualizadores de IG, baseia-se em raspagem e é frágil. Nossas verificações de disponibilidade o encontraram bloqueado ou sob desafio, portanto convém ter alternativas à mão caso ele não carregue. captcha
- AnonyIG (IG story viewer) Um entre uma classe de visualizadores anônimos de stories e destaques do Instagram que não exigem login. É usado diretamente no navegador para ver os stories de uma conta pública; não há API. O Instagram quebra ativamente esses serviços — nossas verificações encontraram bloqueios legais e erros —, portanto conte com testar vários visualizadores semelhantes até que um funcione. bloqueio por IP
- Bluesky Firehose / Jetstream O fluxo de eventos em tempo real do Bluesky, cobrindo toda a rede conforme ela acontece; o Jetstream é o serviço complementar que entrega o mesmo fluxo em JSON mais simples. É um feed WebSocket voltado a desenvolvedores, sem chave, feito para monitoramento ao vivo e coleta de dados, e não para consultar posts antigos. Relevante para quem quer capturar ou acompanhar a atividade do Bluesky em tempo real. API
- 4plebs (4chan archive) Um arquivo de longa data de vários boards do 4chan (/pol/, /x/, /tv/, /adv/ e outros), com anos de histórico pesquisável em texto completo. A busca é feita pelo site; sua API JSON existe, mas as defesas antirraspagem a bloqueiam a partir de muitas redes, tornando o acesso automatizado pouco confiável. É uma fonte essencial para rastrear tópicos antigos ou apagados do 4chan nesses boards; esteja ciente de que ele contém conteúdo NSFW e extremo. Redes sociais bloqueio por IP
- archived.moe (4chan) Um arquivo do 4chan notável pela cobertura incomumente ampla de boards e pelo grande histórico. Conte com usar o site diretamente: tecnicamente existe uma API, mas as defesas antibot bloqueiam clientes automatizados tanto nas páginas quanto na API. Vale consultá-lo quando um tópico não estiver no Desuarchive ou no 4plebs, embora suas proteções antirraspagem possam atrapalhar também visitas comuns; não deve ser confundido com o já extinto archive.moe. captcha
- Software Heritage Um arquivo universal de código-fonte, a “Biblioteca de Alexandria do código”, que preserva mais de 20 bilhões de arquivos-fonte únicos de mais de 350 milhões de projetos. É possível buscar projetos, consultar arquivos por hash (sha1/sha256/git) e resolver identificadores permanentes SWHID, no site ou por sua API REST sem chave. É o lugar a procurar quando um repositório sumiu do host original ou quando é preciso identificar um arquivo pelo hash. Software e pacotes API
- Wikimedia Commons O maior repositório de mídia com licença livre, com mais de 110 milhões de arquivos, por trás da Wikipédia e de seus projetos irmãos. Tudo é pesquisável no site, e a API padrão do MediaWiki oferece a mesma busca sem chave. Recorra a ele quando precisar de imagens e outras mídias com licença aberta, fontes e licenciamento documentados. Imagens API
- Openverse Um buscador do projeto WordPress que abrange mais de 800 milhões de imagens e arquivos de áudio com licença aberta ou em domínio público, reunidos de muitas coleções de origem. A busca pode ser feita no site ou por sua API sem chave. Ideal para quem quer mídia reutilizável e uma única consulta sobre muitas coleções abertas, em vez de visitar cada uma delas. Imagens API
- Internet Archive (Video) O acervo de vídeo do Internet Archive: milhões de itens entre filmes, televisão e material efêmero. A busca e os metadados estão disponíveis pelo site ou pela API de busca sem chave do archive.org. É uma fonte primária para imagens antigas, obscuras ou de outro modo desaparecidas; compartilha as quedas intermitentes e a limitação de requisições do Internet Archive em 2026, portanto pode ser necessário repetir a consulta de vez em quando. Vídeo, áudio e música API
- Internet Archive (Audio) / Live Music Milhões de itens de áudio abertos no Internet Archive, incluindo o Live Music Archive, com mais de 250.000 shows gravados legalmente. É pesquisável no site, com a mesma API de busca e metadados sem chave do restante do archive.org. A primeira parada para gravações ao vivo, transmissões antigas e outros áudios difíceis de encontrar em qualquer outro lugar. Vídeo, áudio e música API
- YouTube via Wayback Machine Mais uma técnica de recuperação do que um site à parte: consultar capturas antigas de páginas de vídeo do YouTube na Wayback Machine para recuperar os metadados, títulos e miniaturas de vídeos apagados ou alterados. Verifica-se a existência de uma captura pela API de disponibilidade do Wayback e, em seguida, abre-se a própria página arquivada. A cobertura se limita às URLs de exibição que a Wayback Machine tenha salvado, e normalmente se recupera a página, e não o fluxo reproduzível; combine com o Filmot ou o Ghostarchive na caça a um vídeo perdido. API
- Dailymotion Um grande serviço ocidental de hospedagem de vídeo, com centenas de milhões de vídeos e busca notavelmente estável por sua Graph API pública sem chave. Em nossa pesquisa sobre onde ressurgem os vídeos desaparecidos do YouTube, destacou-se como a melhor fonte de republicações de acesso aberto. Vale pesquisar nele em busca de uma cópia de um vídeo que sumiu do YouTube; aqui, por enquanto, é oferecido como link para o site. Vídeo, áudio e música
- RuTube O principal serviço de hospedagem de vídeo da Rússia, com dezenas de milhões de vídeos; nossa pesquisa encontrou uma sobreposição de cerca de 4% com republicações do YouTube. A busca funciona no site, embora seu endpoint informal de busca limite requisições e apresente captchas diante de rajadas de tráfego automatizado. Vale consultar quando um vídeo em russo ou relacionado à Rússia desaparece do YouTube. Vídeo, áudio e música captcha
- VK Video O braço de vídeo do VKontakte, com bilhões de clipes e alto potencial para encontrar republicações em russo. A maior parte fica atrás de um muro de login: a busca web exige conta, e a API oficial exige um aplicativo registrado e um token de acesso. Vale consultá-lo na caça a conteúdo em vídeo da esfera russa, mas conte com fazer login para pesquisar. bloqueio por IP
- Odysee Uma plataforma de vídeo construída sobre o protocolo LBRY, com dezenas de milhões de itens e acesso notavelmente aberto — sem captchas nem muros de login em nossa pesquisa. A busca pode ser feita diretamente no site. É uma boa candidata a republicações quando um vídeo foi removido de plataformas convencionais. Vídeo, áudio e música
- Rumble Um serviço de hospedagem de vídeo dos EUA com centenas de milhões de itens. Não tem API pública estável e bloqueia tráfego de data center, portanto a busca deve ser feita diretamente no site, a partir de uma conexão comum. Vale incluí-lo em varreduras por serviços de vídeo em busca de republicações de conteúdo que desapareceu de outros lugares. Vídeo, áudio e música bloqueio por IP
- BitChute Um serviço independente de hospedagem de vídeo com milhões de vídeos. Não há API pública estável e a página de busca está protegida por um hCaptcha contra visitantes automatizados, portanto a busca deve ser feita manualmente no navegador. É parada obrigatória ao varrer plataformas de vídeo alternativas em busca de cópias de imagens removidas ou difíceis de encontrar. Vídeo, áudio e música captcha
- OK.ru Video O braço de vídeo do Odnoklassniki, uma grande rede social russa que hospeda centenas de milhões de clipes. Interessa sobretudo como lugar onde imagens em russo ou republicações de vídeos desaparecidos podem sobreviver. Não há rota de consulta aberta — a API oficial exige um aplicativo registrado e uma chave —, portanto usa-se a busca do próprio site por meio de um link direto. Atualmente degradado: o site retorna resultados vazios a conexões automatizadas, então a busca deve ser feita manualmente em um navegador. bloqueio por IP
- Bilibili A maior plataforma de vídeo da China, com centenas de milhões de vídeos. Para quem pesquisa arquivos, ela importa como possível abrigo de reuploads e de material em chinês que não existe em nenhum outro lugar. Não há API em inglês sem chave, e a busca a partir de fora da China é barrada por verificações geográficas e captchas, portanto este é um recurso do tipo “siga o link”: abra o site e pesquise por lá. Vídeo, áudio e música captcha
- Torrents-CSV Um mecanismo de busca de torrents aberto, construído sobre um conjunto de dados CSV mantido pela comunidade, que indexa milhões de torrents; o serviço inteiro também pode ser auto-hospedado. Ele expõe uma API JSON simples e sem chave, então as buscas rodam automaticamente e devolvem resultados limpos. Útil para verificar se um arquivo ou lançamento que desapareceu da web ainda circula no BitTorrent. Ele apenas entrega links para torrents, então avalie a legalidade de qualquer coisa que você baixar. Torrents API
- Academic Torrents Uma plataforma para distribuir conjuntos de dados de pesquisa e dados acadêmicos por BitTorrent, com petabytes de material compartilhado legitimamente. É possível pesquisar e navegar pelas coleções livremente, e as leituras não exigem chave nem conta. Recorra a ela quando um grande conjunto de dados público for mais fácil de obter como torrent do que a partir de um servidor institucional lento ou frágil. Torrents API
- The Pirate Bay (apibay) O índice geral de torrents mais antigo em atividade, com um catálogo muito extenso em todos os tipos de conteúdo. A via prática de acesso é o apibay.org, seu backend de busca em JSON sem chave, já que o site principal é amplamente bloqueado pelos provedores. Pesquisadores o utilizam para verificar se softwares, mídias ou documentos desaparecidos ainda circulam como torrents. Os resultados apontam em grande parte para material protegido por direitos autorais; trate-os apenas como links. Torrents API
- Nyaa O principal índice de torrents de animes e mídias do Leste Asiático. Seu feed RSS funciona também como uma API de consulta simples e sem chave, e os resultados levam às páginas dos torrents. É o lugar para procurar fansubs antigos, lançamentos fora de catálogo e mídias japonesas que nunca ganharam edição ocidental. Como em qualquer índice de torrents, trate os resultados como links de legalidade variável. Torrents API
- SauceNAO A busca reversa de imagens de fato para animes, mangás e fan art, indexando bilhões de imagens de fontes como Pixiv e Danbooru. Envie uma imagem ou a URL de uma imagem e ele identifica de onde veio a obra; existe uma API JSON, mas ela exige uma chave gratuita mediante registro. Indispensável quando é preciso rastrear uma ilustração até o artista original ou a primeira publicação. Imagens API · key
- VirusTotal A consulta canônica de arquivos por hash: agrega vereditos de antivírus e análises de sandbox para bilhões de arquivos, URLs e domínios. Cole um hash ou uma URL no site para obter um relatório consolidado, ou use a API JSON com uma chave gratuita para consultas automatizadas. Quem pesquisa arquivos recorre a ele para identificar um arquivo misterioso ou verificar se um hash corresponde a malware conhecido antes de manipulá-lo. Arquivo por hash API · key
- MalwareBazaar (abuse.ch) Um repositório gratuito de amostras de malware da abuse.ch, com milhões de amostras pesquisáveis por hash, etiqueta ou assinatura de malware. As consultas passam por sua API, que agora exige uma Auth-Key gratuita da abuse.ch (uma única chave cobre os serviços relacionados). Use-o quando tiver o hash de um arquivo suspeito e quiser saber se ele é uma amostra catalogada, ou quando precisar da própria amostra para análise. API · key
- URLhaus (abuse.ch) O banco de dados de URLs de distribuição de malware da abuse.ch, com milhões de links maliciosos pesquisáveis por URL, host ou hash de payload. As consultas rodam por uma API simples que usa a mesma Auth-Key gratuita da abuse.ch dos demais serviços. Consulte-o quando quiser saber se uma URL encontrada em uma página arquivada ou em um conjunto de dados antigo era conhecida por distribuir malware. API · key
- ThreatFox (abuse.ch) Uma plataforma aberta de compartilhamento de indicadores de comprometimento da abuse.ch, que cataloga milhões de IPs, domínios, hashes e URLs ligados a malwares nomeados. É consultada por sua API com a Auth-Key gratuita da abuse.ch. Útil para situar um artefato em contexto: pesquise um hash ou domínio e descubra a qual família ou campanha de malware ele já foi associado. API · key
- Triage (tria.ge) Um sandbox automatizado de malware operado pela Recorded Future, com um grande corpus público de amostras analisadas. Os relatórios públicos são pesquisáveis por hash de arquivo, e o acesso à API usa um token de uma conta Researcher gratuita. Um bom passo seguinte depois de uma consulta de hash em outro serviço, quando se quer ver o que uma amostra realmente faz ao ser executada. API · key
- MalShare Um repositório público e comunitário de malware com milhões de amostras, que oferece busca por hash e download de amostras. Sua API direta exige chave, mas é gratuita: o cadastro autônomo concede 2.000 chamadas por dia. Uma alternativa de barreira mais baixa aos repositórios restritos a convidados quando é preciso verificar ou recuperar uma amostra por hash. API · key
- Maltiverse Um agregador de inteligência de ameaças para checar IPs, domínios, URLs e hashes de arquivos contra um grande conjunto combinado de IOCs. As consultas passam por sua API JSON, com chaves disponíveis em um nível gratuito. Use-o para enriquecer um artefato da sua pesquisa — um hash ou domínio extraído de uma página arquivada, por exemplo — com aquilo que os feeds de ameaças coletivamente sabem a respeito dele. API · key
- Flickr Um dos maiores arquivos de compartilhamento de fotos da web, com bilhões de fotos, um poço profundo de fotografia histórica e comunitária. A busca funciona no site, e existe uma API REST madura para acesso com chave. Vale pesquisar quando você procura fotografias originais de lugares, eventos ou comunidades da web mais antiga. Degradado para novas integrações: chaves de API novas agora exigem uma assinatura paga do Flickr Pro (as chaves existentes continuam funcionando), então conte com a interface web. API · key
- Imgur Um grande serviço de hospedagem de imagens que por muito tempo funcionou como o backend de imagens padrão do Reddit e de incontáveis fóruns. Envios antigos podem ser recuperados pelo ID da imagem, no site ou por uma API que exige um Client-ID gratuito. Ele importa sobretudo para resolver links do imgur encontrados em discussões arquivadas. Tenha em mente que seu valor arquivístico caiu após a limpeza de conteúdo anônimo de 2023: muitos IDs antigos não retornam mais nada, então confirme que um link ainda resolve antes de depender dele. API · key
- DeviantArt Uma comunidade de arte on-line de longa data que hospeda centenas de milhões de obras. É possível pesquisar e navegar livremente no site, e uma API baseada em OAuth cobre a navegação e a busca públicas para aplicativos registrados. Pesquisadores vêm até aqui para rastrear a procedência de uma obra, recuperar a galeria pública de um artista ou datar uma fan art. API · key
- Freesound Um banco de dados colaborativo com mais de 650.000 amostras e efeitos sonoros licenciados em Creative Commons. A busca funciona no site, e há uma API JSON limpa disponível com um token gratuito. A parada natural quando se precisa de um clipe sonoro com licença clara ou se quer rastrear a origem de uma amostra amplamente reutilizada. API · key
- Yandex Images A busca reversa de imagens da Yandex, tida como a melhor da categoria para rostos e imagens visualmente semelhantes, apoiada em um índice de vários bilhões de imagens. Você envia a URL de uma imagem e revisa as correspondências na interface web; não há API oficial, e o uso automatizado dispara captchas, então ela funciona como um link de repasse. Uma parada padrão em OSINT quando a busca reversa do Google não devolve nada, especialmente para fotografias de pessoas. Imagens captcha
- Google Images / Lens A maior busca reversa e visual de imagens do mundo, com o Lens acrescentando reconhecimento de objetos e de texto. Funciona apenas via web, não há API pública, então você mesmo envia uma imagem ou cola uma URL. Ainda é o primeiro movimento padrão para identificar a origem de uma imagem, seu tema ou outros lugares onde ela aparece on-line. Imagens captcha
- TinEye O mais antigo motor dedicado de busca reversa de imagens, indexando mais de 70 bilhões de imagens e especializado em cópias exatas e editadas, incluindo a aparição indexada mais antiga de uma imagem. A busca web é gratuita para uso manual; a API é paga, portanto não há caminho automatizado aqui. É especialmente valioso quando você precisa datar uma imagem ou determinar onde ela surgiu pela primeira vez. Imagens
- Bing Visual Search A busca visual e reversa de imagens da Microsoft. A interface web ainda funciona para comparar uma imagem com o índice do Bing, mas o uso é apenas manual. Serve como segunda opinião ao lado do Google e da Yandex na busca reversa de uma imagem. Degradado: a API programática foi desativada em agosto de 2025, junto com o restante das APIs de busca do Bing. Imagens
- IQDB Uma busca reversa de imagens combinada nos principais image boards booru. Danbooru, Gelbooru, Zerochan e outros, cobrindo dezenas de milhões de imagens etiquetadas em estilo anime. Você fornece uma imagem ou URL e ele consulta todos os serviços de uma vez; a saída é HTML puro, sem API. A forma mais rápida de encontrar a fonte catalogada e etiquetada de uma imagem de anime quando o SauceNAO deixa dúvidas. Imagens
- ascii2d Um motor japonês de busca reversa de imagens que compara por assinaturas de cor e de características, particularmente forte em obras do Pixiv e do Twitter. Funciona apenas via web, sem API. Vale a tentativa para fan art japonesa quando os motores de busca reversa mais conhecidos falham. O estado é incerto: ele esteve inacessível a partir da nossa infraestrutura durante os testes, e conexões de fora do Japão costumam ser bloqueadas, então espere dificuldades de acesso. bloqueio por IP
- Karma Decay Uma busca reversa de imagens restrita inteiramente ao Reddit: forneça uma imagem e ele revela publicações anteriores da mesma figura em todo o site. É um site simples, sem API. Prático para rastrear quando e onde uma imagem circulou pela primeira vez no Reddit. Atualmente degradado: o site expirou por tempo limite em nossas verificações, e sua atualidade é limitada desde que o Reddit restringiu o acesso aos dados, então trate-o como uma aposta remota.
- PimEyes Um mecanismo de busca por reconhecimento facial que cobre cerca de 3,5 bilhões de imagens de rostos da web aberta: envie a foto de um rosto e ele encontra outras imagens da mesma pessoa. Funciona somente pelo site, e ver os resultados de fato exige uma assinatura paga; não há API pública. Usado em pesquisas de identificação de pessoas quando a busca reversa de imagens comum não é sensível o bastante a rostos. captcha
- Photobucket Um serviço de hospedagem de imagens legado com bilhões de fotos da web mais antiga, quando ele estava por trás de incontáveis posts de fóruns e blogs. Não há API, e boa parte do arquivo é difícil de alcançar: imagens em hotlink costumam exibir espaços reservados e álbuns antigos estão atrás de paywall. Ainda assim, ele é ocasionalmente o único lar sobrevivente de uma imagem antiga de fórum, então uma verificação manual pode compensar. Degradado: espere conteúdo quebrado ou bloqueado com frequência.
- Pinterest Um serviço de descoberta visual com bilhões de imagens fixadas, que muitas vezes preservam cópias de figuras cujas fontes originais desapareceram. Não há API pública de busca de imagens — a oficial é restrita por OAuth a aplicativos comerciais aprovados —, e a navegação casual esbarra em muros de login, então use-o por link direto. Ocasionalmente útil para encontrar uma cópia sobrevivente de uma imagem perdida em seu site original. bloqueio por IP
- Google Arts & Culture O portal do Google para obras de arte e exposições culturais em alta resolução, com milhões de itens de mais de 2.000 museus e instituições. Tudo passa pela interface web; não há API pública. Útil para pesquisar obras de arte, artefatos ou exposições, sobretudo quando imagens em alta resolução com zoom são importantes. Degradado apenas no sentido programático: suas ferramentas para desenvolvedores foram desativadas, então a navegação manual é o caminho.
- Tube Archivarix Localizador de vídeos excluídos do YouTube da própria Archivarix e serviço irmão deste site. A partir de um ID de vídeo, ele procura reuploads ativos do vídeo excluído em sites espelho, mostra os metadados arquivados do vídeo e oferece busca por título em seu índice de metadados do YouTube. Por ser um serviço próprio, está totalmente integrado aqui, sem necessidade de chave ou configuração. A primeira parada quando um link do YouTube está morto e se quer ou os dados do vídeo ou uma cópia sobrevivente. Vídeo, áudio e música
- Filmot Um índice pesquisável de metadados e legendas do YouTube que abrange centenas de milhões de vídeos, incluindo os que já foram excluídos ou tornados privados. É possível pesquisar os metadados dos vídeos e até palavras ditas nas legendas pela interface web gratuita; a API informal precisa de uma chave emitida pelo operador. Seu valor único está em revelar detalhes de vídeos excluídos do YouTube, que muitas vezes não sobrevivem em nenhum outro lugar. Atualmente degradado: as páginas de vídeo ficam atrás de uma barreira da Cloudflare contra conexões automatizadas, então conte com uma navegação manual. Vídeo, áudio e música captcha
- Ghostarchive (video) Um arquivador sob demanda alimentado por usuários, notável por preservar vídeos do YouTube e do Twitter além de páginas comuns. Não há API de busca; abrem-se as páginas de arquivo diretamente pelo ID ou navega-se por sua seção do YouTube. Vale a checagem em qualquer caça a vídeos excluídos, ao lado do Filmot e da Wayback Machine, já que às vezes ele guarda uma cópia realmente reproduzível, e não apenas metadados. Vídeo, áudio e música
- ANY.RUN Um sandbox de malware online e interativo cujo feed público de relatórios torna um grande acervo de análises livremente navegável. A busca e a leitura dos relatórios públicos acontecem no site; a API é restrita a planos pagos. Recorra a ele quando quiser ver como um arquivo suspeito se comporta ao ser executado, sem executá-lo você mesmo.
- Hybrid Analysis O portal comunitário do Falcon Sandbox da CrowdStrike, com um grande acervo público de análises de malware pesquisável por hash de arquivo. O site em si é protegido por captcha, então o caminho viável é sua API, com chave obtida por meio de uma conta gratuita. Uma parada sólida para verificar se um hash já foi analisado e o que o sandbox observou. API · key captcha
- VirusShare Um repositório apenas por convite com dezenas de milhões de amostras de malware, com consulta por hash e download de amostras para membros. Entrar significa escrever ao operador pedindo uma conta; a API igualmente exige a chave de membro. Pesquisadores recorrem a ele quando precisam da amostra real por trás de um hash conhecido e os repositórios abertos não a possuem. captcha
- BTDigg (btdig.com) Um mecanismo de busca de torrents que rastreia a própria DHT do BitTorrent, indexando centenas de milhões de torrents e retornando apenas links magnet. É um site em HTML simples, sem API, divulgado principalmente como um serviço Tor. Bom para encontrar conteúdo que ainda tem seeds, mas não está listado em nenhum índice de torrents convencional. Degradado: seu endereço na clearnet é instável, então espere disponibilidade intermitente e, como sempre acontece com torrents, os resultados são apenas links. Torrents bloqueio por IP
- SolidTorrents Um mecanismo de busca baseado em DHT sobre dezenas de milhões de torrents e seus metadados. É apenas web, sem API oficial, e seu domínio muda periodicamente. Mais uma alternativa para verificar se algo ainda circula no BitTorrent quando os grandes índices não retornam nada. O status é incerto: ele respondeu apenas via proxy em nossas verificações, e o domínio ativo atual deve ser confirmado antes de depender dele. Torrents bloqueio por IP
- Snowfl Uma ferramenta de metabusca para torrents: em vez de manter índice próprio, consulta vários indexadores de torrents ao mesmo tempo e agrega os resultados. Não há API, então usa-se sua interface web diretamente; daqui ele é apresentado apenas como um link externo. Vale a parada quando se quer uma única consulta espalhada por vários índices de torrents em vez de checar cada um manualmente, embora bloqueie algumas faixas de IP e o site dependa fortemente de JavaScript. bloqueio por IP
- TorrentGalaxy Um índice de torrents de uso geral com uma comunidade associada, cobrindo um grande catálogo de torrents. Não tem API oficial; a busca é feita em seu próprio site, ao qual apenas apontamos, sem consultá-lo. Pesquisadores que rastreiam arquivos distribuídos via BitTorrent podem usá-lo como um entre vários índices a checar. Atualmente degradado: o site enfrenta instabilidade e pressão de bloqueio desde 2025, então confirme qual domínio está ativo antes de depender dele. bloqueio por IP
- 1337x Um dos índices gerais de torrents com mais tráfego na web, com um catálogo muito grande. Não existe API oficial, então a busca acontece no próprio site; oferecemos apenas o link externo. É uma primeira parada comum ao procurar um torrent de quase qualquer tipo de arquivo, mas saiba que ele é bloqueado por provedores em muitas regiões, de modo que pode ser preciso um espelho ou proxy para alcançá-lo. Torrents bloqueio por IP
- Bitmagnet (self-host) Diferentemente das outras entradas de torrents, este é um software que você mesmo executa: um rastreador auto-hospedado que escuta a DHT do BitTorrent e constrói o seu próprio índice de torrents. O que ele contém depende inteiramente do seu próprio rastreamento; não há site público nem banco de dados compartilhado para pesquisar. Em funcionamento, expõe uma interface GraphQL e torznab local na sua própria máquina. Recorra a ele se quiser uma visão independente e sob controle próprio do que circula na DHT, em vez de depender de sites de índice públicos.
- GH Archive Um registro contínuo da atividade pública no GitHub: a linha do tempo pública de eventos vem sendo arquivada de hora em hora desde 2011, somando bilhões de eventos. É um conjunto de dados em massa, e não um site de busca: baixam-se arquivos JSON em gzip por hora ou consulta-se o conjunto de dados público no BigQuery; não há API de busca por registro nem formulário de busca web. Pesquisadores recorrem a ele para analisar ou reconstruir offline a atividade histórica do GitHub.
- Sourcegraph (public code search) Busca de código em milhões de repositórios públicos, permitindo encontrar onde um trecho, identificador ou cadeia de texto aparece em qualquer ponto do código aberto. A busca é feita pela interface web; um endpoint GraphQL também responde a consultas públicas sem token. Útil sempre que uma pergunta abrange muitas bases de código ao mesmo tempo, e não um único projeto. O futuro do nível público gratuito é incerto após a virada da empresa para o código fechado, então trate-o como uma conveniência que pode mudar.
- ccMixter Um site comunitário de música, remixes, samples e a cappellas licenciados em Creative Commons, na ordem de dezenas de milhares de faixas CC. A busca e a navegação acontecem no próprio site; existe uma API de consulta legada, mas ela falhou em nossas verificações. É o lugar onde procurar stems e remixes musicais reutilizáveis e abertamente licenciados. O status é atualmente incerto: o site esteve inacessível em sondagens repetidas e pode estar fora do ar, então volte a checar se ele não carregar.
- GifCities (GeoCities GIFs) Um mecanismo de busca dedicado aos GIFs animados salvos do GeoCities, reconstruído em 2025 com busca semântica. Digite um termo e ele retorna os GIFs correspondentes do acervo resgatado; seu endpoint de busca aberto também permite que este site o consulte diretamente. Recorra a ele ao pesquisar a estética da web dos anos 1990 ou ao caçar uma peça específica da imagética da web primitiva. Imagens API
- OoCities Um espelho e ressurreição de páginas do GeoCities salvas antes do encerramento do serviço, navegável pelos caminhos de bairro originais. Não há API; navega-se ou usa-se o formulário de busca no próprio site, ao qual apontamos. Útil quando se precisa revisitar uma página pessoal específica do GeoCities ou perambular pela antiga estrutura de bairros tal como ela era.
- GeoCities.ws Mais um espelho do GeoCities, combinado com hospedagem gratuita em estilo retrô, de modo que páginas arquivadas convivem com páginas recém-hospedadas. Não tem API: use a navegação e o formulário de busca do site pelo link fornecido. Prático como um segundo lugar para checar quando uma página do GeoCities falta nos outros espelhos. Atualmente degradado, e pode apresentar um CAPTCHA antes de liberar o acesso. captcha
- ReoCities Um dos espelhos de resgate originais criados quando o GeoCities foi encerrado em 2009, preservando as páginas salvas durante aquele esforço. A navegação e a busca acontecem no próprio site; não há API, então apontamos para o seu formulário de busca. Por ser um entre vários projetos de resgate independentes, pode guardar páginas que os outros espelhos deixaram passar, o que o torna digno de checagem quando uma página não é encontrada em outro lugar.
- IA GeoCities Collection O rastreamento dedicado do GeoCities feito pelo Internet Archive, o mesmo acervo que alimenta o GifCities. Ele é acessado pelo índice CDX da Wayback Machine restrito a geocities.com, de modo que este site pode consultá-lo diretamente e retornar listas de capturas com carimbos de data e hora. A maneira mais sistemática de encontrar cópias arquivadas de uma URL específica do GeoCities, embora as consultas possam ser lentas. API
- Cameron's World Não é uma ferramenta de busca, e sim uma obra de arte web: uma colagem interativa e curada montada com gráficos e GIFs do GeoCities. Basta visitar e rolar a página; não há API nem função de busca, por isso está listada como link. Vale a visita para sentir a cultura visual da era GeoCities, ou como ponto de partida para explorar a aparência da web amadora dos anos 1990.
- ProtoWeb Um serviço para a computação vintage: um proxy HTTP que serve sites restaurados dos anos 1990 a navegadores antigos da época. Aponta-se um navegador ou emulador vintage para o proxy e navega-se pela web primitiva a partir de seu cache de sites restaurados; não há API e apenas apontamos para ele. De interesse quando se quer experimentar sites antigos no software de seu tempo. Atualmente degradado e pode exibir um CAPTCHA. captcha
- oldweb.today Permite abrir páginas web arquivadas dentro de navegadores vintage emulados, todos rodando no seu navegador moderno, com conteúdo puxado da Wayback e de outros arquivos Memento. O uso é inteiramente interativo no site: escolha um navegador e uma data, informe uma URL; não há API. Pesquisadores recorrem a ele quando o modo como uma página era renderizada importa tanto quanto o que ela dizia.
- Marginalia Search Um mecanismo de busca independente com rastreador próprio, focado na web pequena, antiga, densa em texto e não comercial. É possível pesquisar no site, e sua API pública aberta permite que este site o consulte diretamente. Recorra a ele ao caçar páginas pessoais, sites de hobby e textos longos dos cantos mais silenciosos da web, que os mecanismos convencionais tendem a soterrar. Texto completo da web API
- Wiby Um mecanismo de busca dedicado a páginas de hobby e da web primitiva, com direito a um botão “surprise me” que entrega uma página antiga aleatória. A busca é feita no próprio site ou por seu endpoint JSON simples, que este site pode consultar diretamente. Bom para a descoberta fortuita da web clássica e para encontrar pequenas páginas feitas à mão sobre um tema. Texto completo da web API
- Mojeek Um mecanismo de busca independente do Reino Unido que opera o próprio rastreador em vez de revender resultados do Bing ou do Google. A busca é feita por sua interface web comum; existe uma API paga comercial, mas ela não é usada aqui, então apontamos para o site. Útil quando se quer um índice que não se limita a espelhar a visão da web dos grandes mecanismos.
- Stract Um mecanismo de busca de código aberto, financiado pela NLnet, projetado para ser personalizável e auto-hospedável. A busca é feita em seu site; sua API pública não é documentada, então apontamos para o formulário de busca em vez de consultá-la. Uma opção quando se quer um índice independente e transparente, ou uma instância própria dele.
- Million Short Um mecanismo de busca com uma reviravolta: ele remove deliberadamente os sites mais populares dos resultados para que páginas obscuras possam aparecer. Usa-se seu formulário de busca web diretamente; não há API. Útil para escavar além dos domínios dominantes de sempre ao pesquisar um tema. Atualmente degradado, e você pode topar com um CAPTCHA. captcha
- Teclis Um índice de busca não comercial para a 'web criativa' de sites pequenos e independentes, que hoje serve como índice interno da Kagi. A busca é feita no próprio site; o acesso programático existe apenas pela API paga da Kagi, por isso ele é apresentado aqui como link, e não consultado. Vale recorrer a ele quando os buscadores tradicionais soterram os sites pequenos que você realmente procura.
- Google Groups Usenet Arquivo do Google dos newsgroups da Usenet, construído sobre a coleção DejaNews, com discussões que remontam a 1981. Está congelado e em modo somente leitura desde 2024 e não há API: a busca e a leitura acontecem pela interface web do Google Groups, para a qual apontamos. Ainda assim, é um dos lugares mais profundos para encontrar tópicos de newsgroups com décadas de idade e discussões históricas online. Textos de nicho
- Usenet Archives Um arquivo da web independente e gratuito que reúne centenas de milhões de mensagens históricas da Usenet. A busca e a leitura acontecem no próprio site; não há API, por isso ele é apresentado aqui como link. Uma alternativa ou um complemento útil ao Google Groups na hora de rastrear discussões antigas de newsgroups.
- Narkive Um arquivo da web de longa data da Usenet que permite pesquisar e ler mensagens históricas de newsgroups. Não há API; a busca é feita pelo formulário do próprio site, para o qual apontamos. Vale conferi-lo junto com os demais arquivos da Usenet, já que cada um cobre e apresenta o material de forma um pouco diferente.
- textfiles.com O arquivo curado por Jason Scott da era dos BBS: arquivos de texto, zines, documentos de phreaking e listas de BBS do mundo online anterior à web. É um site simples e navegável, sem API: a exploração é feita diretamente pelo link fornecido. Uma referência central para pesquisar a cultura BBS e os primeiros textos da vida online.
- DiscMaster (files inside old discs) Uma ferramenta notável que busca dentro dos arquivos: busca em texto completo e em nível de arquivo em milhões de arquivos antigos contidos em imagens de disco armazenadas no archive.org. Ele tem um endpoint de busca funcional, de modo que este site pode consultá-lo diretamente além de encaminhar você até lá. Recorra a ele ao caçar um programa shareware, documento ou imagem antiga específica que veio em um CD ou disquete, conteúdo que a busca web comum não enxerga. Textos de nicho API
- MobyGames Um catálogo abrangente da história dos videogames, cobrindo jogos de todas as plataformas. A busca é feita no site; existe uma API, mas ela exige chave. É a referência padrão quando se precisa do registro catalogado de um jogo específico. Atualmente em estado degradado: o site pode interpor um CAPTCHA. captcha
- IA MS-DOS / Software Library A biblioteca do Internet Archive de jogos de MS-DOS e softwares históricos, jogáveis no navegador por emulação. Ela é pesquisável pela interface advancedsearch do IA, que este site consulta diretamente, e os itens rodam no próprio navegador em archive.org. A maneira mais rápida de encontrar e efetivamente executar um software antigo sem instalar nada. Software e pacotes API
- My Abandonware Um grande banco de dados de abandonware, com jogos dos anos 80 e 90 para DOS, Windows, Amiga e consoles, oferecendo downloads ao lado das fichas de catálogo. Não há API; a busca e a navegação acontecem no próprio site, pelo link fornecido. Uma parada prática quando é preciso identificar ou obter um jogo antigo que não é mais vendido. Software e pacotes
- Europeana O agregador do patrimônio cultural europeu, que reúne mais de 50 milhões de itens digitalizados de galerias, bibliotecas, arquivos e museus da Europa. A busca é feita em seu site; também há uma API disponível com chave gratuita. A primeira parada natural quando se procura material cultural europeu digitalizado em muitas instituições de uma só vez.
- DPLA A Digital Public Library of America agrega itens digitalizados de bibliotecas, arquivos e museus de todos os Estados Unidos em um único índice pesquisável. A busca é feita em seu site; também há uma API com chave gratuita. Recorra a ela para procurar materiais históricos norte-americanos sem saber qual instituição os guarda.
- Smithsonian Open Access Registros de Open Access de todos os museus do Smithsonian, combinando metadados de acervo com mídia em CC0 que pode ser reutilizada livremente. A busca acontece no site do Smithsonian; existe uma API, com chave emitida pelo api.data.gov. Valiosa para encontrar imagens de museu reutilizáveis e registros de objetos em um só lugar. Atualmente em estado degradado: espere possíveis interrupções por CAPTCHA. captcha
- Met Museum API Os registros completos do acervo do Metropolitan Museum of Art, com metadados de objetos e imagens de acesso aberto. Ele oferece uma API pública sem chave, de modo que os dados do acervo podem ser pesquisados diretamente a partir deste site, sem nenhuma conta. Útil para pesquisa em história da arte ou para obter imagens de objetos de museu com licença aberta. As sondagens atuais o classificam como degradado, então as respostas podem ser inconsistentes. Patrimônio cultural API
- Rijksmuseum API O acervo online do museu nacional holandês, com metadados de objetos e imagens em alta resolução. A busca no acervo é feita no site do museu; há uma API disponível com chave gratuita. Uma fonte primária para pesquisar arte e história holandesas ou para procurar imagens de alta qualidade dos objetos do museu.
- Chronicling America (LoC) A coleção da Library of Congress de páginas de jornais históricos dos EUA, dos anos 1700 aos anos 1960, com texto completo em OCR, de modo que as próprias páginas são pesquisáveis. A busca é feita pelo site loc.gov, que também pode retornar JSON simples sem chave. Indispensável para encontrar coberturas jornalísticas de época, nomes e acontecimentos na imprensa norte-americana. Observe que o endereço legado chroniclingamerica.loc.gov está obsoleto; use loc.gov. API
- crt.sh (Cert Transparency) Uma janela consultável para os logs de Certificate Transparency, o registro público dos certificados TLS, o que o torna uma forma de descobrir certificados e subdomínios históricos de um domínio. A consulta é feita no site, e a mesma consulta pode retornar JSON sem chave. Pesquisadores o usam para reconstruir o histórico de infraestrutura de um domínio. Ele fica sobrecarregado com frequência e retorna erro sob carga, então repita a consulta caso ela falhe. Páginas e sites
- Censys Search Um índice de varredura de hosts e certificados em toda a internet, com papel semelhante ao do Shodan. A busca é feita por sua interface web; existe uma API com nível gratuito, mas ela exige chave, por isso o serviço é apresentado aqui como link, e não consultado. Relevante ao investigar o que um host ou domínio expõe à internet e sua pegada de certificados. Atualmente em estado degradado: o site pode colocar um CAPTCHA no caminho. captcha
- Shodan Um mecanismo de busca de dispositivos e serviços conectados à internet que também guarda banners históricos de serviço. A consulta é feita por sua própria interface web, para a qual apontamos; existe uma API oficial, mas ela exige chave e é majoritariamente paga. Pesquisadores recorrem a ele para rastrear quais serviços ou softwares um host expôs ao longo do tempo, como parte do trabalho de histórico de domínios e infraestrutura.
- Intelligence X A Intelligence X é um serviço de busca OSINT que cobre pastes, conteúdo da darkweb, vazamentos de dados e registros whois, com uma 'máquina do tempo' para material que foi removido desde então. O uso é feito pelo próprio site, por meio do nosso link; sua API exige chave e os dados mais profundos ficam atrás de planos pagos. Vale uma visita quando se persegue pastes apagados ou material vazado que os arquivos da web comuns nunca capturaram.
- Have I Been Pwned (pwned passwords) Um índice de contas e credenciais que apareceram em violações de dados conhecidas. O endpoint de intervalos do Pwned Passwords dispensa chave, então nossa busca pode consultá-lo diretamente, enquanto a API mais completa de consulta de vazamentos é paga e as verificações de contas individuais acontecem no próprio site. Use-o para confirmar se uma credencial veio à tona em um vazamento. O serviço está sinalizado como degradado em nossas últimas verificações, portanto o site pode ficar instável para acessar. API
- Ahmia (Tor index) Um mecanismo de busca na clearnet que indexa serviços ocultos .onion do Tor, com resultados filtrados contra abusos. Não há API; as consultas são feitas em seu próprio formulário de busca, para o qual apontamos. É a forma prática de descobrir conteúdo de sites onion a partir da web comum, o que o torna um ponto de partida para pesquisas ligadas à darkweb.
- APKMirror Um arquivo de versões históricas de APKs Android, que hospeda pacotes assinados e verificados. Não há API, então a navegação e a busca acontecem no próprio site, pelo link que fornecemos. Recorra a ele quando precisar de uma versão antiga de um aplicativo Android que as lojas atuais não oferecem mais. Software e pacotes
- F-Droid O repositório de aplicativos Android livres e de código aberto, que mantém um arquivo completo de versões e compila os pacotes de forma reproduzível. Seu índice de pacotes é publicado como JSON sem chave, de modo que nossa busca pode consultá-lo diretamente, além de levar você ao site. O lugar para procurar versões atuais e históricas de aplicativos Android FOSS. Software e pacotes API
- PyPI O índice de pacotes da comunidade Python, que guarda todas as versões publicadas de cada pacote junto com metadados estruturados. A busca pode ser feita no site, e sua API JSON sem chave permite que nossa busca obtenha os detalhes dos pacotes diretamente. Útil para a arqueologia de software: recuperar uma versão antiga de uma biblioteca ou consultar o histórico de versões de um pacote. Software e pacotes API
- npm registry O registro de pacotes por trás do ecossistema Node.js, com histórico completo de versões e tarballs para download de cada pacote. A API de registro subjacente dispensa chave e nossa busca a consulta diretamente. Recorra a ele para rastrear o histórico de lançamentos de um pacote JavaScript ou obter uma versão antiga. Observe que o próprio site npmjs.com atualmente desafia o tráfego vindo de redes de datacenter, de modo que links diretos para páginas de pacotes podem exibir antes uma etapa de verificação. Software e pacotes API captcha
- OldMapsOnline Um portal para descobrir mapas históricos georreferenciados guardados por instituições do mundo todo, que aponta para o acervo detentor de cada mapa. Ele oferece uma API de busca geográfica (por bounding box) e endpoints IIIF, mas nós o apresentamos como um link para seu próprio formulário de busca. Atualmente sinalizado como degradado: o site pode apresentar um CAPTCHA antes de liberar o acesso. Patrimônio cultural captcha
- David Rumsey Maps Uma das principais coleções digitalizadas de mapas históricos, que oferece digitalizações em alta resolução, muitas delas georreferenciadas, na plataforma Luna. Existem APIs parciais do Luna e IIIF, mas o caminho prático é a interface de busca do próprio site, para a qual apontamos. Uma primeira parada quando se precisa de uma digitalização de alta qualidade de um mapa antigo.
- OSM / Overpass O OpenStreetMap é o mapa do mundo editado de forma colaborativa; a API Overpass oferece consultas estruturadas somente leitura sobre seus dados, e os dumps do histórico completo preservam os estados passados do mapa. O Overpass dispensa chave (com limites de uso moderado), e nossa busca pode consultá-lo diretamente. Relevante quando é preciso saber quais feições mapeadas existem em um local, ou para investigar o histórico de edições do mapa. API
- GDELT Um projeto de monitoramento global de notícias que acompanha eventos e tom na mídia mundial, inclusive no telejornalismo. Sua API de documentos dispensa chave, de modo que nossa busca a consulta diretamente, além de oferecer o link para o site do projeto. Use-o para encontrar a cobertura jornalística de um acontecimento em muitos países e veículos de uma só vez. API
- IA TV News Archive A coleção TV News do Internet Archive torna pesquisável, pelo texto das legendas ocultas, o telejornalismo norte-americano e internacional desde 2009. É consultada pela API de busca sem chave do Internet Archive, que nosso site utiliza diretamente. Inestimável quando é preciso estabelecer quando e onde algo foi dito na televisão. Vídeo, áudio e música API
- Radio Garden Um globo interativo para sintonizar milhares de rádios ao vivo em todo o mundo. Existe uma API não oficial sem chave, que nossa busca pode consultar, além de oferecer o link para a própria interface do globo. Mais uma ferramenta de escuta ao vivo do que um arquivo, mas prática para localizar emissoras por lugar. API
- IA Live Music (etree) A coleção de música ao vivo do Internet Archive (etree) reúne gravações amadoras legais de shows ao vivo. É pesquisável pela API de busca sem chave do Archive, de modo que os resultados aparecem diretamente em nossa busca e também no archive.org. O lugar certo para procurar gravações de apresentações passadas de uma banda. Vídeo, áudio e música API
- Zenodo O repositório de finalidade geral do CERN para dados de pesquisa e software, no qual cada depósito recebe um DOI. Possui uma API de leitura sem chave, mas o serviço bloqueou nossos endereços de sondagem, de modo que, por ora, oferecemos o link para sua própria busca em vez de consultá-la. Recorra a ele ao caçar conjuntos de dados, versões de software ou materiais suplementares por trás de pesquisas publicadas. Seu status é incerto apenas do nosso ponto de observação; sabe-se que está operacional em outros lugares, portanto o link deve funcionar para você. Conjuntos de dados
- Figshare Um repositório em que pesquisadores depositam conjuntos de dados, figuras, pôsteres e outros produtos suplementares. Sua API de leitura dispensa chave e nossa busca a consulta diretamente, ou é possível navegar pelo site. Útil quando os dados por trás de um artigo foram publicados separadamente do artigo em si. Conjuntos de dados API
- Harvard Dataverse A instância Harvard da plataforma Dataverse, um grande repositório de dados de pesquisa. A API de busca dispensa chave e nossa busca a consulta diretamente; o site oferece a mesma busca para navegação. Uma parada obrigatória na procura por conjuntos de dados acadêmicos. Conjuntos de dados API
- OSF O Open Science Framework é uma plataforma de colaboração em pesquisa que hospeda materiais de projetos, dados e um registro de preprints. Sua API de leitura dispensa chave, o que permite que nossa busca a consulte diretamente. Útil para encontrar preprints e materiais de projetos de pesquisa que nunca chegaram a periódicos. Conjuntos de dados API
- Hugging Face Datasets O maior hub de conjuntos de dados de aprendizado de máquina (e de modelos), cada um com metadados abundantes. Uma API sem chave fornece os resultados de busca, que nosso site consulta diretamente, e tudo pode ser navegado no site. O lugar padrão para procurar quando se precisa de um conjunto de dados de ML publicado ou de sua documentação. Conjuntos de dados API
- Archive of Our Own O Archive of Our Own, mantido pela Organization for Transformative Works, é o maior arquivo de fan fiction. Não tem API oficial por questão de política, portanto oferecemos o link para sua própria interface de busca e filtragem. Essencial para qualquer pesquisa sobre obras de fãs. Atualmente sinalizado como degradado: espere uma etapa de verificação do navegador antes de o site carregar. Textos de nicho captcha
- FanFiction.Net Um site veterano de fan fiction cujos acervos datam da era anterior ao AO3. Não há API e o site fica atrás da Cloudflare, portanto é apresentado como um link para seu formulário de busca. Vale a consulta para obras de fãs mais antigas daquele período inicial. Sinalizado como degradado: pode ser necessário passar por um desafio de verificação para entrar. captcha
- Fanlore Uma wiki mantida pela Organization for Transformative Works que documenta a história dos fãs, os fandoms e a terminologia dos fãs. Por ser um site MediaWiki, dispõe da API padrão sem chave, mas atualmente a apresentamos como um link para sua própria busca. É a obra de referência para entender o contexto de fandom em torno de obras de fãs arquivadas. Sinalizado como degradado: o site pode submeter o navegador a um desafio antes de carregar. captcha
- WikiTeam dumps Dumps preservados de mais de 600.000 wikis, incluindo comunidades Fandom/Wikia e sites MediaWiki de nicho, armazenados no Internet Archive. A coleção é pesquisável pela API de busca sem chave do Archive, que nosso site utiliza diretamente. O lugar certo para procurar quando uma wiki desapareceu e é preciso recuperar seu conteúdo. Textos de nicho API
- Discogs Um banco de dados colaborativo de lançamentos musicais e prensagens físicas, aliado a um marketplace. Sua API de busca exige um token, portanto o apresentamos como um link para a busca do próprio site. A referência padrão para discografias e para identificar uma prensagem específica de um lançamento. Sinalizado como degradado: um CAPTCHA pode se interpor entre você e o site. captcha
- MusicBrainz Uma enciclopédia musical aberta que atribui identificadores canônicos (MBIDs) a artistas e lançamentos. Sua API de webservice dispensa chave, tem limite de uma requisição por segundo, e nossa busca a consulta diretamente. A fonte de referência para metadados musicais limpos e estruturados. Vídeo, áudio e música API
- Genius Um banco de dados de letras de músicas acompanhadas de anotações. Sua API de busca exige um token OAuth, portanto oferecemos o link para a busca do próprio site em vez de consultá-la. Útil para determinar com precisão as letras e o contexto anotado em torno delas.
- CourtListener / RECAP Um arquivo gratuito de jurisprudência dos EUA, de documentos judiciais reunidos do PACER pelo projeto RECAP e de áudio de sustentações orais. Sua API REST de busca funciona sem chave (um token amplia os limites de requisições), e nossa busca a consulta diretamente. A primeira parada para localizar registros judiciais norte-americanos sem custo. Patrimônio cultural API
- PatentsView (USPTO) Um serviço de dados de patentes do USPTO cujo traço distintivo são os registros desambiguados de inventores e titulares. A API de busca exige uma chave gratuita e consultas estruturadas, portanto, por ora, oferecemos o link para sua interface de busca em vez de consultá-la diretamente. Útil quando se quer acompanhar as patentes de um inventor ou de uma empresa específica, e não apenas fazer correspondência de documentos por palavra-chave.
- Google Patents Busca de patentes em texto completo abrangendo escritórios de patentes do mundo inteiro, além de literatura não patentária. Não há API oficial (os dados estão disponíveis separadamente como um conjunto de dados público no BigQuery), portanto a pesquisa é feita no próprio site por meio do nosso link. Uma das interfaces únicas mais práticas para consultas globais de patentes. Artigos acadêmicos
- Espacenet / EPO OPS A busca mundial de patentes do Escritório Europeu de Patentes, acompanhada da API REST Open Patent Services. A API exige uma chave OAuth (existe um plano gratuito), portanto atualmente oferecemos o link para a interface de busca do Espacenet. Use-o para pesquisar o banco de dados mundial de patentes do EPO. Sinalizado como degradado: o site pode apresentar um desafio de verificação antes de carregar. captcha
- FamilySearch O maior arquivo gratuito de registros genealógicos do mundo, operado pela Igreja SUD. Sua API REST exige uma chave aprovada e login, portanto oferecemos o link para a busca de registros do próprio site. O ponto de partida gratuito padrão para pesquisa genealógica.
- pouet.net (demoscene) O banco de dados canônico da demoscene, que documenta produções, parties e grupos desde os anos 1990. Seus dados são publicados como dumps JSON periódicos (data.pouet.net), dos quais nossa busca pode se valer, ao lado da navegação e da busca do próprio site. A fonte de referência ao pesquisar lançamentos da demoscene ou o histórico de grupos. API
- 16colo.rs (ANSI/ASCII art) Um arquivo de artpacks ANSI e ASCII da artscene dos BBS, com material que remonta ao início dos anos 1990. Uma API sem chave é anunciada, mas nossa sondagem dela falhou, portanto oferecemos o link para a navegação e a busca do próprio site. O principal lar da arte preservada da era dos BBS; recorra a ele ao pesquisar a artscene ou localizar um artpack específico.
- ASCII Art Archive Uma grande biblioteca categorizada de arte ASCII clássica de imagem única. Não há API; a navegação pelas categorias é feita no próprio site, por meio do nosso link. Prática quando se quer exemplos de arte ASCII tradicional organizados por assunto.
- CyberLeninka (КиберЛенинка) A maior biblioteca científica de acesso aberto em língua russa: artigos de periódicos em texto completo de todas as áreas, de leitura gratuita e sem cadastro. A busca por título, autor ou tema é feita na interface web; não há API pública oficial, portanto este site oferece um link de busca. A primeira parada para artigos em russo que os índices ocidentais (Crossref, OpenAlex) muitas vezes não alcançam. Artigos acadêmicos
- НЭБ. National Electronic Library (rusneb.ru) A Biblioteca Eletrônica Nacional da Rússia agrega livros, periódicos e teses digitalizados da Biblioteca Estatal Russa e de instituições parceiras. As digitalizações em domínio público podem ser lidas diretamente no visualizador web; as obras protegidas por direitos autorais ficam restritas às salas de leitura. A busca no acervo é feita no site, o que é útil para impressos russos pré-revolucionários e da era soviética que não existem em nenhum outro lugar on-line. O site estava inacessível durante nossa última verificação, portanto a disponibilidade pode variar.
- End of Term Web Archive Um projeto conjunto do Internet Archive, da Library of Congress e de parceiros universitários que rastreia sites do governo federal dos EUA a cada transição presidencial. Preserva conteúdo .gov e .mil que rotineiramente desaparece quando as administrações mudam: páginas, relatórios e conjuntos de dados apagados dos sites no ar. Navegue pelo portal do projeto para chegar aos rastreamentos de cada mandato, que são reproduzidos por instâncias wayback parceiras. Recorra a ele quando uma página governamental desapareceu na época de uma eleição.