Buscador de PDFs

Procure uma palavra em todos os seus PDFs de uma vez.

Aponte para uma pasta. Ele lê cada PDF que houver ali dentro, inclusive os escaneados, e responde em qual arquivo e em qual página o termo aparece. Dois cliques abrem o documento já na página certa.

Windows 64 bits · arquivo único de 44 MB · não instala nada, não precisa de Python

Janela do programa: a busca por "contraventamento" devolveu 10 ocorrências em 3 documentos, cada um aberto nas páginas onde o termo aparece, com um trecho de contexto.

Quatro passos, uma vez só.

A leitura dos PDFs acontece uma vez por arquivo. Da segunda vez em diante o programa relê apenas o que mudou, e a busca é instantânea.

Campo Pasta preenchido com o caminho escolhido; a lista de resultados ainda está vazia e a mensagem pede para clicar em Atualizar.
Barra de progresso cheia e a mensagem: indexação concluída, 4 PDFs em 0,1 segundo.
Resultado da busca: três documentos, com a contagem de ocorrências e as páginas listadas embaixo de cada um.
A linha da página 2 aparece selecionada na lista, pronta para o duplo-clique que abre o PDF nela.

Passo 1. A pasta está definida e o índice, ainda vazio. A análise não começa sozinha.

O trabalho pesado acontece uma vez.

Ler o texto de milhares de PDFs é lento; procurar dentro de um índice já pronto não é. O programa guarda o que leu num banco SQLite dentro da própria pasta e, na vez seguinte, confere a data de cada arquivo e relê só os que mudaram. Uma pasta com mil documentos demora na primeira passada e responde na hora nas seguintes.

Cópias idênticas viram um item só

O mesmo memorial salvo em quatro pastas de obra não vira quatro resultados. O conteúdo de cada arquivo é comparado por hash, e as cópias aparecem agrupadas sob um único documento.

PDF escaneado também

Páginas que são só imagem passam por OCR e entram na busca como qualquer outra. Depende do Tesseract instalado na máquina; sem ele, o resto continua funcionando normalmente.

Acento e maiúscula não contam

Página, pagina e PÁGINA encontram a mesma coisa. Uma frase quebrada no meio pela diagramação do PDF continua sendo encontrada inteira.

Pasta de rede sem permissão de escrita

Se o programa não conseguir gravar o índice na pasta analisada — comum em unidade de rede corporativa —, ele grava ao lado do próprio executável e avisa na barra de status.

Abre no leitor que você já usa

Foxit, Adobe Acrobat e Reader, PDF-XChange, SumatraPDF e Edge abrem direto na página encontrada. Em leitores fora dessa lista o PDF abre normalmente, só sem pular a página.

Antes de baixar

O Windows vai reclamar
O executável não tem assinatura digital paga, então o SmartScreen mostra um aviso na primeira vez. Clique em Mais informações e depois em Executar assim mesmo. O código-fonte inteiro está no GitHub, se você quiser conferir antes.
Onde fica o índice
Num arquivo .pdf_search_index.sqlite3 dentro da pasta analisada. Pode apagar quando quiser: na próxima análise ele é refeito.
OCR é opcional
Para ler PDFs escaneados é preciso ter o Tesseract instalado. O programa procura sozinho nos lugares de sempre e avisa na tela se não achar.
Nada sai da sua máquina
Não há servidor, conta nem envio de arquivo. O programa lê os PDFs, grava o índice no seu disco e é só isso.

Baixe e aponte para uma pasta.

Funciona em qualquer pasta com PDFs: normas, memoriais, manuais, contratos, a papelada toda de uma obra.

Arraste para o lado para ver a janela inteira.

Portfólio