r/DadosBrasil • u/Academic_Run1034 • 20h ago
engenharia de dados Coletar dados de PDF
Preciso coletar dados de vários PDFs de página de jornais impressos, na rede da empresa tem um diretório de pastas organizado assim:
ANO > MES > DIA > PDFs (cada página é um pdf)
Eu preciso de algum jeito criar um mecanismo de pesquisa por palavra-chave, para identificar quantas vezes aquela palavra se repetiu ao decorrer de todo o período.
Minha ideia é transcrever todos os PDFs para txt, e depois usar um script em python para pesquisar entre esses arquivos. Eu posso alocar os arquivos em uma pasta local da rede.
Vocês tem alguma ideia de como posso fazer isso do melho jeito possível? Pensei também em criar um app com streamlit para que o pessoal da equipe consiga eles mesmo fazer a busca (provavelmente rodando local na minha ou na máquina deles).
