Clone utilitario para sincronizar conteudo do NovaStar Drive, converter PDFs para Markdown e manter indices/logs de sync.
sync_all_files.ps1: sincroniza recursivamente arquivos do drive parafiles/download_pdfs.ps1: fluxo legado focado apenas em PDFconvert_pdfs_to_md.py: varrefiles/e converte PDFs parapdf_markdown/mantendo a hierarquiaall_files_index.txt: lista de todos os arquivos locais emfiles/pdf_index.txt: lista de PDFs locais emfiles/failed_dirs.txt: pastas que a API nao conseguiu listarfailed_files.txt: arquivos que falharam no downloadsync_report.json: resumo da ultima execucao
- Windows + PowerShell
- Python 3.10+
py -m venv .venv
Set-ExecutionPolicy -Scope Process Bypass -Force
.\.venv\Scripts\Activate.ps1
python -m pip install -U pip
python -m pip install pymupdf pymupdf4llmSet-ExecutionPolicy -Scope Process Bypass -Force
.\sync_all_files.ps1Comportamento:
- cria estrutura de pastas local em
files/ - baixa arquivos novos
- faz
SKIPquando arquivo local ja existe com mesmo tamanho - gera logs e indices
.\.venv\Scripts\python.exe .\convert_pdfs_to_md.pyComportamento:
- busca todos os
*.pdfemfiles/ - gera
*.mdespelhando a mesma estrutura empdf_markdown/ - faz
SKIPse o Markdown ja existe e esta mais novo que o PDF
Algumas pastas do servidor retornam erro 500 object not found na API publica e ficam registradas em failed_dirs.txt.
- Andre Nogueira
- andrenogrib@gmail.com