Skip to content

Repository files navigation

novastar_website_clone

Clone utilitario para sincronizar conteudo do NovaStar Drive, converter PDFs para Markdown e manter indices/logs de sync.

Estrutura

  • sync_all_files.ps1: sincroniza recursivamente arquivos do drive para files/
  • download_pdfs.ps1: fluxo legado focado apenas em PDF
  • convert_pdfs_to_md.py: varre files/ e converte PDFs para pdf_markdown/ mantendo a hierarquia
  • all_files_index.txt: lista de todos os arquivos locais em files/
  • pdf_index.txt: lista de PDFs locais em files/
  • failed_dirs.txt: pastas que a API nao conseguiu listar
  • failed_files.txt: arquivos que falharam no download
  • sync_report.json: resumo da ultima execucao

Requisitos

  • Windows + PowerShell
  • Python 3.10+

Setup Python

py -m venv .venv
Set-ExecutionPolicy -Scope Process Bypass -Force
.\.venv\Scripts\Activate.ps1
python -m pip install -U pip
python -m pip install pymupdf pymupdf4llm

Sync completo (incremental)

Set-ExecutionPolicy -Scope Process Bypass -Force
.\sync_all_files.ps1

Comportamento:

  • cria estrutura de pastas local em files/
  • baixa arquivos novos
  • faz SKIP quando arquivo local ja existe com mesmo tamanho
  • gera logs e indices

Converter PDFs para Markdown (incremental)

.\.venv\Scripts\python.exe .\convert_pdfs_to_md.py

Comportamento:

  • busca todos os *.pdf em files/
  • gera *.md espelhando a mesma estrutura em pdf_markdown/
  • faz SKIP se o Markdown ja existe e esta mais novo que o PDF

Observacao importante

Algumas pastas do servidor retornam erro 500 object not found na API publica e ficam registradas em failed_dirs.txt.

Autor

About

Clone utilitario para sincronizar conteudo do NovaStar Drive

Topics

Resources

Stars

0 stars

Watchers

0 watching

Forks

Releases

Packages

Contributors

Languages