This project provides a Python script to analyze PDF files, extract text and images, and structure the content into a hierarchical JSON format.
- Extracts text elements with font styles (bold, italic), sizes, and positions.
- Extracts and saves images from PDF pages.
- Removes page numbers automatically.
- Builds a hierarchical structure with headers and paragraphs.
- Outputs structured JSON for further processing.
- PyMuPDF (fitz)
- Python 3.x
Install dependencies:
pip install PyMuPDF- U need to place pdf file with reader on one folder
- Run the script to analyze a PDF:
python reader.pyoutput.json: Raw page data with text and image metadata.(template)book_images/: Folder containing extracted images.final_book.json: Structured content with headers, paragraphs, and images.
- Извлекает текстовые элементы с стилями шрифтов (жирный, курсив), размерами и позициями.
- Извлекает и сохраняет изображения со страниц PDF.
- Автоматически удаляет номера страниц.
- Строит иерархическую структуру с заголовками и параграфами.
- Выводит структурированный JSON для дальнейшей обработки.
- PyMuPDF (fitz)
- Python 3.x
Установите зависимости:
pip install PyMuPDF- Убедитесь что pdf файл и скрипт находится в одной папке
- Запустите скрипт для анализа PDF:
python reader.pyАльтернативно, запустите весь процесс, выполнив скрипт напрямую (он запросит путь к PDF и обработает автоматически).
output.json: Сырые данные страниц с текстом и метаданными изображений.book_images/: Папка с извлеченными изображениями.final_book.json: Структурированное содержимое с заголовками, параграфами и изображениями.