Мощное и красивое веб-приложение для конвертации отсканированных PDF-документов в "поисковые" PDF (searchable PDF) с распознанным текстом, сохраняя при этом оригинальное оформление и изображения.
- Высокое качество распознавания: Использование встроенного PDF-генератора Tesseract OCR для правильной кодировки кириллицы и других языков.
- Гибкий выбор страниц: Поддержка парсинга диапазонов (например,
1-10, 15, 20-30), а также удобные пресеты (первые 10, первая половина и т.д.). - Режимы разметки (PSM): Настройка алгоритма под разные типы документов (книги, таблицы, колонки).
- Потрясающий интерфейс: Современный дизайн (Glassmorphism, темная тема), работающий прямо в вашем браузере.
- Автоматическая установка зависимостей: Установка Tesseract OCR и Poppler прямо из веб-интерфейса в один клик.
- Приватность: Вся обработка происходит локально на вашем компьютере. Документы никуда не отправляются.
- Windows 10 / 11
- Python 3.10+
- Tesseract OCR (можно установить через интерфейс программы)
- Poppler (можно установить через интерфейс программы)
-
Клонируйте репозиторий:
git clone <URL_репозитория> cd ocr_pdf_converter
-
Установите зависимости:
pip install -r requirements.txt
-
Запустите приложение:
python app.py
Или используйте
start.batдля быстрого запуска на Windows. -
Откройте браузер по адресу
http://localhost:8000. В разделе "Настройки" программа поможет скачать и установить необходимые внешние компоненты (Tesseract и Poppler).
- Запустите программу и откройте интерфейс в браузере.
- Перетащите ваш отсканированный PDF-файл.
- Укажите нужные страницы для распознавания.
- Выберите язык и качество (DPI).
- Нажмите "Начать OCR обработку".
- После завершения скачайте готовый PDF-файл с распознанным текстом!
См. файл LICENSE. Распространение и копирование без разрешения запрещено.