Skip to content

Latest commit

 

History

1 Commit

Folders and files

NameName
Last commit message
Last commit date
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 

Repository files navigation

PDF OCR Converter

Мощное и красивое веб-приложение для конвертации отсканированных PDF-документов в "поисковые" PDF (searchable PDF) с распознанным текстом, сохраняя при этом оригинальное оформление и изображения.

Особенности

  • Высокое качество распознавания: Использование встроенного PDF-генератора Tesseract OCR для правильной кодировки кириллицы и других языков.
  • Гибкий выбор страниц: Поддержка парсинга диапазонов (например, 1-10, 15, 20-30), а также удобные пресеты (первые 10, первая половина и т.д.).
  • Режимы разметки (PSM): Настройка алгоритма под разные типы документов (книги, таблицы, колонки).
  • Потрясающий интерфейс: Современный дизайн (Glassmorphism, темная тема), работающий прямо в вашем браузере.
  • Автоматическая установка зависимостей: Установка Tesseract OCR и Poppler прямо из веб-интерфейса в один клик.
  • Приватность: Вся обработка происходит локально на вашем компьютере. Документы никуда не отправляются.

Системные требования

  • Windows 10 / 11
  • Python 3.10+
  • Tesseract OCR (можно установить через интерфейс программы)
  • Poppler (можно установить через интерфейс программы)

Установка и запуск (для разработчиков)

  1. Клонируйте репозиторий:

    git clone <URL_репозитория>
    cd ocr_pdf_converter
  2. Установите зависимости:

    pip install -r requirements.txt
  3. Запустите приложение:

    python app.py

    Или используйте start.bat для быстрого запуска на Windows.

  4. Откройте браузер по адресу http://localhost:8000. В разделе "Настройки" программа поможет скачать и установить необходимые внешние компоненты (Tesseract и Poppler).

Использование

  1. Запустите программу и откройте интерфейс в браузере.
  2. Перетащите ваш отсканированный PDF-файл.
  3. Укажите нужные страницы для распознавания.
  4. Выберите язык и качество (DPI).
  5. Нажмите "Начать OCR обработку".
  6. После завершения скачайте готовый PDF-файл с распознанным текстом!

Лицензия

См. файл LICENSE. Распространение и копирование без разрешения запрещено.

About

No description, website, or topics provided.

Resources

Stars

0 stars

Watchers

0 watching

Forks

Releases

Packages

Contributors

Languages