Система аудита учебных материалов с использованием современных методов и подходов – RAG, LLM.
-
Создать питоновское окружение:
python3.14 -m venv .venv source .venv/bin/activate pip install -r requirements.txt -
Запустить
arxiv_fetcher.py– статьи должны загрузиться в папкуDataDocs:python dataScripts/arxiv_fetcher.py
-
Настроить доступ к локальной PostgreSQL‑базе
vector_database_fill.py -
В том же файле, в методе
load_and_save_database, установить аргументы:folder_path– путь к папке со статьями,save_to– произвольный путь, куда будет сохранена векторная база.
-
Запустить
vector_database_fill.py. Он чанкует PDF‑ки, загружает куски в Postgres и одновременно векторизует их в векторную базу данных. Это может занять некоторое время:python vector_database_fill.py
-
Открыть
modelAPI.py. Убедиться, что в переменных окружения есть ключ авторизации. Его можно получить здесь: https://developers.sber.ru/portal/products/gigachat-api -
Запустить
modelAPI.py, выбрав удобный для вас порт:export GIGACHAT_API_KEY="ваш_ключ" python modelAPI.py --port 8000
-
Перейти в
relational_database.py. Настроить подключение к Postgres и векторной базе, запустить на удобном порте:python relational_database.py --port 8001
-
Перейти в директорию
frontendи запустить Streamlit‑сервер:cd frontend streamlit run app.py --server.port 8501 -
Убедиться, что все выбранные порты на бэкенде и фронтенде связаны по HTTP.