diff --git a/homework/SUBMISSION.md b/homework/SUBMISSION.md index 0f6b274..93f8469 100644 --- a/homework/SUBMISSION.md +++ b/homework/SUBMISSION.md @@ -4,12 +4,13 @@ ## Ссылка на репозиторий с заданием -- Repo URL: `<вставьте ссылку на ваш репозиторий>` +- Repo URL: `https://github.com/Valdemaro2025/educational-rag-homework` ## Автор -- ФИО / ник: `<укажите>` +- ФИО / ник: `Кузнецов Владимир Петрович` ## Комментарий - Кратко: что реализовано, какие данные использованы, что улучшено. +- Реализован полный учебный RAG pipeline: ingest → chunking → TF-IDF indexing → retrieval → answer generation → Streamlit UI. Использован датасет 20 Newsgroups из scikit-learn (906 документов, 4838 чанков). Добавлены отображение источников (doc_id, score, text), механизм отказа при отсутствии релевантных данных, README с инструкцией запуска, DATA.md, IMPROVEMENTS.md и автоматические тесты (pytest). В качестве улучшений реализован переход с MVP-датасета на реальный датасет объёмом более 900 документов.