Проект на R: семь Jupyter-ноутбуков. По демонстрационным данным они проходят путь от сырых измерений до точности прогнозных оценок, лабораторных панелей маркеров и средовых эффектов.
Ячейки уже выполнены: таблицы и графики сохранены внутри .ipynb. Данные в data/ синтетические.
Проект отвечает на шесть практических вопросов:
- Можно ли подавать сырые измерения в модель как есть?
- Как связаны прогнозные оценки, индексы и категории изделий?
- Что меняется, если оставить только точные оценки?
- Чем объясняется точность оценки — измерениями, серией, годом, сертификацией или связанными позициями?
- Как из сырых лабораторных панелей собрать матрицу маркеров для смешанной модели?
- Какую кривую процесса и какие средовые эффекты оставлять в модели качества?
Тема нарочно нейтральная: контроль качества продукции. В данных нет отраслевых идентификаторов, только производственные показатели.
.
├── README.md
├── 01_data_preparation.ipynb диагностика сырых измерений
├── 02_score_statistics.ipynb корреляции и связи оценок
├── 03_score_accuracy.ipynb то же, но только точные оценки
├── 04_score_regression.ipynb регрессии и взаимодействия
├── 05_score_reliability.ipynb точность оценок
├── 06_marker_panel.ipynb лабораторные панели маркеров
├── 07_process_environment.ipynb кривые процесса и среда
└── data/ синтетические CSV для отчётов
Читать по номерам: 01 → 07. Каждый файл начинается с блока «О документе»: источник данных, цель, короткий результат.
| Файл | Вопрос | Данные | Методы |
|---|---|---|---|
01_data_preparation.ipynb |
Есть ли выбросы, неоднородная дисперсия, коллинеарность? | data/metric_output.csv |
z-score, Андерсон–Дарлинг, Levene, VIF, Краскел–Уоллис, Данн, Дарбин–Уотсон |
02_score_statistics.ipynb |
Как связаны оценки, индексы и категории? | data/scores.csv |
Кендалл, Шапиро–Уилк, ANOVA / Краскел–Уоллис |
03_score_accuracy.ipynb |
Что остаётся, если accuracy ≥ 0.8? |
data/scores_accuracy.csv |
те же тесты на отфильтрованной выборке |
04_score_regression.ipynb |
Что двигает индексы? | data/scores_norm.csv, data/metric_averages.csv |
линейная регрессия, центрирование, glinternet |
05_score_reliability.ipynb |
От чего зависит надёжность оценки? | измерения + data/scores_accuracy.csv + data/registry.csv |
гистограммы, boxplot, Манна–Уитни, регрессия по категориям |
06_marker_panel.ipynb |
Как собрать матрицу маркеров из сырых панелей? | data/lab_report_2020.csv … 2023, data/marker_map.csv |
QC вызовов, выравнивание кодировки, call rate, индекс однородности |
07_process_environment.ipynb |
Какие кривая и среда нужны модели? | data/process_curve.csv, data/environment_raw.csv, data/process_events.csv |
полином, k-fold CV, фильтр остатков, Кендалл / Краскел–Уоллис, ANOVA |
| Код | Смысл |
|---|---|
output |
производительность |
related |
сопутствующий выпуск |
frequency |
частота выпуска |
yield |
выход годного |
volume |
объём партии |
defect |
доля брака |
overall_index |
сводный индекс |
process_index |
индекс процесса |
product_index |
индекс изделия |
rel_* |
точность соответствующей оценки |
qc_score |
качество лабораторного вызова маркера |
call rate |
доля успешных вызовов по маркеру или образцу |
purity_index |
однородность панели относительно среднего |
age / mass |
возраст процесса и измеренная характеристика партии |
temp, pressure, humidity |
средовые ковариаты события |
Категории изделия: тип (A / B), год выпуска, серия, класс, площадка, марка, метод изготовления, сертификация.
- Jupyter Notebook, ядро R.
- Русские заголовки, английские имена переменных в обратных кавычках.
- В начале каждого файла — паспорт отчёта, в конце — короткое заключение.
| Файл | Содержание |
|---|---|
metric_output.csv |
измерения производительности (для диагностики и флага «есть факт») |
metric_related.csv … metric_defect.csv |
измерения остальных контуров |
scores.csv |
оценки, индексы, категории |
scores_norm.csv |
то же для регрессии |
metric_averages.csv |
средние измерения, стыкуются по item_id |
scores_accuracy.csv |
оценки плюс коэффициенты точности rel_* |
registry.csv |
соответствие rec_id ↔ item_id для связанных позиций |
lab_report_*.csv |
длинные лабораторные панели: образец, маркер, аллели, qc_score |
marker_map.csv |
канал и позиция маркера |
process_curve.csv |
измерения mass по возрасту процесса, заводу и марке |
environment_raw.csv |
сырая среда: дата, текст видимости и ветра, площадка |
process_events.csv |
trait события плюс температура, давление, влажность |