Skip to content

Repository files navigation

Контроль качества продукции: статистические отчёты

Проект на R: семь Jupyter-ноутбуков. По демонстрационным данным они проходят путь от сырых измерений до точности прогнозных оценок, лабораторных панелей маркеров и средовых эффектов.

Ячейки уже выполнены: таблицы и графики сохранены внутри .ipynb. Данные в data/ синтетические.


Зачем это репозиторий

Проект отвечает на шесть практических вопросов:

  1. Можно ли подавать сырые измерения в модель как есть?
  2. Как связаны прогнозные оценки, индексы и категории изделий?
  3. Что меняется, если оставить только точные оценки?
  4. Чем объясняется точность оценки — измерениями, серией, годом, сертификацией или связанными позициями?
  5. Как из сырых лабораторных панелей собрать матрицу маркеров для смешанной модели?
  6. Какую кривую процесса и какие средовые эффекты оставлять в модели качества?

Тема нарочно нейтральная: контроль качества продукции. В данных нет отраслевых идентификаторов, только производственные показатели.


Как устроен проект

.
├── README.md
├── 01_data_preparation.ipynb         диагностика сырых измерений
├── 02_score_statistics.ipynb         корреляции и связи оценок
├── 03_score_accuracy.ipynb           то же, но только точные оценки
├── 04_score_regression.ipynb         регрессии и взаимодействия
├── 05_score_reliability.ipynb        точность оценок
├── 06_marker_panel.ipynb             лабораторные панели маркеров
├── 07_process_environment.ipynb      кривые процесса и среда
└── data/                             синтетические CSV для отчётов

Читать по номерам: 01 → 07. Каждый файл начинается с блока «О документе»: источник данных, цель, короткий результат.


Что внутри отчётов

Файл Вопрос Данные Методы
01_data_preparation.ipynb Есть ли выбросы, неоднородная дисперсия, коллинеарность? data/metric_output.csv z-score, Андерсон–Дарлинг, Levene, VIF, Краскел–Уоллис, Данн, Дарбин–Уотсон
02_score_statistics.ipynb Как связаны оценки, индексы и категории? data/scores.csv Кендалл, Шапиро–Уилк, ANOVA / Краскел–Уоллис
03_score_accuracy.ipynb Что остаётся, если accuracy ≥ 0.8? data/scores_accuracy.csv те же тесты на отфильтрованной выборке
04_score_regression.ipynb Что двигает индексы? data/scores_norm.csv, data/metric_averages.csv линейная регрессия, центрирование, glinternet
05_score_reliability.ipynb От чего зависит надёжность оценки? измерения + data/scores_accuracy.csv + data/registry.csv гистограммы, boxplot, Манна–Уитни, регрессия по категориям
06_marker_panel.ipynb Как собрать матрицу маркеров из сырых панелей? data/lab_report_2020.csv … 2023, data/marker_map.csv QC вызовов, выравнивание кодировки, call rate, индекс однородности
07_process_environment.ipynb Какие кривая и среда нужны модели? data/process_curve.csv, data/environment_raw.csv, data/process_events.csv полином, k-fold CV, фильтр остатков, Кендалл / Краскел–Уоллис, ANOVA

Показатели

Код Смысл
output производительность
related сопутствующий выпуск
frequency частота выпуска
yield выход годного
volume объём партии
defect доля брака
overall_index сводный индекс
process_index индекс процесса
product_index индекс изделия
rel_* точность соответствующей оценки
qc_score качество лабораторного вызова маркера
call rate доля успешных вызовов по маркеру или образцу
purity_index однородность панели относительно среднего
age / mass возраст процесса и измеренная характеристика партии
temp, pressure, humidity средовые ковариаты события

Категории изделия: тип (A / B), год выпуска, серия, класс, площадка, марка, метод изготовления, сертификация.


Единый стиль отчётов

  • Jupyter Notebook, ядро R.
  • Русские заголовки, английские имена переменных в обратных кавычках.
  • В начале каждого файла — паспорт отчёта, в конце — короткое заключение.

Данные

Файл Содержание
metric_output.csv измерения производительности (для диагностики и флага «есть факт»)
metric_related.csv … metric_defect.csv измерения остальных контуров
scores.csv оценки, индексы, категории
scores_norm.csv то же для регрессии
metric_averages.csv средние измерения, стыкуются по item_id
scores_accuracy.csv оценки плюс коэффициенты точности rel_*
registry.csv соответствие rec_id ↔ item_id для связанных позиций
lab_report_*.csv длинные лабораторные панели: образец, маркер, аллели, qc_score
marker_map.csv канал и позиция маркера
process_curve.csv измерения mass по возрасту процесса, заводу и марке
environment_raw.csv сырая среда: дата, текст видимости и ветра, площадка
process_events.csv trait события плюс температура, давление, влажность

About

Статистический контроль качества продукции в R: от сырых данных до объяснимых выводов

Topics

Resources

Stars

0 stars

Watchers

0 watching

Forks

Releases

Packages

Contributors

Languages