Skip to content

Latest commit

 

History

7 Commits

Folders and files

NameName
Last commit message
Last commit date
 
 
 
 
 
 

Repository files navigation

🧬 Antibody CDR3 Analysis

Анализ CDR3-последовательностей антител, полученных из NGS-скрининга. Цель - выявить признаки последовательностей, который значимо влияют на способность антител связывать антиген.

Анализ проводился в рамках тестового задания.

Задачи:

  • исследовать свойства CDR3 последовательностей
  • выделить информативные признаки
  • сравнить high и low binders
  • оценить возможность предсказания связывания с помощью простой модели

Структура данных

Датасет содержит:

  • id — идентификатор антитела
  • cdr3_sequence — аминокислотная последовательность CDR3
  • binding_score — результат скрининга (0–1)

Что сделано

Первичный анализ данных (EDA)

  • Проверка на пропуски и дубликаты
  • Анализ распределения длины CDR3
  • Подсчёт частот аминокислот

Feature engineering

Добавлены признаки:

  • cdr3_length — длина последовательности
  • hydrophobic_fraction — доля гидрофобных аминокислот
  • aromatic_fraction — доля ароматических
  • charged_fraction — доля заряженных
  • net_charge — общий заряд
  • glycine_fraction — доля глицина (гибкость)
  • proline_fraction — доля пролина (жесткость)

Статистический анализ

  • Выделены группы high binders (> 0.7) и low binders (< 0.3)
  • Проведено сравнение с помощью Mann–Whitney U test (выбран из-за малой выборки и отсутствия требования нормальности распределений)

Визуализация

Построены:

  • распределение binding_score
  • boxplot признаков для high/low binders
  • scatter plot признаков vs binding_score

Моделирование

Построены базовые модели:

  • Logistic Regression
  • Random Forest

Результаты

  • Наиболее информативные признаки:

    • доля гидрофобных аминокислот;
    • доля ароматических аминокислот;
    • доля заряженных аминокислот.
  • Статистический анализ показал значимые различия между high и low binders для большинства признаков.

  • Logistic Regression:

    • выявляет линейные зависимости;
    • чувствительна к мультиколлинеарности.
  • Random Forest:

    • учитывает нелинейные взаимодействия;
    • показал лучшие метрики качества.

Ограничения анализа

  • малый размер выборки (26 high / 44 low) → риск переобучения;
  • бинаризация binding_score → потеря информации;
  • упрощённые признаки → возможна недоиспользованная информация последовательности.

Инструменты

Python, Pandas, Numpy, Matplotlib, Seaborn, Scipy, Scikit-learn

About

Анализ последовательностей CDR3 антител

Topics

Resources

Stars

0 stars

Watchers

0 watching

Forks

Contributors

Languages