Skip to content
 
 

Folders and files

NameName
Last commit message
Last commit date

Latest commit

 

History

46 Commits
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 

Repository files navigation

DataCon-2025

В этом репозитории представлен проект по генеративному дизайну молекул для лечения болезни Альцгеймера.

image

1. Сбор и обработка данных

В данной задаче мы сосредоточились на изучении GSK3β (гликогенсинтазы киназы-3 бета) как перспективной мишени для терапии болезни Альцгеймера. Этот выбор обусловлен ключевой ролью фермента в нескольких патологических процессах.

  • Во-первых, GSK3β регулирует процессинг белка-предшественника амилоида, усиливая продукцию токсичной формы β-амилоида - основного компонента амилоидных бляшек.
  • Во-вторых, фермент вызывает гиперфосфорилирование тау-белка, приводящее к образованию нейрофибриллярных клубков - второго диагностического маркера БА. Кроме того, GSK3β активирует провоспалительные сигнальные пути в клетках микроглии, усиливая нейродегенерацию. Экспериментально доказано, что ингибирование GSK3β восстанавливает синаптическую пластичность и когнитивные способности в животных моделях.

Ссылки на статьи по данной мишени:

  • Zhao, J., Wei, M., Guo, M., Wang, M., Niu, H., Xu, T., & Zhou, Y. (2024). GSK3: A potential target and pending issues for treatment of Alzheimer’s disease. In CNS Neuroscience and Therapeutics (Vol. 30, Issue 7). (https://doi.org/10.1111/cns.14818)
  • He, J., & Tam, K. Y. (2024). Dual-target inhibitors of cholinesterase and GSK-3β to modulate Alzheimer’s disease. (https://doi.org/10.1016/j.drudis.2024.103914)
  • Zareei, S., Pourmand, S., Eskandarzadeh, M., & Massahi, S. (2024). In silico anti-alzheimer study of phytochemicals from Lamiaceae family through GSK3-β inhibition. Scientific Reports, 14(1). (https://doi.org/10.1038/s41598-023-47069-w)
  • Sequeira, R. C., & Godad, A. (2024). Understanding Glycogen Synthase Kinase-3: A Novel Avenue for Alzheimer’s Disease. In Molecular Neurobiology (Vol. 61, Issue 7, pp. 4203–4221). Springer. (https://doi.org/10.1007/s12035-023-03839-1)
  • Mohammadi, Y., Emadi, R., Maddahi, A., Shirdel, S., & Morowvat, M. H. (2024). Identifying potential Alzheimer’s disease therapeutics through GSK-3β inhibition: A molecular docking and dynamics approach. Computational Biology and Chemistry, 111. (https://doi.org/10.1016/j.compbiolchem.2024.108095)

Для поиска лигандов к нашей мишени мы использовали базу данных ChEMBLE, которая была выбрана по нескольким ключевым причинам.

  • Во-первых, все данные в ChEMBLE проходят многоэтапную проверку экспертами, что гарантирует их надежность.
  • Во-вторых, база предоставляет стандартизированный формат представления значений активности, позволяющий сравнивать результаты разных исследований. Кроме того, ChEMBLE содержит информацию о более чем 2 миллионах соединений и 15 тысячах биологических мишеней, что обеспечивает широкий охват для анализа.

Процесс обработки данных включал несколько последовательных этапов (рисунок 1).

  1. На этапе первичной фильтрации мы отбирали соединения с измеренной ингибирующей активностью против GSK3β, удаляли дубликаты по SMILES, фильтровали нужные колонки и переводили константу ингибировани Ki в pKi в nM по формуле 9 - lg(Ki).
  2. Далее мы рассчитывали молекулярные характеристики: генерировали 2048-битные фингерпринты Моргана (радиус=2), вычисляли физико-химические дескрипторы с помощью RDKit и нормировали дескрипторы методом StandardScaler, чтобы они не "перетягивали" на себя внимание модели. Мы сделали так по нескольким причинам. Фингерпринты Моргана были выбраны с такими конкретными параметрами, потому что они оптимально отражают локальное окружение атомов в молекуле - радиус 2 охватывает достаточно широкий фрагмент молекулы (примерно 2-3 связи вокруг каждого атома), что позволяет учитывать важные фармакофорные особенности, а 2048 бит обеспечивают хороший баланс между информативностью и вычислительной эффективностью. Эти фингерпринты особенно хорошо описывают стерические и электронные особенности молекул, которые критически важны для взаимодействия с активным центром GSK3β. В то же время, молекулярные дескрипторы дают нам дополнительную информацию о физико-химических свойствах соединений, которые напрямую влияют на их биодоступность, способность проникать через гематоэнцефалический барьер и другие фармакокинетические параметры, что особенно важно для разработки препаратов против болезни Альцгеймера.
  3. Для уменьшения размерности данных мы применяли PCA к физико-химическим дескрипторам (фингерпринты изначально представляют собой бинарные векторы (0/1) с низкой взаимной корреляцией, специально разработанные для эффективного описания структурных особенностей молекул, чтобы устранить сильную корреляцию между различными физико-химическими параметрами молекул). Эта мультиколлинеарность создает серьезные проблемы при построении предсказательных моделей, приводя к нестабильности оценок коэффициентов, переобучению и трудностям в интерпретации вклада отдельных молекулярных свойств.
Снимок экрана 2025-07-15 205059

Рисунок 1. Пайплайн сборки и предобработки данных

2. Отбор оптимальной модели для предсказания константы ингибирования

Оптимизация гиперпараметров для предсказывающей модели проводилась с помощью GridSearchCV и optuna. В отбор были включены модели следующих классов: Random Forest, Gradient Boosting, XGBoost, LightGBM, MLP и CNN. Для оптимизации нейросетевых модлей были созданы обертки с помощью библиотеки skorch. Оценка оптимизации проводилась с помощью метрик MAE, RMSE и R2. По итогам оптимизации наилучшие метрики показали XGBoost и LightGBM. Для дальнейшего анализа была выбрана модель LightGBM с параметрами: learning_rate = 0.05, max_depth = 5, n_estimators = 200, num_leaves = 31.

image

Рисунок 2. Результаты отбора предсказывающей модели

3. Генерация молекул

Как основная модель для генерации молекул была выбрана MolHF.

https://github.com/violet-sto/MolHF/tree/master

MolHF: A Hierarchical Normalizing Flow for Molecular Graph Generation (IJCAI 2023)

Критерии отбора модели MolHF (плюсы):

  • Высокое качество генерации
    • Молекулы получаются валидными (корректная валентность, отсутствие противоречивых связей)
    • Учитывает структурные паттерны (функциональные группы, циклы) благодаря иерархической генерации
  • Оптимизация ресурсов
    • Быстрая генерация: одноэтапный процесс (в отличие от авторегрессивных моделей)
    • С учётом наших ресурсов, нам важно, что модель использует мало памяти
  • Гибкость обучения
    • Может обучаться с нуля на чистых датасетах

В нашем эксперименте были опробованы три стратегии:

  1. Дообучение предобученной модели (ZINC250k) на кастомном датасете

    • Проблема: модель сохранила склонность к генерации токсофоров (из-за их обилия в ZINC250k)

    • Такой подход не подходит для задач, требующих строгого контроля над химическими свойствами

  2. Обучение с нуля на кастомном датасете

    • Результат: Большой процент валидных молекул, соответствующих целевым критериям

    • Модель хорошо адаптируется под нужное распределение данных

  3. Очистка ZINC250k + дообучение на кастомных данных

    • Результат: Хорошее качество молекул, баланс между разнообразием и соответствием критериям

    • Фильтрация ZINC250k снижает риск генерации токсичных соединений

image

Рисунок 3. Пайплан обучения

Все конфигурации запусков и метрики можно посмотреть в директории /data/MolHF_results/, дополненный код (с возможностью обучения на кастомном датасете) MolHF лежит в архиве 03_MolHF_extended.tar

4. Фильтрация кандидатов

Было проведено несколько этапов фильтрации кандидатов. После фильтрации по базовым критериям, оставалась 81 молекула, поэтому для отбора топа рамки сужались.

Расширенные критерии (для топ-6 молекул для докинга):

 QED ≥ 0.65

 0 нарушений Липинского,

 значение активности ≥ 6.5,

 отсутствие токсофоров,

 SA Score – от 2 до 6

 проницаемость через ГЭБ.
image

Рисунок 3. Результаты фильтрации молекул-кандидатов

Для топ-2 молекулы ставилось ограничение QED ≥ 0.7.

5. Молекулярный докинг

GSK-3β принадлежит к семейству CMGC серин/треониновых киназ и обладает консервативной структурой, характерной для протеинкиназ, но с рядом некоторых структурных особенностей.

GSK-3β состоит из N-терминального домена (β-листы), каталитического домена (α/β-структура) и С-терминального домена. Можно выделить несколько ключевых структурных мотив, которые встречаются в литературе: Малый лепесток (N-лопасть, β-листы) – отвечает за связывание ATP.

Большой лепесток (C-лопасть, α-спирали) – участвует в связывании субстрата и регуляции.

Активационная петля (T-loop, остатки 200–226) – содержит критический остаток Tyr216, фосфорилирование которого необходимо для полной активности.

Субстрат-связывающий карман – формируется за счет гидрофобных и заряженных остатков.

Чаще всего применяются АТP-конкуретные ингибиторы.

В ходе исследования был проведен молекулярный докинг химического соединения в активный сайт белка с использованием следующих параметров:

Локализация бокса докинга:

Центр бокса задан координатами: -8, -1, -8 (по осям X, Y, Z соответственно).

Размеры бокса: 20 × 20 × 20 Å, что обеспечивает достаточное пространство для размещения лиганда и учета возможных конформационных изменений белка.

Метод докинга:

Использован AutoDock (AC) – алгоритм, основанный на эмпирической функции свободной энергии связывания, включающей вандерваальсовы, электростатические, водородные связи и энтропийные вклады.

Экстенсивность сэмплирования: (средний)

image

Рисунок 4. Связывание лиганда CNC1C(C)CC2C3CCC2C1C3 с мишенью

Лиганд CNC1C(C)CC2C3CCC2C1C3, по всей видимости, является конкурентным ингибитором ATP, связываясь в каталитическом сайте GSK3β через комбинацию водородных, гидрофобных и электростатических взаимодействий.

image

Рисунок 5. Связывание лиганда CNC1C(C)CC2C3CCC2C1C3 с мишенью в увеличенном виде

Энергия связывания составила -4.969 kcal/mol, что оставляет желать лучшего. Серые штрихи, это гидрофобное взаимодействие. Основное взаимодействие - гидрофобика. Именно из-за этого получается небольшая энергия связывания. Посторонние молекулы на рисунке - это аминокислоные остатки белка в другом представлении для наглядности.

image

Рисунок 6. Связывание лиганда CNC1C(C)CC2C3CCC2C1C3 с мишенью в поверхностном представлении

Лиганд в явном виде забивает собой "желоб" для стекинг взаимодействия.

Также мы сделали молекулярный докинг для молекулы CCCC1C2CC(C2C)C1CNC, для которой были самые лучшие показатели

image

Рисунок 7. Связывание лиганда CCCC1C2CC(C2C)C1CNC с мишенью

Энергия связывания составила -6,4 kcal/mol, что уже гораздо лучше по сравнению с предыдущей молекулой. Также преобладает гидрофобное взаимодействие, и сама молекула сидит в кармане глубже, оттого и сильнее её связывание с мишенью. Собственно, оно видно и по поверхностному представлению (рисунок 8)

image

Рисунок 8. Связывание лиганда CCCC1C2CC(C2C)C1CNC с мишенью в поверхностном представлении

В любом случае, эти обе молекулы предпочитают ATP-связывающие области. Скорее всего будут выступать как конкурирующий ингибитор

Сгенерированные нами молекулы станут серьёзным шагом в разработке эффективных лекарственных молекул против болезни Альцгеймера

About

В этом репозитории представлен проект по генеративному дизайну молекул для лечения болезни Альцгеймера

Resources

Stars

0 stars

Watchers

0 watching

Forks

Releases

Packages

Contributors

Languages