В этом репозитории представлен проект по генеративному дизайну молекул для лечения болезни Альцгеймера.
В данной задаче мы сосредоточились на изучении GSK3β (гликогенсинтазы киназы-3 бета) как перспективной мишени для терапии болезни Альцгеймера. Этот выбор обусловлен ключевой ролью фермента в нескольких патологических процессах.
- Во-первых, GSK3β регулирует процессинг белка-предшественника амилоида, усиливая продукцию токсичной формы β-амилоида - основного компонента амилоидных бляшек.
- Во-вторых, фермент вызывает гиперфосфорилирование тау-белка, приводящее к образованию нейрофибриллярных клубков - второго диагностического маркера БА. Кроме того, GSK3β активирует провоспалительные сигнальные пути в клетках микроглии, усиливая нейродегенерацию. Экспериментально доказано, что ингибирование GSK3β восстанавливает синаптическую пластичность и когнитивные способности в животных моделях.
Ссылки на статьи по данной мишени:
- Zhao, J., Wei, M., Guo, M., Wang, M., Niu, H., Xu, T., & Zhou, Y. (2024). GSK3: A potential target and pending issues for treatment of Alzheimer’s disease. In CNS Neuroscience and Therapeutics (Vol. 30, Issue 7). (https://doi.org/10.1111/cns.14818)
- He, J., & Tam, K. Y. (2024). Dual-target inhibitors of cholinesterase and GSK-3β to modulate Alzheimer’s disease. (https://doi.org/10.1016/j.drudis.2024.103914)
- Zareei, S., Pourmand, S., Eskandarzadeh, M., & Massahi, S. (2024). In silico anti-alzheimer study of phytochemicals from Lamiaceae family through GSK3-β inhibition. Scientific Reports, 14(1). (https://doi.org/10.1038/s41598-023-47069-w)
- Sequeira, R. C., & Godad, A. (2024). Understanding Glycogen Synthase Kinase-3: A Novel Avenue for Alzheimer’s Disease. In Molecular Neurobiology (Vol. 61, Issue 7, pp. 4203–4221). Springer. (https://doi.org/10.1007/s12035-023-03839-1)
- Mohammadi, Y., Emadi, R., Maddahi, A., Shirdel, S., & Morowvat, M. H. (2024). Identifying potential Alzheimer’s disease therapeutics through GSK-3β inhibition: A molecular docking and dynamics approach. Computational Biology and Chemistry, 111. (https://doi.org/10.1016/j.compbiolchem.2024.108095)
Для поиска лигандов к нашей мишени мы использовали базу данных ChEMBLE, которая была выбрана по нескольким ключевым причинам.
- Во-первых, все данные в ChEMBLE проходят многоэтапную проверку экспертами, что гарантирует их надежность.
- Во-вторых, база предоставляет стандартизированный формат представления значений активности, позволяющий сравнивать результаты разных исследований. Кроме того, ChEMBLE содержит информацию о более чем 2 миллионах соединений и 15 тысячах биологических мишеней, что обеспечивает широкий охват для анализа.
Процесс обработки данных включал несколько последовательных этапов (рисунок 1).
- На этапе первичной фильтрации мы отбирали соединения с измеренной ингибирующей активностью против GSK3β, удаляли дубликаты по SMILES, фильтровали нужные колонки и переводили константу ингибировани Ki в pKi в nM по формуле 9 - lg(Ki).
- Далее мы рассчитывали молекулярные характеристики: генерировали 2048-битные фингерпринты Моргана (радиус=2), вычисляли физико-химические дескрипторы с помощью RDKit и нормировали дескрипторы методом StandardScaler, чтобы они не "перетягивали" на себя внимание модели. Мы сделали так по нескольким причинам. Фингерпринты Моргана были выбраны с такими конкретными параметрами, потому что они оптимально отражают локальное окружение атомов в молекуле - радиус 2 охватывает достаточно широкий фрагмент молекулы (примерно 2-3 связи вокруг каждого атома), что позволяет учитывать важные фармакофорные особенности, а 2048 бит обеспечивают хороший баланс между информативностью и вычислительной эффективностью. Эти фингерпринты особенно хорошо описывают стерические и электронные особенности молекул, которые критически важны для взаимодействия с активным центром GSK3β. В то же время, молекулярные дескрипторы дают нам дополнительную информацию о физико-химических свойствах соединений, которые напрямую влияют на их биодоступность, способность проникать через гематоэнцефалический барьер и другие фармакокинетические параметры, что особенно важно для разработки препаратов против болезни Альцгеймера.
- Для уменьшения размерности данных мы применяли PCA к физико-химическим дескрипторам (фингерпринты изначально представляют собой бинарные векторы (0/1) с низкой взаимной корреляцией, специально разработанные для эффективного описания структурных особенностей молекул, чтобы устранить сильную корреляцию между различными физико-химическими параметрами молекул). Эта мультиколлинеарность создает серьезные проблемы при построении предсказательных моделей, приводя к нестабильности оценок коэффициентов, переобучению и трудностям в интерпретации вклада отдельных молекулярных свойств.
Рисунок 1. Пайплайн сборки и предобработки данных
Оптимизация гиперпараметров для предсказывающей модели проводилась с помощью GridSearchCV и optuna. В отбор были включены модели следующих классов: Random Forest, Gradient Boosting, XGBoost, LightGBM, MLP и CNN. Для оптимизации нейросетевых модлей были созданы обертки с помощью библиотеки skorch. Оценка оптимизации проводилась с помощью метрик MAE, RMSE и R2. По итогам оптимизации наилучшие метрики показали XGBoost и LightGBM. Для дальнейшего анализа была выбрана модель LightGBM с параметрами: learning_rate = 0.05, max_depth = 5, n_estimators = 200, num_leaves = 31.
Рисунок 2. Результаты отбора предсказывающей модели
Как основная модель для генерации молекул была выбрана MolHF.
https://github.com/violet-sto/MolHF/tree/master
MolHF: A Hierarchical Normalizing Flow for Molecular Graph Generation (IJCAI 2023)
Критерии отбора модели MolHF (плюсы):
- Высокое качество генерации
- Молекулы получаются валидными (корректная валентность, отсутствие противоречивых связей)
- Учитывает структурные паттерны (функциональные группы, циклы) благодаря иерархической генерации
- Оптимизация ресурсов
- Быстрая генерация: одноэтапный процесс (в отличие от авторегрессивных моделей)
- С учётом наших ресурсов, нам важно, что модель использует мало памяти
- Гибкость обучения
- Может обучаться с нуля на чистых датасетах
В нашем эксперименте были опробованы три стратегии:
-
Дообучение предобученной модели (ZINC250k) на кастомном датасете
-
Проблема: модель сохранила склонность к генерации токсофоров (из-за их обилия в ZINC250k)
-
Такой подход не подходит для задач, требующих строгого контроля над химическими свойствами
-
-
Обучение с нуля на кастомном датасете
-
Результат: Большой процент валидных молекул, соответствующих целевым критериям
-
Модель хорошо адаптируется под нужное распределение данных
-
-
Очистка ZINC250k + дообучение на кастомных данных
-
Результат: Хорошее качество молекул, баланс между разнообразием и соответствием критериям
-
Фильтрация ZINC250k снижает риск генерации токсичных соединений
-
Рисунок 3. Пайплан обучения
Все конфигурации запусков и метрики можно посмотреть в директории /data/MolHF_results/, дополненный код (с возможностью обучения на кастомном датасете) MolHF лежит в архиве 03_MolHF_extended.tar
Было проведено несколько этапов фильтрации кандидатов. После фильтрации по базовым критериям, оставалась 81 молекула, поэтому для отбора топа рамки сужались.
Расширенные критерии (для топ-6 молекул для докинга):
QED ≥ 0.65
0 нарушений Липинского,
значение активности ≥ 6.5,
отсутствие токсофоров,
SA Score – от 2 до 6
проницаемость через ГЭБ.
Рисунок 3. Результаты фильтрации молекул-кандидатов
Для топ-2 молекулы ставилось ограничение QED ≥ 0.7.
GSK-3β принадлежит к семейству CMGC серин/треониновых киназ и обладает консервативной структурой, характерной для протеинкиназ, но с рядом некоторых структурных особенностей.
GSK-3β состоит из N-терминального домена (β-листы), каталитического домена (α/β-структура) и С-терминального домена. Можно выделить несколько ключевых структурных мотив, которые встречаются в литературе: Малый лепесток (N-лопасть, β-листы) – отвечает за связывание ATP.
Большой лепесток (C-лопасть, α-спирали) – участвует в связывании субстрата и регуляции.
Активационная петля (T-loop, остатки 200–226) – содержит критический остаток Tyr216, фосфорилирование которого необходимо для полной активности.
Субстрат-связывающий карман – формируется за счет гидрофобных и заряженных остатков.
Чаще всего применяются АТP-конкуретные ингибиторы.
В ходе исследования был проведен молекулярный докинг химического соединения в активный сайт белка с использованием следующих параметров:
Локализация бокса докинга:
Центр бокса задан координатами: -8, -1, -8 (по осям X, Y, Z соответственно).
Размеры бокса: 20 × 20 × 20 Å, что обеспечивает достаточное пространство для размещения лиганда и учета возможных конформационных изменений белка.
Метод докинга:
Использован AutoDock (AC) – алгоритм, основанный на эмпирической функции свободной энергии связывания, включающей вандерваальсовы, электростатические, водородные связи и энтропийные вклады.
Экстенсивность сэмплирования: (средний)
Рисунок 4. Связывание лиганда CNC1C(C)CC2C3CCC2C1C3 с мишенью
Лиганд CNC1C(C)CC2C3CCC2C1C3, по всей видимости, является конкурентным ингибитором ATP, связываясь в каталитическом сайте GSK3β через комбинацию водородных, гидрофобных и электростатических взаимодействий.
Рисунок 5. Связывание лиганда CNC1C(C)CC2C3CCC2C1C3 с мишенью в увеличенном виде
Энергия связывания составила -4.969 kcal/mol, что оставляет желать лучшего. Серые штрихи, это гидрофобное взаимодействие. Основное взаимодействие - гидрофобика. Именно из-за этого получается небольшая энергия связывания. Посторонние молекулы на рисунке - это аминокислоные остатки белка в другом представлении для наглядности.
Рисунок 6. Связывание лиганда CNC1C(C)CC2C3CCC2C1C3 с мишенью в поверхностном представлении
Лиганд в явном виде забивает собой "желоб" для стекинг взаимодействия.
Также мы сделали молекулярный докинг для молекулы CCCC1C2CC(C2C)C1CNC, для которой были самые лучшие показатели
Рисунок 7. Связывание лиганда CCCC1C2CC(C2C)C1CNC с мишенью
Энергия связывания составила -6,4 kcal/mol, что уже гораздо лучше по сравнению с предыдущей молекулой. Также преобладает гидрофобное взаимодействие, и сама молекула сидит в кармане глубже, оттого и сильнее её связывание с мишенью. Собственно, оно видно и по поверхностному представлению (рисунок 8)
Рисунок 8. Связывание лиганда CCCC1C2CC(C2C)C1CNC с мишенью в поверхностном представлении
В любом случае, эти обе молекулы предпочитают ATP-связывающие области. Скорее всего будут выступать как конкурирующий ингибитор
Сгенерированные нами молекулы станут серьёзным шагом в разработке эффективных лекарственных молекул против болезни Альцгеймера