Привет! Я Алина, врач-психиатр. Сегодня расскажу о том, как языковые модели учатся предсказывать побочные эффекты при одновременном приёме нескольких препаратов.
Полипрагмазия (одновременный прием нескольких препаратов) широко распространена, особенно у пациентов с несколькими хроническими заболеваниями.
➡️ Например, в психиатрии нередко пациент получает комбинации психотропных препаратов (антидепрессанты, нормотимики, нейролептики, анксиолитики) одновременно, не считая соматической терапии. С каждым новым препаратом в схеме растёт риск непредвиденных межлекарственных взаимодействий и нежелательных реакций.
💥 Возможны серотониновый синдром при сочетании СИОЗС с другими серотонинергическими средствами
💥 Удлинение интервала QT при комбинации ряда антипсихотиков
💥 Метаболические нарушения и фармакокинетические взаимодействия через систему цитохрома P450 (когда один препарат изменяет скорость метаболизма другого, что может приводить к повышению его токсичности или, наоборот, снижению эффективности)
➡️ Недавно была представлена модель PolyLLM — подход, в котором большие языковые модели используются для предсказания побочных эффектов лекарственных комбинаций, опираясь только на химическую структуру препаратов. С учетом увеличения фарм рынка, такие инструменты становятся особенно актуальными, так как предсказывают побочные эффекты комбинаций, даже если они ещё не описаны в литературе.
💥 Как устроена архитектура?
Каждый препарат имеет текстовое представление молекулярной структуры — SMILES. Авторы подали эти строки в несколько языковых моделей (ChemBERTa, GPT, BERT, Mol2vec и др.), чтобы получить эмбеддинги — числовые векторы, кодирующие химические свойства молекулы. Затем эмбеддинги двух препаратов суммируются в единый вектор пары и подаются в классификатор.
Авторы протестировали два классификатора: многослойный перцептрон (MLP) и графовую нейронную сеть (GNN). В случае GNN данные организованы в двудольный граф, где один тип узлов — пары препаратов, другой — побочные эффекты, а рёбра между ними отражают известные ассоциации.
Модель обучается предсказывать наличие или отсутствие связи между парой препаратов и конкретным побочным эффектом. Датасет включает 645 препаратов, более 63 тысяч уникальных комбинаций и 964 типа побочных эффектов.
💥 Ключевые результаты:
🔶 Лучшую точность показала связка ChemBERTa + GNN: AUC 0,92 и AUPRC 0,89 — выше всех базовых моделей, включая Decagon, который дополнительно использует данные о белках и генах
🔶 GPT-эмбеддинги оказались конкурентоспособны (AUC 0,918), хотя модель не обучалась на химических данных. Уже в который раз показано, как масштабное предобучение компенсирует отсутствие доменной специфичности
🔶 Модель работает только на основе химических формул. Это важно для ситуаций, когда информация о белках-мишенях или клеточных линиях недоступна
🔶 MLP-подход показал высокий AUC, но из-за дисбаланса классов были ложноположительные предсказания
🔶 Хуже справляется с иммуноопосредованными, редкими и биологически сложными реакциями, которые невозможно уловить из одной лишь молекулярной формулы
🔶 Для редких побочных эффектов с небольшим числом известных взаимодействий модель работает заметно слабее
Однако на данном этапе PolyLLM остаётся исследовательской моделью — до клинического внедрения необходимы проверка на независимых данных и интеграция дополнительных биологических признаков.
💥 Кстати, если вы сами принимаете несколько препаратов одновременно и хотите убедиться, что они безопасно сочетаются друг с другом, рекомендую проверить свои назначения на совместимость и доказанную эффективность. Это не заменит консультацию врача, но поможет лучше ориентироваться в своей терапии.
@FemtechForce — о технологиях для здоровья женщин
Текст подготовила #АлинаАкбашева