В данном ТГ-канале я уже отмечал, что изучение с помощью нейросетевых подходов текстов на «языке ДНК», т.е. последовательностей нуклеотидов в ДНК – очень перспективное новое направление, где можно ожидать реальных научных прорывов. И приводил в качестве примера ИИ-модель Evo 2, которая была разработана учеными расположенного в Калифорнии Arc Institute:
https://t.me/khokhlovAR/1206
Эта модель была обучена на последовательностях ДНК более чем 100 тысяч видов живых организмов по всему древу жизни – от одноклеточных организмов до человека.
В частности, я тогда отмечал, что «большие языковые модели обучаются на совокупности произведенных человечеством текстов, подавляющая часть которых не отличается особой мудростью. А последовательности нуклеотидов в ДНК были отобраны в ходе миллиардов лет эволюции, эти тексты будут явно поумнее, и обучение на них должно (по идее) приводить к намного более интересным результатам.»
И вот совсем недавно я получил сообщение от доктора биологических наук В.С.Фишмана, руководителя лабораторий Института цитологии и генетики СО РАН и Университета Сириус, а также группы геномики основанного Сбером Института искусственного интеллекта (AIRI). Он сообщил, что в России тоже активно ведутся исследования по анализу текстов на «языке ДНК». В прошлом году в Nucleic Acids Research была опубликована разработанная этой группой модель GENA-LM:
https://academic.oup.com/nar/article/53/2/gkae1310/7954523
Об этой модели на русском языке и на очень популярном уровне можно прочитать здесь:
https://www.kommersant.ru/doc/7550813
Я попросил Вениамина Семеновича коротко сформулировать основные отличия этой модели от EVO 2. Вот его ответ: «GENA-LM и Evo-2 - две параллельные линии развития моделей для ДНК. Обе учатся на больших массивах геномных последовательностей и затем могут использоваться для широкого круга биологических задач. Технологически обе модели рассчитаны на анализ длинных последовательностей, но используют для этого разные подходы. Кроме того, Evo-2 - генеративная модель, т.е. предназначена для генерации последовательностей (и в этом смысле она ближе к ChatGPT), с акцентом на анализ геномов бактерий и фагов. GENA-LM — модель, архитектура которой в первую очередь предназначена для извлечения информации из последовательностей ДНК, а не генерации новых последовательности; она больше применялась для задач регуляторной геномики человека и животных: поиска генов, предсказания активности регуляторных элементов и интерпретации вариантов.»
Очень хорошо, что это направление развивается в ведущих российских научных организациях с привлечением компетенций как в области геномики, так и инструментов ИИ. Причем это делается на высоком научном уровне (Nucleic Acids Research – один из топовых журналов). Еще лучше, что В.С.Фишман активно пользуется возможностями telegram. Он ведет ТГ-канал; там он сообщает о новых успехах, предлагает сотрудничество с потенциальными пользователями - см, например, недавние посты:
https://t.me/fishmanvs/882
https://t.me/fishmanvs/870
Post #899
1.24K
Forwarded from Алексей Хохлов
- 🔥 31
- 👍 9
- ❤ 6
- 🤯 2