Коллеги прислали обновление препринта Cell2Sentence от гугла:
https://www.biorxiv.org/content/10.1101/2025.04.14.648850v2.full
У Cell2Sentence моделей такая идея: в модель подается информация об активности генов в клетке в формате порядка генов: первым идет имя самого активного ген, потом второго по активности и т.д. Далее в модель подается текстовое описание - что это за тип клеток, были ли клетки обработаны каким-либо химическим агентом и т.п. Поскольку все данные на входе - это текст, учится модель как стандартная текстовая модель (архитектура тут decoder-only Transformer).
Статья довольно большая и будет интересно послушать чей-то детальный разбор (я прочитал внимательно только отдельные части). У меня сложилось такое впечатление, что это такой ИИ поисковик по статьям (статьи подаются при обучении вместе с данными об экспрессии), который ещё умеет по набору топ-экспрессирующихся генов задавать в поиск некоторый контекст - о каком типе клеток идет речь в запросе. Насколько этот "поисковик" хорошо генерализуется, чтобы выдавать что-то неизвестное - большое вопрос.
Авторы приводят пример, когда модель предсказала ранее неизвестное свойство интерферона усиливать репрезентацию антигенов, причем экспериментальная проверка предсказание модели. Но для меня (ни разу не иммунолога) не очевидно, насколько это действительно новое предсказание.
В любом случае даже возможность искать информацию по научным статьям и датасетам, запромптив поисковик своими single-cell данными - уже довольно интересно.
У коллег есть модели на HF - кто попробует, напишите отзывы!
https://huggingface.co/vandijklab/C2S-Scale-Pythia-1b-pt
Post #765
1.46K
- 👍 7
- 🤔 5
- ❤ 3
- 🥴 2
- 🔥 1