TGViewer
Channel Public Channel
Открытый код ФКН ВШЭ

Открытый код ФКН ВШЭ

@hse_cs_opensource

Показываем новости по открытому коду ФКН ВШЭ.

Контакты: Михаил Гущин @mhushchyn
Subscribers
933
Photos
82
Videos
1
Links
162

Showing posts older than #168 · Back to latest

Older Posts 20 shown
Post #167 472
Folding-In-MRGSRec

В репозитории опубликован код Folding-In-MRGSRec — метода для быстрого обновления графовых рекомендательных моделей после появления новых взаимодействий. Авторы работают с практической проблемой таких рекомендательных систем, где новые действия пользователей обычно требуют полного переобучения модели. В реальных задачах это быстро становится дорогим и неудобным, особенно если рекомендации должны меняться почти сразу после новых кликов, покупок или просмотров. Вместо обновления всех весов Folding-In меняет только небольшую часть пользовательских представлений, связанных с пользователями, у которых появились новые взаимодействия. Метод встроен в MRGSRec, модели с множественными представлениями, объединяющую графовую часть на LightGCN и последовательную часть на SASRec. Графовая компонента отвечает за глобальные связи между пользователями и объектами, а sequential-компонента лучше ловит локальную историю конкретного пользователя. Эксперименты проведены на MovieLens-1M и трёх датасетах Amazon. Folding-In-MRGSRec показывает лучшее качество среди рассмотренных графовых, последовательных и бейзлайнов с множественными представлениями. Работа будет полезна исследователям рекомендательных систем и ML специалистам в области рекоменлдаций.

статья | код
  • ❤ 7
  • 🥰 3
  • 🔥 2
  • 👍 1
Post #166 494
solar-magnetic-tornado

В репозитории опубликован код solar-magnetic-tornado — пайплайна для автоматического поиска солнечных магнитных торнадо на изображениях SDO/AIA 171 Å. Авторы рассматривают темные спиралевидные структуры у лимба Солнца, которые раньше в основном находили вручную по отдельным наблюдениям. Такой подход плохо подходит для статистики по солнечному циклу, поэтому в работе собраны обучающие данные по известным и дополнительно размеченным торнадо и предложены два нейросетевых метода детекции. Первый метод использует MobileNetV3 как feature extractor и recurrent-блок GRU или LSTM для классификации последовательностей из 20 кадров. Он учитывает временную динамику и видимое вращение структуры. Второй метод основан на YOLO 11 и работает с отдельными кадрами, зато сразу возвращает bounding boxes, координаты и оценку размера объекта. Лучшей моделью в первом подходе стала связка MobileNetV3 + GRU с AUC-ROC 0.945, recall 0.968 и precision 0.836 при пороге 0.5. YOLO хуже учитывает динамику, но удобен для массового поиска и пространственного анализа. На основе моделей авторы нашли 1 476 885 новых объектов и построили базу событий, пригодную для дальнейшей проверки и статистики. Работа будет полезна исследователям физики солнц, специалистам по автоматическому анализу астрономических изображений и командам, которые строят большие базы событий из потоковых наблюдений, где ручная разметка уже не масштабируется.

статья | код
  • 🥰 4
  • ❤ 1
  • 👍 1
Post #165 471

Forwarded from Научный опенсорс (Nikolay Nikitin)

Наша сегодняшняя онлайн-секция Open Source начинается меньше чем через пол-часа!

Ровно в 12-00 стартуем. Будут доклады от представителей Yandex Cloud, ФКН ВШЭ и Иннотеха.

Ссылка на трансляцию - https://dion.vc/event/datafest-kb (нужно нажимать "Войти как гость")

Задавать вопросы докладчикам можно в чате трансляция или здесь в комментариях.

Подробности по программе - тут.
  • ❤ 5
  • 😍 1
Post #164 440

Forwarded from Научный опенсорс (Nikolay Nikitin)

Публикуем расписание нашей секции Open Source на DataFest 2026 - https://ods.ai/events/datafest2026:

Онлайн
(30.05, 12:00):

1) Марина Кошелева, руководитель проектов, Центр технологий для общества Yandex Cloud:
Как мы делали библиотеку-опенсорс курсов от преподавателей вузов

2) Михаил Гущин, ведущий научный сотрудник, зам. зав. лаб, руководитель проекта по открытому коду Факультета компьютерных наук ФКН НИУ ВШЭ:
Научные открытые проекты

3) Юрий Барамыков, старший руководитель проекта, Иннотех:
ggmlR:Vulkan GPU-бэкенд для R

Белград, 31.05 - https://ods.ai/events/fest2026-fon-belgrade

4) Алексей Васильев, исполнительный директор по исследованию данных, Sber AI Lab:
SplitLight: RecSys Evaluation Toolkit

5) Илья Шагабеев, ML Researcher, Acclaim ai
TTS in 2026: Open Source vs Big Tech

Ссылки на трансляцию онлайна скинем позже.
  • 🔥 5
  • 👍 3
  • ❤ 1
  • 😍 1
Post #163 416
DPNVerifier

В репозитории опубликован код DPN Verifier — инструментария для проверки и исправления бездефектности моделей процессов с данными. Работа рассматривает Data Petri Nets, расширение сетей Петри, где переходы зависят не только от разметки, но и от значений переменных. Такая постановка нужна для процессов, в которых данные напрямую меняют поток управления, а ошибки могут проявляться как deadlock, livelock, неограниченный рост ресурсов или действия, которые никогда не выполняются. Авторы предлагают более быстрый метод проверки DPN, который требует не больше двух построений пространства состояний. Существующие подходы часто опираются на многократное построение графов, из-за чего методы плохо масштабировались и оставались ближе к исследовательским прототипам. DPN Verifier реализует новую роцедуру, добавление tau-переходов и анализ абстрактных пространств состояний, включая ARG, ACG и ACT. Сам DPN Verifier поставляется как desktop-приложение, консольная утилита и библиотека классов, поэтому его можно использовать вручную, подключать к пайплайнам моделирования или брать как основу для экспериментов с DPN. Работа будет полезна исследователям process mining, разработчикам инструментов формальной верификации и командам, которые работают с процессными моделями, где поведение зависит от данных, а проверка корректности должна быть не демонстрацией на малом примере, а частью нормального инженерного пайплайна.

статья | код
  • 🔥 3
  • 👍 2
  • 🥰 2
  • ❤ 1
Post #162 384
SimChrom

В репозитории опубликован код SimChrom — интерактивного ресурса и набора данных для анализа человеческого хроматома. Авторы собирают разрозненную информацию о хроматин-ассоциированных белках из функциональных баз, данных о субклеточной локализации и исследований спектрометрии, а затем приводят её к единой системе. Работа обращает внимание на то, что само множество белков хроматина до сих пор плохо согласовано между источниками, и разные протеомные исследования дают сильно отличающиеся списки, локализационные базы имеют неполное покрытие, а Gene Ontology слишком подробна и неудобна для прямого анализа хроматома. На этой основе авторы строят SimChrom классификацию, набор примерно из 3000 хроматиновых белков и более простую версию разметки, где каждый белок получает одну основную категорию. Отдельно авторы показывают, что в хроматиновых белках остаётся заметная тёмная часть структурного пространства. С помощью AlphaFold и TED они находят 241 структурный домен без известных экспериментальных структур или близких структурных суперсемейств, а часть из них также не имеет Pfam-аннотаций. Работа будет полезна исследователям хроматина, системной биологии, структурной биоинформатики и командам, которые строят модели регуляции генома на уровне белков, доменов и взаимодействий.

статья | код
  • 🔥 4
  • 🥰 3
  • ❤ 1
  • 👍 1
Post #161 363

Forwarded from Мониторинг аналитики об IT

Интерес к российским платформам для Open Source будет расти, ИИ обеспечит появление новых открытых проектов

ICT.Moscow подвел итоги опроса о перспективах развития проектов с открытым исходным кодом (Open Source), в котором приняли участие более 300 представителей ИТ-сферы.

Какие прогнозы в отрасли строят на этот год:

• 36% респондентов считают, что российские аналоги будут охотнее выбирать в качестве альтернативы зарубежным репозиториям;

• 46% отметили, что заметным драйвером станет искусственный интеллект и именно эта технология приведет к увеличению числа открытых проектов как в России, так и за ее пределами;

• по мнению 14%, все чаще начнут использовать гибридные или коммерческие бизнес-модели распространения открытых решений;

• помимо этого, в числе прогнозов выделяют появление центров экспертизы на стыке индустрии, науки и сообществ открытого кода, а также разработку национальных стандартов качества и безопасности продуктов Open Source. 15% надеются, что в 2026 году будут новые инициативы в регулировании индустрии;

• несмотря на преобладание оптимистичных прогнозов, 28% опрошенных не ждут значительных изменений в сфере открытого софта в России, указывая на неясность относительно будущего локального развития.

Ознакомиться со всеми итогами →

Опрос проводился командой аналитического хаба ICT.Moscow в апреле 2026 года. Участникам предлагалось выбрать несколько вариантов ответа на вопрос о том, чего они ожидают от российского Open Source в ближайшей перспективе.

***
📎В июне ICT.Moscow представит обзор отечественной индустрии Open Source. Подписаться на обновление по этой теме.
  • ❤ 1
Post #160 507
GeomMotif

В репозитории опубликован код GeomMotif — бенчмарка для оценки геометрического сохранения структурных фрагментов при генерации белков. Авторы обращают внимание на ограничение существующих бенчмарков для motif scaffolding, где задачи обычно строятся вокруг функциональных мотивов, например активных центров ферментов или участков связывания. В такой постановке оценка смешивает сразу несколько факторов: сохранение 3D-геометрии, аминокислотный состав, заряд, гидрофобную упаковку, боковые цепи и функциональную совместимость мотива. GeomMotif предлагает более чистую диагностическую постановку, где проверяется именно способность модели достроить белковую структуру вокруг заданного мотива без дополнительного требования к биологической функции. Для этого авторы собирают 57 задач из структур Protein Data Bank. Дополнительно каждый мотив описан набором структурных и физико-химических свойств, включая размер, вторичную структуру, гидрофобность, заряд, степень захороненности и контактное окружение. Это позволяет анализировать не только средний результат, но и конкретные режимы, в которых разные модели теряют геометрию. Для оценки используется SUN, метрика, объединяющая успешность сохранения мотива, разнообразие решений и новизну сгенерированных структур. В экспериментах структурные модели заметно превосходят sequence-based подходы. Наилучшие результаты показывают Genie2, La-Proteina и RFdiffusion, тогда как модели, генерирующие только последовательности, почти не справляются с задачами на два пространственно разнесённых мотива. Отдельно авторы показывают, что ESM3 в режиме совместной генерации последовательности и структуры работает хуже sequence-only варианта, что делает этот бенчмарк полезным не только для ранжирования моделей, но и для поиска архитектурных ограничений. Работа будет полезна исследователям генеративного дизайна белков, разработчикам моделей для protein scaffolding и командам, которым важно понимать, какие геометрические ограничения современные модели действительно умеют сохранять.

статья | код
  • ❤ 4
  • 🔥 2
  • 😍 2
Post #159 529
RiemanianFinetune

В репозитории опубликован код RiemanianFinetune — нового подхода к обучению LoRA-адаптеров через риманову оптимизацию. Авторы обращают внимание на проблему стандартной LoRA, где один и тот же низкоранговый сдвиг весов можно представить разными парами матриц, но обычные оптимизаторы вроде Adam или SGD обучают именно эти факторы, поэтому результат может зависеть от случайной параметризации. В работе предлагается обучать не отдельные множители LoRA, а саму низкоранговую матрицу как точку на многообразии матриц фиксированного ранга. Для этого авторы вводят оптимизатор Riemannion — риманово обобщение Muon для низкоранговых адаптеров. Такой подход делает обновления более геометрически корректными и менее зависимыми от выбранного разложения. Дополнительно предложена специальная инициализация адаптеров, ориентированная на начальный градиент, а также эффективная реализация без заметных издержек при малых рангах. Эксперименты на Llama 3-8B в задачах commonsense reasoning показывают, что Riemannion превосходит LoRA, DoRA, Muon по факторам LoRA и другие римановы варианты. Средняя accuracy по восьми задачам достигает 88.1% против 87.1% у Adam-LoRA. В экспериментах с Stable Diffusion 2 для subject-driven generation метод быстрее сохраняет концепт и лучше удерживает соответствие текстовому описанию. Работа будет полезна исследователям parameter-efficient fine-tuning, разработчикам LLM и diffusion-моделей, а также тем, кто изучает геометрические методы оптимизации для низкоранговых нейросетевых адаптеров.

статья | код
  • ❤ 5
  • 🔥 2
  • 😍 2
  • 👍 1
Post #158 505

Forwarded from Вышка для своих

🔬 Как превратить научные результаты в востребованный продукт (и грамотно оформить на него права)?

Для этого в Вышке создана инфраструктура, помогающая ученым и разработчикам сопровождать результат интеллектуальной деятельности на всех этапах.

Сотрудникам и студентам доступны консультации, патентная поддержка и механизмы регистрации разработок.

Подробнее о том, как университет работает с интеллектуальной собственностью, рассказывает «Вышка для своих»

#Важное

📲 Подписывайтесь на Вышку в MAX: Официальный канал | Афиша Вышки | IQ Media | Вышка в Санкт-Петербурге | Вышка в Нижнем Новгороде | Вышка в Перми | Вышка Онлайн
  • ❤‍🔥 1
  • 🔥 1
Post #157 725
tabular-dl-optimizers

В репозитории опубликован код масштабного исследования оптимизаторов для MLP-моделей в задачах глубокого обучения на табличных данных. Авторы обращают внимание на любопытный перекос в современной практике, где архитектуры для табличного DL активно развиваются и сравниваются, а вот выбор оптимизатора чаще всего остаётся почти автоматическим. Для этого авторы предлагают единый бенчмарк 15 оптимизаторов на 17 датасетах в стандартной постановке обучения с учителем. Главный вывод работы — оптимизатор Muon стабильно превосходит AdamW как на простых MLP, так и на более современных архитектурах. Muon выигрывает у AdamW на большинстве датасетов и для всех рассмотренных семейств моделей. Дополнительно авторы показывают, что экспоненциальное скользящее усреднение весов заметно улучшает AdamW на обычных MLP, хотя на более сильных моделях эффект EMA уже менее стабилен. Таким образом, Muon выглядит как новый сильный практический бейзлайн для табличного DL, а AdamW+EMA — как простая и разумная альтернатива. Работа будет полезна исследователям табличного глубинного обучения, разработчикам прикладных моделей для табличных данных и всем, кто хочет строить честные и воспроизводимые пайплайны обучения.

статья | код
  • ❤ 7
  • 🔥 5
  • 👍 3
  • 😍 1
Post #156 509
DPN-Soundness-Verification

В репозитории опубликован код для проверки корректности моделей процессов, зависящих от данных, представленных в виде сетей Петри с данными (Data Petri Nets, DPN). Авторы рассматривают более реалистичный сценарий, где поведение процесса определяется не только его структурой, но и значениями переменных. Главный результат работы — новый алгоритм проверки так называемой корректности с учётом данных. Авторы показывают, что один из прежних алгоритмов в общем случае даёт неверный результат и может не замечать некоторые случаи зацикливания. Чтобы исправить это, они предлагают сначала уточнить модель, разбивая переходы, которые изменяют переменные внутри циклов, затем добавить специальные немые переходы и после этого построить систему переходов с метками, где вершина описывает не одно конкретное состояние, а целое множество состояний с одинаковой маркировкой и разными значениями переменных. Метод реализован в виде исследовательского прототипа — настольного приложения на .NET с импортом моделей, визуализацией сети и проверкой через SMT-решатель Z3. Эксперименты показывают, что для моделей размером до 30 переходов проверка обычно занимает меньше 20 секунд, а для моделей до 60 переходов — меньше 10 минут. Код инструмента опубликован в открытом репозитории DataPetriNet. Работа будет полезна исследователям в области анализа и верификации процессов, формальных методов и process mining, а также разработчикам систем, где ход выполнения зависит от данных и условий принятия решений, а значит требует более строгой проверки, чем обычные модели бизнес-процессов.

статья | код
  • 🔥 6
  • ❤ 2
  • 👍 1
  • 🥰 1
Post #155 625
SynEL

В репозитории опубликован код SynEL — синтетического бенчмарка для связывания именованных сущностей и задач извлечения знаний из текста. Авторы рассматривают практический сценарий построения графа знаний из неструктурированных данных, где нужно не только распознавать сущности и отношения, но и правильно сопоставлять найденные упоминания с записями во внешней базе знаний. Основной акцент сделан на сущностях, которые плохо представлены в обучающих корпусах больших языковых моделей. Это особенно важно для прикладных задач вроде клиентской поддержки, корпоративных баз и внутренних реестров, где встречаются малоизвестные компании и похожие по контексту названия. Ключевая идея работы — генерировать не просто синтетические тексты, а сразу тексты с заранее заданным “правильным” ответом для линковки сущностей. Вместо наивной схемы, где модель сначала пишет диалог, а потом сама пытается разметить в нём сущности, авторы сначала выбирают сущности и связи из графа знаний, а затем заставляют LLM построить диалог, в котором эти сущности естественно появляются. Это позволяет получить реалистичные диалоги с корректной привязкой к идентификаторам в базе. В работе использованы два источника данных: энциклопедический DBpedia и российский реестр компаний ЕГРЮЛ, а также дополнительная схема с псевдонимизацией реальных диалогов. Авторы отдельно проверяют качество полученной разметки вручную. На выборке из 800 диалогов синтетические данные показывают итоговый F1 по всем типам сущностей составляет около 0.97 как для английских диалогов на DBpedia, так и для русских диалогов на основе ЕГРЮЛ. Работа будет полезна исследователям LLM, специализирующихся в графах знаний и галлюцинациях, а также командам, которые строят LLM-системы для корпоративных данных, клиентской поддержки и отраслевых реестров, где особенно важна работа с редкими и слабо представленными сущностями.

статья | код
  • ❤ 2
  • 👍 2
  • 🥰 2
Post #154 611
Activation_Pruning

В репозитории опубликован код метода Activation_Pruning — подхода к активационному прунингу нейросетей, основанного на идеях термодинамики. Авторы предлагают смотреть на распределение активаций как на физическую систему с энергетическими состояниями. Прунинг в такой интерпретации становится отбором состояний по энергетическому порогу. Это позволяет ввести термодинамические характеристики — плотность состояний, энтропию, внутреннюю энергию и, главное, свободную энергию, которая используется как основной индикатор того, когда pruning начинает разрушать качество модели. Ключевая идея работы состоит в том, что резкое ухудшение точности при прунинге похоже на фазовый переход. Пока порог невелик, модель почти не теряет качество, но после некоторого критического значения начинается быстрый спад точности. Авторы показывают, что такие переходы можно обнаруживать по поведению свободной энергии: по её экстремумам, точкам перегиба и изменению кривизны. Это даёт способ заранее оценить критический порог прунинга без полного перебора всех вариантов и без дорогостоящей серии экспериментов. Метод проверяется на большом наборе архитектур и задач. Авторы показывают, что предложенный критерий работает устойчиво и на компьютерном зрении, и на задачах обработки текста, а сама термодинамическая интерпретация даёт не только практический инструмент для прунинга, но и более глубокое понимание того, как нейросети теряют функциональную устойчивость при росте разреженности. Работа будет полезна исследователям в области сжатия нейросетей, разреженного и эффективного инференса, а также инженерам, которые хотят подбирать уровень прунинга не эмпирически, а с опорой на более интерпретируемый и теоретически обоснованный критерий.

статья | код
  • 🔥 3
  • ❤ 1
  • 👍 1
  • 🥰 1
Post #153
Открытый код ФКН ВШЭ pinned «🎉 Стартовал второй конкурс проектов с открытым кодом для студентов ФКН НИУ ВШЭ 2026! 🎉 Приглашаем вас принять участие в конкурсе проектов с открытым исходным кодом. Это отличный шанс прокачать свои навыки, сделать вклад в open-source сообщество и выиграть…»
Post #152 5.39K
🎉 Стартовал второй конкурс проектов с открытым кодом для студентов ФКН НИУ ВШЭ 2026! 🎉

Приглашаем вас принять участие в конкурсе проектов с открытым исходным кодом. Это отличный шанс прокачать свои навыки, сделать вклад в open-source сообщество и выиграть призы!

📌 Цель конкурса
– Популяризировать открытые проекты среди студентов ФКН НИУ ВШЭ.
– Поощрить создание и публикацию собственных разработок с открытым исходным кодом.

👥 Кто может участвовать
– Аспиранты и студенты всех курсов и направлений подготовки ФКН.
– Индивидуальные авторы и команды.

Принимаются проекты любых форматов:
* Результаты курсовых работ (КР)
* Выпускные квалификационные работы (ВКР)
* Любые другие инициативные разработки

🚀 Что вас ждет 🚀
- Прокачка навыков
- Интеграция в мировое open-source сообщество
- Подарки и награды победителям конкурса

📝 Как стать участником
1) Заполните заявку на сайте конкурса
2) Прикрепите ссылку на репозиторий вашего проекта (GitHub/GitLab/GitVerse)
3) Вопросы по конкурсу можно писать нам в чат

Прием заявок до 15 июля 2026 💻
Награждение победителей планируется 01 октября 2026 🏆
  • 🔥 3
  • 🥰 3
  • 👍 2
Post #151 575
aquakv

В репозитории опубликован код AQUA-KV — метода сжатия Key-Value cache для больших языковых моделей при работе с длинным контекстом. Ключевая идея AQUA-KV — использовать внутренние зависимости самого кэша. Авторы показывают, что в современных LLM есть сильная взаимосвязь как между соседними слоями, так и между ключами и значениями внутри одного слоя. На этой основе строится схема адаптивной квантизации, где компактные линейные предсказатели пытаются восстановить часть информации из уже имеющихся компонент, а квантизации подвергается только остаток, который нельзя хорошо предсказать. Эксперименты на современных моделях семейства Llama и других LLM показывают, что AQUA-KV даёт особенно сильный выигрыш в режиме жёсткого сжатия. На Llama 3.x метод превосходит KVQuant при сопоставимом или даже меньшем числе бит на значение: например, для моделей на 3B, 8B и 70B параметров средний результат на 14 задачах LongBench оказывается выше при 2.09 бита против 2.33 бита у базовой альтернативы. В аннотации авторы отдельно подчёркивают, что на Llama 3.2 удаётся получить почти без потерь качество при 2–2.5 битах на значение, с относительным ухудшением менее 1% по perplexity и LongBench. Метод также совместим с практическими сценариями инференса: поддерживаются recent-token buffer, model parallelism, offloading, speculative decoding и комбинация с pruning-подходами вроде H2O. Работа будет полезна исследователям и инженерам, которые занимаются эффективным инференсом LLM, обслуживанием длинного контекста и оптимизацией памяти в продакшене.

статья | код
  • ❤ 6
  • 🔥 4
  • 👍 3
  • 😍 1
Post #150 544
gsmformer-ppi

В репозитории опубликован код GSMFormer-PPI — мультимодальной модели для предсказания взаимодействий белок–белок. Авторы объединяют сразу три источника информации: молекулярную поверхность белка, его трёхмерную структуру и последовательность аминокислот. Для поверхности используются физико-химические дескрипторы в духе MaSIF, для структуры — графовая нейросеть, а для последовательности — поостаточные эмбеддинги из ProstT5. После этого признаки сводятся в общее пространство и обрабатываются трансформером, который учится моделировать связи между разными модальностями, а не просто склеивать их. Модель оценивается на наборе PINDER, где особое внимание уделено корректному разделению данных и снижению утечек между обучением и тестом. В прямом сравнении с графовыми базовыми моделями GSMFormer-PPI показывает заметный прирост качества: на тестовом наборе достигаются 95,7 % accuracy, 0,914 MCC, 0,988 AUROC и 0,990 AUPRC, что лучше результатов GCN, GAT и базовой версии с простым объединением признаков. Это показывает, что продвинутое слияние модальностей действительно важнее, чем простая конкатенация. Авторы отдельно проверяют вклад разных источников информации. Эксперименты показывают, что поверхностные признаки играют критическую роль, а лучшим источником последовательностных эмбеддингов оказывается именно ProstT5, который превосходит ESM-2 и ProtT5 в этой задаче. В сравнении с другими современными подходами для PPI-предсказания GSMFormer-PPI выступает на уровне лучших моделей, а по AUPRC даже превосходит более сильный метод Jha and Saha, что особенно важно для несбалансированных данных. Работа показывает, что совместный анализ поверхности, структуры и последовательности — перспективное направление для вычислительной биологии и предсказания белковых взаимодействий.

статья | код
  • 🔥 4
  • 👍 2
  • 😍 2
Post #149 643
SEFNAC_Alg

В репозитории опубликован код SEFNAC_Alg — метода поиска сообществ в сетях с признаками у узлов. Авторы рассматривают более общий случай. Помимо структуры связей между объектами учитываются ещё и их характеристики, которые могут быть количественными, категориальными или смешанными. Задача состоит в том, чтобы находить группы узлов, которые одновременно плотно связаны между собой и похожи по своим признакам. В основе метода лежит подход восстановления данных. Авторы объединяют в одном критерии две части: качество восстановления структуры графа и качество восстановления признаков узлов. На этой основе строится алгоритм SEFNAC (Sequential Extraction of Feature-rich Network Addition Clusters), который извлекает сообщества последовательно, по одному, а не пытается найти все сразу. Благодаря этому число кластеров определяется автоматически, без задания заранее. Эксперименты на синтетических и реальных данных показывают, что SEFNAC устойчиво работает в разных сценариях и остаётся конкурентоспособным по сравнению с известными методами CESNA, SIAN и EVA. Особенно хорошо алгоритм проявляет себя на средних по размеру синтетических сетях и на большинстве реальных наборов данных. В отличие от многих существующих подходов, он не ограничивается только категориальными атрибутами. Работа будет полезна исследователям в области анализа графов, кластеризации и поиска сообществ, а также специалистам, работающим с социальными, биологическими и другими сетями, где у узлов есть содержательные признаки.

статья | код
  • ❤ 5
  • 👍 3
  • 😍 2
  • 🔥 1
  • 🤔 1
Post #148 535
PT-PPI

В репозитории представлен код PT-PPI — геометрического deep learning-фреймворка для предсказания взаимодействий белок–белок. Модель использует поверхностную геометрию белков и их аминокислотные последовательности. Поверхность каждого белка представляется в виде ориентированного точечного облака с химическими и геометрическими признаками, а последовательность кодируется эмбеддингами языковой модели ProstT5. Ключевая особенность PT-PPI — способ построения графа по поверхности белка. Вместо классических схем с порогом по расстоянию или k-ближайшими соседями авторы применяют метод Spherical Convex Hull (SCHull), который без подбора гиперпараметров строит разреженный, но хорошо связный геометрический граф. Узлы такого графа проходят через сеть типа Point Transformer, где учитываются как локальные, так и глобальные пространственные отношения, после чего полученные представления объединяются с последовательностными эмбеддингами пары белков и подаются в финальный предсказатель взаимодействия. На датасете PINDER PT-PPI достигает точности и полноты на уровне современных state-of-the-art-моделей и превосходит конкурирующие подходы, такие как последовательностный D-SCRIPT, графовые GCN и GAT, модель Struct2Graph, а также гибридные архитектуры вроде SpatialPPIv2. Отдельные эксперименты показывают, что замена SCHull на стандартные способы построения графа приводит к заметному падению F1-меры и полноты, что подчёркивает важность правильного геометрического представления поверхности белка. Работа будет интересна специалистам по биоинформатике, структурной биологии и разработчикам методов геометрического глубокого обучения, которые используют информацию о форме и химии белков для предсказания их взаимодействий.

статья | код
  • 🔥 6
  • 🥰 3
Older posts →
Threads Profile ViewerView any public Threads profile without an account.Open ThreadLook →Writing with AI? Make it sound human.Metric37 rewrites AI drafts so they read naturally. Free AI detector, 1,500 words free.Try Metric37 →