TGViewer
Channel Public Channel
Открытый код ФКН ВШЭ

Открытый код ФКН ВШЭ

@hse_cs_opensource

Показываем новости по открытому коду ФКН ВШЭ.

Контакты: Михаил Гущин @mhushchyn
Subscribers
935
Photos
82
Videos
1
Links
162

Showing posts older than #148 · Back to latest

Older Posts 20 shown
Post #147 556
hse-rtcms4j

Система RTCMS4J - платформа для автоматического создания, версионирования и изменения конфигураций, представляемых в коде в виде Bean классов хранения данных (POJO, DTO), для приложений, использующих фреймворк Spring Boot. Репозиторий представляет проект масштабируемой распределенной системы, включающей фронтенд и бекенд. Реализована способность интегрироваться с внешней СУБД PostgreSQL, кешом и шиной сообщений Valkey, и системой авторизации Keycloak. Данная система предоставляет готовое решение для управления конфигурациями распределенных систем и приложений, способных менять свое поведение динамически в реальном времени.
Репозиторий может быть полезен backend и full-stack специалистам и Java разработчикам.

А самим авторам будет полезен ваш фидбек!

код
  • ❤ 4
  • 👍 2
  • 🔥 2
  • 🥰 1
Post #146 606
ML2B

В репозитории представлен код для воспроизведения результатов работы над ML2B — многоязычным бенчмарком для автоматизированной разработки ML-решений и AutoML-агентов на базе больших языковых моделей. Авторы берут 30 реальных соревнований Kaggle и аккуратно переводят их задания на 13 языков, включая русский, китайский, арабский, казахский, польский и другие. Для каждой задачи задаются чёткие метаданные: тип данных (табличные, текст, изображения), предметная область (12 доменов — от медицины и экологии до финансов и городского планирования), метрика качества и формат ответа. Поддерживаются простой вариант решение с одной функцией предсказания и модульный формат с раздельным обучением, подготовкой данных и предсказанием, что уменьшает риск утечек данных на этапе предобработки и упрощает статический анализ кода. Дополнительно в бенчмарк включены 6 закрытых соревнований, по которым нет открытых ноутбуков Kaggle, — это снижает риск того, что ответы на задачи уже «зашиты» в обучающие данные LLM. В серии экспериментов авторы сравнивают несколько крупных языковых моделей и их связки внутри двух агентных систем AIDE и ML Master. Работа может быть полезна исследователям агентов, LLM и автоматизированных пайплайнов по решению data science задач.

статья | код
  • ❤ 3
  • 🔥 3
  • 😍 3
Post #145 707
hotpp-benchmark

В репозитории опубликован код бенчмарка HoTPP для оценки моделей на дальнем горизонте предсказания событийных последовательностей. Авторы рассматривают данные в формате помеченных временных точечных процессов (MTTP): интернет-активность, транзакции, медицинские записи, социальные сети. В отличие от большинства работ, сосредоточенных на прогнозе только следующего события, HoTPP специально нацелен на сценарий предсказания на горизонт, где копятся ошибки авторегрессии и особенно важна корректная методика оценки. HoTPP объединяет данные из финансов (Transactions), медицины (MIMIC-IV), социальных сетей (Retweet, StackOverflow) и электронной коммерции (Amazon), а также реализует широкий набор методов. Эксперименты показывают, что модели, хорошиe в задаче следующего события, часто проседают на длинном горизонте, а простые статистические схемы нередко сопоставимы или лучше современных нейросетевых MTTP. Работа будет полезна исследователям временных точечных процессов и последовательностей событий, разработчикам рекомендательных и финтех-систем, а также инженерам, которым нужно честно сравнивать модели в задачах долгосрочного прогнозирования.

статья | код
  • ❤ 4
  • 🔥 3
  • 👍 2
  • 😍 1
Post #144 482

Forwarded from SourceCraft

⏰ Продолжается приём заявок на гранты Yandex Open Source × SourceCraft

Программа грантов поддерживает опенсорс-проекты независимых разработчиков и помогает авторам сделать свой вклад заметным для сообщества и индустрии.

В программе три трека
🔵 Обработка и хранение данных
🔵 Разработка
🔵 Искусственный интеллект

Для участия достаточно заполнить форму и разместить проект в публичном репозитории SourceCraft под личным аккаунтом для подтверждения авторства.

📌 Заявки принимаются до 15 марта. Победители получат гранты в размере 600 тысяч рублей на год на облачные технологии Yandex Cloud.

〰️ Программа грантов
Post #143 465
Сегодня наши друзья из ИТМО проводят митап с докладами на разные темы Open Source и не только. Полная программа тут.

Трансляция начнется в 18-25. Подключайтесь послушать!
  • 🔥 7
  • ❤ 3
  • 😍 3
Post #142 689
Всероссийский конкурс проектов с открытым кодом

Продолжается прием заявок на всероссийский конкурс проектов с открытым кодом. Можно участвовать со своим проектом, разместив его на GitHub или GitLab с открытой лицензией. Также можно участвовать с мердж-реквестом в любом из существующих проектов.

Эксперты из ведущих IT компаний оценят проекты. Лучших ждет CodeReview от экспертов ведущих технологических компаний и подготовка к публикации статьи о проекте. Также лучшие участники получат возможность пройти стажировки в крупных IT-компаниях.

🏆Победители и призеры прошлого года: https://foss.kruzhok.org/results_2024


⏰ Прием конкурсных заявок до 01.03.2026

⚠️ Детали и форма подачи заявки на https://foss.kruzhok.org
  • 🔥 4
  • 😍 2
  • 👍 1
Post #141 482
self-supervised-depth-estimation

В репозитории представлен код к работе по самопроверочному восстановлению глубины с учетом временной информации и механизмов внимания. Авторы рассматривают задачу оценки глубины по видеопоследовательности с одной камеры, где модель одновременно восстанавливает структуру сцены и движение камеры, обучаясь только на видеорядах без карт истинной глубины. Базой служит классический self-supervised pipeline в духе Monodepth2. Отдельные сети предсказывают карту глубины и относительные позы между кадрами, а модель обучается по фотометрической ошибке между реальным кадром и синтезированным с помощью геометрических преобразований. Эксперименты на наборе KITTI показывают, что предложенные модификации улучшают качество относительно базовой Monodepth2 по ключевой метрике RMSE и дают особенно выигрыши на удалённых объектах и областях с большой вариацией глубины. Последовательный режим работы, когда на тесте модель прокручивает несколько предыдущих кадров, дополнительно снижает ошибки. Работа будет полезна исследователям в области компьютерного зрения и робототехники, инженерам, занимающимся системами помощи водителю и автономным вождением, а также разработчикам AR-и VR-приложений, где требуется оценка глубины в реальном времени из видеопотока.

статья | код
  • ❤ 4
  • 🔥 3
  • 👍 2
Post #140 614
HyperDomainNet

В репозитории опубликован код к работе HyperDomainNet: Universal Domain Adaptation for GANs, посвящённой адаптации StyleGAN2 к новым стилям и доменам при очень малом числе параметров. Вместо дообучения всех 30 миллионов весов генератора авторы предлагают domain-modulation: для каждого целевого домена оптимизируется один вектор размерности около 6 тысяч координат, который подключается в модуль модулируемых свёрток StyleGAN2 и управляет сдвигом стиля. При этом качество адаптации практически не уступает полному дообучению модели. Поверх этого подхода вводится новый регуляризатор indomain angle consistency, который заставляет сохранять попарные косинусные расстояния между изображениями в пространстве эмбеддингов CLIP до и после адаптации. Это заметно уменьшает эффект схлопывания мод и помогает сохранить разнообразие сгенерированных лиц в новом стиле, что видно и по метрикам, и по примерам для доменов вроде аниме-портрет. Авторский вариант MindTheGap с новым параметрическим представлением и этим регуляризатором даёт сопоставимое качество с исходным методом при сокращении числа обучаемых параметров примерно в тысячу раз. Работа будет полезна исследователям генеративных моделей, тем, кто занимается few-shot-адаптацией GAN по тексту или единичным изображениям, а также разработчикам интерактивных инструментов для художественного и стилистического редактирования изображений.

статья | код
  • ❤ 7
  • 🔥 2
  • 👍 1
Post #139 614

Forwarded from А когда не Мишан?

Дорогие коллеги 🦔

Наша работа 🐮CasTex🐮 принята на конференцию WACV 2026! Мы выложили новую версию статьи на arXiv и код — будем очень рады вашим звездочкам ⭐️ и репостам 💋

CasTex: Cascaded Text-to-Texture Synthesis via Explicit Texture Maps and Physically-Based Shading

🐮CasTex🐮 — это метод генерации переосвещаемых PBR-текстур по текстовому промпту на основе Score Distillation Sampling (SDS). Мы заметили, что стандартная связка SDS с латентной диффузией часто создает неестественные артефакты и требует сложной неявной параметризации для их маскировки. В противовес этому мы предлагаем использовать каскадные модели непосредственно в пиксельном пространстве. Это позволяет нам напрямую и эффективно оптимизировать явные текстурные карты (albedo, roughness, metalness, normals), получая на выходе физически корректные материалы.

🐮 arXiv — ставьте лайки на alphaxiv
📱 Twitter — репостните наш пост
📱 GitHub — ставьте звездочки
🌐 Project Page — там классные визуализации

P.S. Мы также сделали эмодзи- и стикер-паки наших коровок, которые вы можете себе добавить ❤️
  • 🔥 9
  • ❤ 7
  • 👍 6
Post #138 532
Коллеги из Центра глубинного обучения и байесовских методов делятся своим новым проектом с открытым кодом
Post #137 718
Привет!
Возможно вам или вашим знакомым будет интересно 🔭

Сейчас в НИУ ВШЭ проходит кампания по привлечению международных специалистов на вакансию Assistant Professor in Computer Science в рамках Tenure Track.

Tenure Track — программа международной академической карьеры для кандидатов, которые имеют степень PhD, полученную в ведущем зарубежном университете или исследовательском центре.

Прием заявок продлится до 15 января 2026 года. Подробности о конкурсе по направлению Computer Science — на странице Центра рекрутинга и аттестации международных специалистов НИУ ВШЭ:
https://iri.hse.ru/ru/TT_CompSci_2025.
  • 👍 2
  • 👎 2
  • 🔥 1
  • 🐳 1
Post #136 688
MAD-CV

В репозитории представлен код для воспроизведения результатов работы по снижению дисперсии оценок для аддитивных функционалов марковских цепей на основе нового мартингального разложения. Авторы рассматривают задачу вычисления среднего по стационарному распределению, когда прямые независимые выборки сделать нельзя и приходится использовать методы Маркова–Монте-Карло. Предлагаемый подход не требует знать стационарное распределение, не опирается на обратимость переходного оператора и применим как к классическим MCMC-алгоритмам, так и к дискретизациям диффузионных процессов. Для цепей с гауссовским шумом получены строгие неасимптотические оценки. В численных экспериментах рассмотрены одномерный и двумерный случаи. Показано, что предложенный метод даёт значительное уменьшение дисперсии при разумных вычислительных затратах. Коэффициент стоимость-к-дисперсии заметно лучше, чем у наивного метода без контрольных вариаций. Работа будет полезна исследователям в области Монте-Карло и марковских цепей, специалистам по байесовской статистике и стохастическому анализу.

статья | код
GitHub GitHub - svsamsonov/MAD-CV: Variance reduction with martingale representations Variance reduction with martingale representations - svsamsonov/MAD-CV
  • ❤ 4
  • 👍 3
  • 🔥 3
Post #135 681
miad

В репозитории опубликован код модели Mirage Atom Diffusion — диффузионного генератора для de novo синтеза кристаллов, который умеет менять число атомов в ячейке прямо в процессе генерации. Авторы исходят из того, что современные диффузионные модели для материалов работают с фиксированным числом атомов и тем самым ограничивают пространство траекторий. Модель не может добавить или убрать атом по ходу синтеза, что ухудшает как разнообразие, так и качество структур. В расширенном пространстве структур к каждому реальному кристаллу добавляются миражные атомы специального типа. Они ведут себя как обычные атомы в диффузионном процессе, но при обучении их координаты не штрафуются в функции потерь. MiAD строится поверх базовой совместной диффузионной модели для решётки, дробных координат и типов атомов и обучается на наборе MP-20. Качество оценивается по метрике S.U.N. (Stable, Unique, Novel) — доле материалов, которые одновременно стабильны, уникальны и отсутствуют в обучающем наборе. На 10 000 сгенерированных кристаллах MiAD достигает 8,2 % S.U.N. (по DFT), заметно обгоняя лучшие предыдущие модели, включая ADiT и WyFormer, и даёт до ×2,5 улучшения по S.U.N. по сравнению с исходным DiffCSP без mirage infusion. Аналогичные преимущества сохраняются и при более дешёвой оценке стабильности с помощью ML-потенциалов CHGNet и eq-V2. Работа может быть полезна исследователям новых материалов и генеративных моделей.

статья | код
GitHub GitHub - andrey-okhotin/miad: Official implementation of paper MiAD: Mirage Atom Diffusion for De Novo Crystal Generation Official implementation of paper MiAD: Mirage Atom Diffusion for De Novo Crystal Generation - andrey-okhotin/miad
  • ❤ 6
  • 🔥 3
  • 👍 1
  • 🤔 1
Post #134 618
gfnx

Библиотека gfnx — быстрая и масшатбируемая JAX-платформа для обучения и оценки Generative Flow Networks. В отличие от существующих решений вроде torchgfn, где логика среды работает на процессоре и постоянно обменивается данными с видеокартой, gfnx переносит и среды, и обучение целиком на GPU. Вся вычислительная цепочка компилируется целиком с помощью JIT, что резко уменьшает накладные расходы и упрощает крупные серии экспериментов. Библиотека включает набор типовых сред из литературы по GFlowNet: синтетические гиперрешётки, генерацию двоичных последовательностей, задачи проектирования ДНК-последовательностей (TFBind8), генерацию молекул (QM9), синтез антимикробных пептидов (AMP), построение филогенетических деревьев, байесовское восстановление структуры графов и выборки из модели Изинга. Эксперименты показывают серьёзный выигрыш по времени работы при том же качестве выборок. На задачах последовательностей и молекул gfnx ускоряет обучение по сравнению с PyTorch-реализациями в десятки раз. В гиперрешётках и биологических задачах библиотека достигает тех же метрик расхождения с истинным распределением, что и базовые реализации, но при значительно большем числе итераций в секунду. Работа может быть полезна исследователям GFlowNet и обучения с подкреплением, а также тем, кто занимается амортизированным семплированием в комбинаторных и научных задачах.

статья | код
GitHub GitHub - d-tiapkin/gfnx: Environments and Algorithms for Generative Flow Networks in JAX Environments and Algorithms for Generative Flow Networks in JAX - d-tiapkin/gfnx
  • 🔥 8
  • 👍 4
  • ❤ 1
  • 🤩 1
Post #133 655
QuAP

В репозитории представлен код для воспроизведения результатов работы по теории и оцениванию долей смешения в популяционной геномике. Авторы обращают внимание, что такие величины, как admixture fractions, давно стали стандартным инструментом в анализе данных (например, в программах Structure и ADMIXTURE), но их статистические свойства в рамках строгих моделей изучены недостаточно. В работе получены теоретические выражения, позволяющие предсказывать средние значения и дисперсии долей смешения внутри популяции с учётом рекомбинации и генетического дрейфа. На основе этих результатов предложен практический метод оценивания параметров потока генов по уже рассчитанным долям смешения. Авторы показывают, как корректировать оценки моментов с учётом ошибок, возникающих при вычислении admixture fractions, и как работать с неполными данными генотипов. Предложенная процедура, реализованная в пакете QuAP, использует регрессию наблюдаемых статистик по хромосомам разной длины на теоретические кривые и позволяет восстанавливать время начала, длительность и интенсивность миграции. Работа будет полезна исследователям в области популяционной генетики и вычислительной геномики.

статья | код
GitHub GitHub - Genomics-HSE/QuAP: The method for estimating of parameters of a constant migration. The method for estimating of parameters of a constant migration. - Genomics-HSE/QuAP
  • ❤ 4
  • 👍 2
  • 🔥 1
Post #132 657
autojudge

В репозитории опубликован код AutoJudge — метода ускорения вывода больших языковых моделей за счёт приближённого семплирования вместо точного повторения вывода исходной модели. Вместо того чтобы строго отклонять все расхождения между черновой и целевой моделью, AutoJudge автоматически определяет, какие различающиеся токены действительно важны для качества ответа, а какие можно сгенерировать быстрее упрощённой моделью без заметной потери точности. Важность токена определяется не по форме, а по влиянию на конечный результат задачи. Авторы предлагают поисковый алгоритм, который последовательно подменяет токены ответа целевой модели на варианты черновой модели и заново достраивает продолжение. Метод не требует ручной разметки и легко встраивается в существующие фреймворки вывода. В экспериментах на задачах математического рассуждения (GSM8K) и программирования (LiveCodeBench) с моделями семейств Llama 3 и Qwen2.5 AutoJudge позволяет принимать в среднем 20–45 токенов за один шаг проверки целевой моделью и даёт ускорение до ~2 раз по сравнению со стандартным speculative decoding при падении точности не более чем на 1–2 процентных пункта. Отдельные эксперименты с vLLM показывают прирост скорости до 1.5–2 раз для связок 8B→70B и даже 8B→405B параметров. Работа будет полезна исследователям, занимающимся ускорением вывода и тест-тайм вычислениями в LLM, инженерам, внедряющим большие модели, а также разработчикам инфраструктуры вывода и фреймворков для генерации.

статья | код
GitHub GitHub - garipovroma/autojudge: [NeurIPS 2025] Official PyTorch implementation for the paper AutoJudge: Judge Decoding Without… [NeurIPS 2025] Official PyTorch implementation for the paper AutoJudge: Judge Decoding Without Manual Annotation - garipovroma/autojudge
  • ❤ 5
  • ❤‍🔥 1
  • 👎 1
  • 🔥 1
  • 🤨 1
Post #131 594
Tight Bounds for Schrödinger Potential Estimation

В репозитории опубликован код для воспроизведения результатов работы по оценке потенциала Шрёдингера в задачах генеративного моделирования и переноса распределений без парных данных. Авторы рассматривают постановку моста Шрёдингера, где по выборкам из начального и целевого распределений нужно построить наиболее близкую к опорной динамике стохастическую связь между ними. В качестве опорного процесса вместо классического броуновского движения берётся процесс Орнштейна–Уленбека с экспоненциальным смешением, что позволяет лучше учитывать структуру данных и уменьшить нежелательную долгую зависимость между начальным и конечным состояниями. Для проверки теории авторы модифицируют практический алгоритм Light Schrödinger Bridge, заменяя в нём опорную динамику на процесс Орнштейна–Уленбека. Новый вариант, обозначаемый как LightSB-OU, демонстрирует более точное восстановление целевого распределения в задачах на смесях нормальных распределений, даёт улучшения по расстоянию Васерштейна и MMD и лучше покрывает моды. На биологических данных по динамике клеток метод показывает качество на уровне лучших современных подходов и улучшает базовый LightSB. В задаче непарного переноса изображений взрослый–ребёнок и мужчина–женщина в латентном пространстве автоэнкодера модель на основе процесса Орнштейна–Уленбека лучше сохраняет важные визуальные признаки, такие как оттенок кожи и форма лица. Работа будет интересна исследователям стохастического оптимального управления и моста Шрёдингера, специалистам по генеративным моделям, а также практикам, которым требуется строгий контроль обобщающей ошибки при обучении по непарным данным.

статья | код
  • 🔥 4
  • ❤ 2
  • 👍 1
Post #130 711
ProcrustesGPT

В репозитории опубликован код ProcrustesGPT — подхода к сжатию больших языковых моделей, который опирается на структурированные матрицы и ортогональные преобразования весов. Авторы используют тот факт, что выход трансформера не меняется, если внутри слоя повернуть скрытое пространство ортогональной матрицей и соответствующим образом скорректировать скип-соединения. Рассматриваются два семейства представлений: суммы произведений Кронекера и так называемые GS-матрицы, обобщающие известные Monarch-структуры. Эксперименты на моделях OPT и Llama2 показывают, что при сжатии порядка 14–36 % по числу параметров ProcrustesGPT даёт меньшую потерю качества, чем SliceGPT и другие методы без дообучения, как по перплексии на WikiText2, так и по нулевому обучению на задачах ARC, HellaSwag, PIQA и WinoGrande. Особенно заметен выигрыш на моделях Llama2, где средняя точность после сжатия остаётся близкой к исходной и существенно превосходит альтернативы. Работа демонстрирует, что грамотно подобранные ортогональные преобразования могут сделать структурированные разложения практичным инструментом сжатия LLM без дополнительного обучения. Код может быть полезен исследователям сжатия нейросетей, инженерам, внедряющим LLM в ресурсно-ограниченные среды, и разработчикам, работающим со структурированными матричными разложениями.

статья | код
GitHub GitHub - GrishKate/ProcrustesGPT Contribute to GrishKate/ProcrustesGPT development by creating an account on GitHub.
  • 🔥 16
  • ❤ 2
Post #129 822
when-punctuation-matters

В репозитории опубликован код и протокол масштабного сравнения методов повышения устойчивости моделей к формату запроса. Авторы берут 8 открытых LLM из семейств Llama, Qwen и Gemma, 52 задачи из набора Natural Instructions и системно оценивают пять подходов: калибровку батча, ансамбли шаблонов, чувствительное к возмущениям декодирование, дообучение LoRA с форматными аугментациями и LoRA с согласующим штрафом. Результаты дополнены проверкой на GPT-4.1 и DeepSeek V3, чтобы понять, как ведут себя «флагманские» модели при изменении пробелов, пунктуации и разметки вариантов ответа. Авторы выяснили, что калибровка батча одновременно повышает точность и снижает разброс качества между разными форматами, оставаясь почти бесплатной по вычислениям; однако при сильном перекосе классов её преимущество исчезает. Исследователи также проверяют переносимость под сдвигами распределения: при композиционном сдвиге по форматам влияние невелико, а при переносе между наборами данных точность LoRA зависит от домена исходного обучения. Работа может быть полезна практикам, которым нужна стабильность LLM в продакшене; исследователям оценки и калибровки; командам, внедряющим ботов и ассистентов в чувствительных сценариях, где изменение шаблона промпта недопустимо.

статья | код
GitHub GitHub - AIRI-Institute/when-punctuation-matters Contribute to AIRI-Institute/when-punctuation-matters development by creating an account on GitHub.
  • ❤ 5
  • 🔥 3
Post #128 883

Forwarded from Yandex Open Source Jam /chat

Псс 👀 еще не забыли про нас?

Yandex Open Source Jam возвращается!

Уже 24 ноября мы будем ждать вас в Москве и онлайн на нашем третьем опенсорс-джеме. В этот раз мероприятие проходит при поддержке платформы для разработчиков SourceCraft: ребята подготовили для вас много интересных активностей и приятные призы.

Что еще вас ждет на джеме — смотрите на сайте. И регистрируйтесь по ссылке ❤️

До встречи!
  • ❤ 4
Older posts →
Threads Profile ViewerView any public Threads profile without an account.Open ThreadLook →Writing with AI? Make it sound human.Metric37 rewrites AI drafts so they read naturally. Free AI detector, 1,500 words free.Try Metric37 →