TGViewer
Channel Public Channel
Mashkka про Data Science

Mashkka про Data Science

@mashkka_ds

Погружение в Data Science и технологии GenAI
Subscribers
5.18K
Photos
3K
Videos
294
Links
1.3K
Recent Posts 3 shown
Post #3765 273

Forwarded from Kali Novskaya

🌸AI Research Preference Model🌸
#nlp #про_nlp #nlp_papers

Сегодня опять про скаффолды для агентов. Мы уже говорили про то, хорошая ли идея применить сверху preference models для оценки потенциала идей (спойлер: нет). А что, если попробовать обучить такую preference-модель не на вкусовщине (новизна идеи, "вкус", интуиция и т.д.), а на верифицируемом сигнале? Про это наша новая статья — “AI Research Preference Models”.

🌸TL;DR

Главная проблема: AI-агент может быстро придумать множество вариантов эксперимента, но полноценный запуск каждого варианта — обучение модели и оценка результата — требует часов работы GPU. Поэтому критически важно заранее понять, какие идеи действительно стоит проверять.

Мы предлагаем Research Preference Model (RPM) — модель, которая сравнивает несколько предложенных решений и выбирает наиболее перспективное до их полного запуска. В идеале, такая модель может выучить паттерны лучших практик МЛ, чтобы использовать эту информацию для попарного сравнения экспериментов, какой будет более перспективным.
Рассматриваются два варианта:
Inference-only RPM анализирует планы, код и результаты предыдущих экспериментов только при помощи рассуждений LLM.
Agentic RPM дополнительно проводит дешёвые пилотные эксперименты: запускает сокращённое обучение (5 минут, 30 минут, 4 часа), проверяет код и использует полученные метрики для выбора.

🌸Агент
RPM встроена в исследовательского агента AIRA-dojo. На каждом шаге агент генерирует 15 вариантов продолжения, после чего RPM проводит попарное сравнение и отправляет на полноценный запуск только победителя.

🌸Данные
Эксперименты проведены на 20 задачах AIRS-Bench, охватывающих языковое моделирование, математику, биоинформатику и временные ряды. Каждому запуску предоставлялись 24 часа на одной H200 GPU.

🌸Основные результаты
обычный AIRA-dojo: 0,684 среднего нормализованного балла;
с Inference-only RPM: 0,711;
с Agentic RPM: 0,729;
теоретически достижимый результат: 0,748.
Обе RPM достигают результата обычного 24-часового агента примерно за 15 часов, то есть требуют примерно в 1,5 раза меньше вычислений. Кроме того, были получены новые SOTA:
94,1% на WinoGrande против прежнего агентного SOTA 90,4%;
95,7% на SVAMP против опубликованного человеческого SOTA 94,2%.

🌸Главный вывод статьи:
прогресс исследовательских агентов зависит не только от способности генерировать хорошие идеи, но и от умения выбирать, какие идеи заслуживают дорогой экспериментальной проверки. Дополнительные вычисления выгодно тратить не только на генерацию решений, но и на их предварительный отбор, основанный на предсказуемых и верифицируемых сигналах.
Сигнала от мини-версии эксперимента, с первых 5 минут, бывает вполне достаточно!
Проверено на одном скаффолде, но для всех tree-search подходов такой апгрейд должен сработать.

🟣Arxiv https://arxiv.org/abs/2608.13940
🟣Alpharxiv https://www.alphaxiv.org/abs/2608.13940
  • 🔥 2
Post #3759 613
#justaboutme Ангелочек

Этот образ задумывался как образ черного ангела, но у вселенной были другие планы на нас. И когда нам по ошибке доставили белые крылья вместо черных, да еще и привезли их в последний момент, мы решили, что ангельской фотосессии все равно быть. Такого образа точно нет ни у кого!

#justaboutme воскресная рубрика, в которой я делюсь яркими событиями из своей жизни, не связанными с DS и ИТ, подобно тому, как я это делаю в соцсетях (например, в инсте или VK).

#фотосессия #photoshoot #ангел #angel #justaboutme
  • 🥰 6
  • 👍 1
  • 🔥 1
  • 😐 1
Post #3749 560

Forwarded from RnD ML Team

⚡️ PML Conf от Яндекса

Не успели закончиться эмоции от Deep Tech Night, а тут очередная конференция от Яндекса для тех, кто делает реальный AI (как говорят сами организаторы)! Сегодня в Москве прошёл Practical ML Conf 2026, вроде бы это уже в четвертый раз. Если коротко: это не просто "ещё один ML-ивент", а точка притяжения большого количества AI-энтузиастов со всей страны, где идет бесконечный нетворк и обмен опытом.

🔬 Про программу
В центре внимания 2026 года — агентные системы, эффективный инференс LLM, генеративные рекомендации, мультимодальный ИИ, автономный транспорт и робототехника.

На докладах побывать практически не удалось, весь день ушел на нетворкинг, но особо зацепил доклад "Agentic Vision: как научить VLM рассуждать и использовать инструменты". Современные VLM часто ошибаются в деталях, при подсчёте объектов и пространственных отношениях. Один из способов повысить качество — дать модели возможность не отвечать сразу, а получить дополнительную визуальную информацию, вызвать внешние инструменты и скорректировать решение по результатам промежуточных шагов.

🎤 Наши на сцене
От нас выступала Алёна Феногенова с наболевшей темой — бенчмаркингом в GenAI следующего поколения. Она руководит проектом MERA и занимается созданием технологий комплексной оценки моделей и AI-агентов — от качества отдельных способностей до работы в интерактивных средах. Тема, которая сейчас волнует всех, кто строит этих ваших уроборосов)

🏆 Yandex ML Prize
В рамках конференции вручили Yandex ML Prize — премию Яндекса при экспертной поддержке ШАДа за вклад в развитие машинного обучения. В этом году три номинации: Преподаватели, Руководители образовательных программ и Начинающие преподаватели. Победили товарищи из AIRI, включая Ивана Оселедца и его сотрудников.

🕹️ Стенды и активности
Отдельный кайф — зона знакомства с сервисами Яндекса. Иммерсивный опыт, фотобудка, роборуки, датчики, AI-сервисы — всё, что можно пощупать, включая беспилотные тачки и пухососы. Свои ML-решения показали Поисковые сервисы и ИИ, Вертикали, Персональные и Городские сервисы, Автономный транспорт, Yandex Cloud, Yandex Crowd и Яндекс 360.

🎁 Мерч и афтепати
Мерч — отдельный пунктик любой конференции. Подарили кофе в дрип-пакетах и термокружку. В этот раз без живой музыки, но и без неё было хорошо. А на афтепати можно было взять розы, заморозить и разбить молотком, или кому-нибудь подарить, что мы и сделали 🌹

🤝 Нетворкинг
Люди — главный магнит любой конференции, и не важно, сколько она стоит. Сегодня было ну очень много знакомых, включая коллег из GigaChat, AIRI и ML-каналов: @doomgrad, @n_it_girls, @aboutscientists, @Ivan_Oseledets, @Roma_Data, @tech_priestess, @girafe_ai, @rads_ai, @buckwheat_thoughts и другие.

Вместо заключения: Яндекс в очередной раз подтверждает, что умеет делать ивенты, а PML Conf заслуженно входит в топ рейтинга. Отдельное спасибо Пете Ермакову и Кате Мамонтовой за организацию. Вы крутые. 🔥

#pmlconf #conference #yandex
  • ❤ 4
  • 🔥 4
Older posts →

About this channel

How can I read @mashkka_ds without a Telegram account?
TGViewer shows the public web preview Telegram publishes for Mashkka про Data Science: recent posts, photos, videos and the subscriber count, with no app, login or account.
How many subscribers does Mashkka про Data Science have?
Mashkka про Data Science (@mashkka_ds) has 5.18K subscribers on Telegram, refreshed roughly every 30 minutes.
Does Mashkka про Data Science know I viewed it here?
No. Public channel previews carry no viewer identity, and TGViewer has no accounts or tracking of what you look up.
Threads Profile ViewerView any public Threads profile without an account.Open ThreadLook →Writing with AI? Make it sound human.Metric37 rewrites AI drafts so they read naturally. Free AI detector, 1,500 words free.Try Metric37 →