TGViewer
Maxim.ML - канал Maxim.ML - канал @ml_maxim · 1.05K subscribers
Post #99 939
Про Context-Driven Solving

Вчера я рассказал про свое VLM-решение на Yandex Cup: Qwen, STEM-задачи и все, что вокруг них. Теперь - более верхнеуровневая часть истории: про мой подход к соревнованиям, когда в процессе появился co-solver, и почему я называю этот метод Context-Driven Solving

Что такое Context-Driven Solving

Коротко: это способ решать ML-задачи, где вы управляете контекстом и постановкой, а агент берет на себя максимально возможный объем итеративных изменений.

Главная валюта и фактор успеха - это не только GPU и токены, но и количество осмысленных гипотез, которые вы успеваете проверить, плюс ширина вашего понимания задачи

Что нужно сделать, чтобы ваш co-solver заработал

Если совсем упрощать, вам нужно создать три вещи

1️⃣ Честную систему оценки решения (метрики)
2️⃣ Пространство для записи и чтения логов экспериментов
3️⃣ Пространство с контекстом для генерации идей

В моем случае co-solver - это Cursor, который умеет писать и перебирать код. Но у него нет понимания, как итеративно идти к улучшению решения. Для этого нужно создать удобный контур локальной валидации.

Например: поднять контейнер с решением, прогонять его на val-выборке и сделать результаты доступными для Cursor - например, через MCP (Model Context Protocol)

Как это работало у меня

🔵 Собрал около 9k примеров из трех датасетов, затем отобрал по 250 из каждого для быстрой локальной валидации
🔵 Описал правила: какие изменения считаются новой гипотезой, как меряем качество, когда считаем эксперимент неуспешным. Это определяющий шаг для автономности: чем лучше прописаны правила, тем меньше у co-solver'а галлюцинаций
🔵 Дал агенту право генерировать варианты кода, промптов и пайплайнов, а система валидации сама выявляла лучшие идеи

В итоге получилось провести 64 эксперимента за время соревнования. В ручном режиме я еле-еле дожал бы до двух десятков

Ловушка контекста

При этом co-solver - все еще помощник.
Если вы плохо понимаете доменную область, даете сырое описание задачи и расплывчатые метрики, агент просто масштабирует это непонимание. Он честно и быстро ведет вас в локальный оптимум.

Ваша задача - создать систему проверки и качественно описать идеи. Результат оказывается лучше суммы частей только если архитектор силен. Если архитектор слабый - co-solver просто ускоряет путь в тупик.

Что будет в соревновательном ML в 2026

Думаю, 2026 год будет еще интереснее:

1. Задачки вида «подкрутите fine-tune» уйдут. Уже появляются skills, которые делают finetune «из коробки». По сути, за нас сделали MCP для задач обучения - это круто.
2. Появятся сложные форматы с агентами, многошаговой логикой и ограничениями по контексту.

Ориентиром уже сейчас выглядят соревнования уровня AI Journey 2025 у Сбера, где одной «большой моделью» без архитектурного дизайна не обойтись (вот тут в канале у дяди делали разбор топовых решений - получилось интересно).

Итог

Призываю всех пробовать участвовать в соревнованиях. В первую очередь самостоятельно, чтобы расширять свой контекст, но и во вторую - при помощи LLM и co-solver’ов.

Даже если ваша цель - не победа, а просто практика, вы:

🔵 лучше поймете, как ставить задачи моделям
🔵 научитесь строить рабочие контексты
🔵 увидите, где ваш способ мышления реально упирается в потолок

Соревнования - это безопасная песочница, где можно экспериментировать с Context-Driven Solving и учиться работать в паре с ИИ
  • 👍 6
  • ❤ 2
  • 🔥 2
More from @ml_maxim
  1. Sep 17, 2026Тут huawei выпустила отчёт intelligent world 2035, там целых 10 смелых прогнозов, советую…
  2. Sep 14, 2026Показательно получилось 🛌 Вчера таки написал на habr про то, как легко теперь копировать…
  3. Sep 11, 2026Сходил за сырниками, а пришлось анализировать данные 📈 В магазине играла знакомая песня.…
  4. Sep 8, 2026Выхожу из декретного творческого отпуска 🛌 и сразу рассказываю свои апдейты и новости, на…
  5. Apr 14, 2026Архитектуру построили. А ML - нет 🤷‍♂️ Завершился наш с Никитой модуль по AI-агентам в ВШ…
  6. Mar 31, 2026Как неожиданно и приятно Месяц назад отправлял свою рукопись в ainl, сегодня пришёл резуль…
Threads Profile ViewerView any public Threads profile without an account.Open ThreadLook →Writing with AI? Make it sound human.Metric37 rewrites AI drafts so they read naturally. Free AI detector, 1,500 words free.Try Metric37 →