TGViewer
Concise Research Concise Research @c_research · 1.25K subscribers
Post #316 520
Наука или инженерия
Мысли после ICML'26 [2/2]

В первой части обсуждали критерии научности и 10% работ, которые им соответствуют. Теперь про остальные 90%. Чему они соответствуют?

Roberto Pieraccini называет такие работы translational имея ввиду “перевод” общих методов в плоскость прикладных задач. По смыслу это ближе всего к тому что ML сообществе называют RnD:
• Составление бенчмарков
• Добавление к общему методу inductive bias конкретной модальности или задачи
• Локальные трюки и хаки

То есть высокая специфичность решений может не обобщаться, а знания и трюки — устаревать еще до появления на конференции.

Сразу отмечу, что не считаю такие работы менее интересными или ценными. Они часто проверяют полезность общих методов и закрывают актуальные вопросы, волнующие сообщество здесь и сейчас. Давайте рассмотрим на примерах.

Beyond Confidence: Adaptive and Coherent Decoding for Diffusion Language Models

Инференс DLM опирается на потокенные confidence и энтропию. Их независимость может приводить к несогласованным траекториям (одновременно размаскируем sunny и rainy в разных частях одного предложения). Авторы предлагают доп верификацию противоречивности уже после диффузионного семплинга. Это дает ускорение, метод training-free.

Полезно? Сейчас точно да. Научно? Со сменой генеративного стека и общим прогрессом качества метод может обесцениться.

CUARewardBench: Benchmark for Evaluating Reward Models on Computer-using Agent Trajectories

Первый бенчмарк сразу для outcome- и process-reward моделей, оценивающих computer-using агентов. По сути, сделали метрику (human judges) на метрику (VLM as a judge), прогнали 7 VLM и описали наблюдения. Например, что общие модели судят траектории лучше специализированных CUA, а Qwen2.5VL-72B проиграл своей же 32B 🌚

Полезно? Да, очень. Научно? Паттерн работы агентов может поменяться и бенч станет не актуален.

❗️Описанные работы ценны, но важно относиться к ним по-другому.

В чем же ценность? Для меня — в возможности понять общее направление проблем и их решений. Если обозреть их на более высоком уровне, то можно заметить интресные факты.

В диффузии, например, из DLM всё больше делают авторегрессию. Нам повезло с JustGRPO из прошлого поста — outstanding paper говорит о неоднозначности полезности произвольного порядка семплирования явно. Можно ли было понять это без той работы? Да, можно, подумав о том что стоит за Beyond confidence в этом посте и десятком аналогичных работ.

В агентах другая проблема — им никто не доверяет. FormalJudge, SERA, MAS-ProVe, ReSeek, тот же CUARewardBench: в десятках статье к агенту приделывается верификатор потому что агенты не могут оценить себя сами. Возможно, прогресс области ограничен сигналом верификации, а не способностями модели.

Практический вывод №2: translational статьи полезны, особенно если смотреть глубже частных трюков и стараться обобщать.

И снова, не важно где вы изучаете работы. Надеюсь, кому-то подобный подход к разбору статей хотя бы немного упростит жизнь.
  • ❤ 5
  • 🔥 4
More from @c_research
  1. Aug 3, 2026Наука или инженерия Мысли после ICML'26 [1/2] Не важно ходишь ли по постерам в Сеуле или п…
  2. Jul 14, 2026Рассказываем о новой unified-модели в Alice AI С недавних пор в Алисе AI и Шедевруме появи…
  3. Jul 7, 2026ICML’26 Зачем ездить на конференции? Конечно, чтобы презентовать свои статьи и читать чужи…
  4. Jul 3, 2026Агентская мультимодалка спустя те же 14 месяцев: закрыли ли разрыв, который не закрыла уни…
  5. Jul 2, 2026Унифицированная мультимодалка спустя 14 месяцев: где обещанная синергия? В мае 2025 BAGEL…
  6. Jun 29, 2026Результаты На IA-Bench Qwen-Image-Agent даёт IA-score 45.4. Для контекста: • Nano Banana P…
Threads Profile ViewerView any public Threads profile without an account.Open ThreadLook →Writing with AI? Make it sound human.Metric37 rewrites AI drafts so they read naturally. Free AI detector, 1,500 words free.Try Metric37 →