TGViewer
Concise Research Concise Research @c_research · 1.25K subscribers
Post #315 471
Наука или инженерия
Мысли после ICML'26 [1/2]

Не важно ходишь ли по постерам в Сеуле или пытаешься читать по заверениям дедов фид arxiv cs.ai 👴: твой контекст не бесконечен и не очевидно на что его тратить.

Есть такой Roberto Pieraccini, я бы его описал как Шмитхубера здорового человека: много чего сделал и понял, но не пытается причислить себе все ключевые находки в ML. У него есть блог The voice in the machine, в котором он много рефлексирует и обсуждает прогресс.

В эссе Prompting Is Not AI Research он на примере статей, про, собственно, промтинг предлагает для определения научности использовать критерии:

1. Механизм. Работа объясняет, почему объект исследования ведет себя определенным образом или только фиксирует поведение?
2. Долговечность. Знание накапливается или обесценивается с очередным релизом модели?

Идея не нова, но заставила задуматься.

Дальше я решил посмотреть на статьи с ICML: грепнул все работы, разметил LM’кой, вышло ~10% науки против ~90% всего остального. Разметка автоматическая, да и граница между категориями размытая, так что это скорее порядок величины.

Дальше я решил взять две области, за которыми следил на конфе: диффузионки и агентов. По ним было примерно по 450 статей, всего около 15% конференции. Дальше повторил классификацию, получил по диффузии порядка 11% научных работ (чуть выше среднего), а по агентам (ожидаемо) всего 3%.

Ситуация со статьями по агентам ожидаема потому что в сообществе сейчас популярно мнение, что это вообще не область и науки в ней нет, но так ли это?

Ниже примеры по-настоящиму научных работ в каждой из областей.

The Flexibility Trap: Rethinking the Value of Arbitrary Order in Diffusion Language Models
[код, веса]

Одна из двух Outstanding Papers этой конфы. Интуиция такая: произвольный порядок генерации в DLM включает left-to-right как частный случай и кажется, он должен делать всё строго лучше. Но авторы показывают, что на математике и коде выходит обратное: DLM пользуется свободой порядка, чтобы избегать токенов с высокой неопределенностью, те самые forking tokens, где ветвятся пути решения. В результате генерация коллапсирует. Лечат JustGRPO: left-to-right форсят только на RL-фазе.

The Crowded Embedding Space: A Mean-Field Mechanism for Emergent Marginalization in Retrieval-Augmented Agents

RAG-агентов оценивают по одному запросу, и это прячет главное: запросы геометрически связаны в общем эмбеддинг-пространстве. Плотность документов по широкой теме (например, фильмы-боевики) выдавливает из top-k соседнюю узкую категорию (Film Noir 🧐). Это фундаментальная проблема RAG-систем, корень которой в самом лоссе на обучении поисковых агентов. Для решения проблмы переформулируют задачу и делают так чтоб агент сам двигал эмбеддинги, оптимизируя свою же точность поиска.

Практический вывод №1: больше внимания действительно научным статьям. Их, в действительности, не так много.

В следующем посте - про остальные 90%, их ценность, которая видна только при чтении множества работ.
  • ❤ 18
  • 🔥 5
  • 👏 2
More from @c_research
  1. Aug 4, 2026Наука или инженерия Мысли после ICML'26 [2/2] В первой части обсуждали критерии научности…
  2. Jul 14, 2026Рассказываем о новой unified-модели в Alice AI С недавних пор в Алисе AI и Шедевруме появи…
  3. Jul 7, 2026ICML’26 Зачем ездить на конференции? Конечно, чтобы презентовать свои статьи и читать чужи…
  4. Jul 3, 2026Агентская мультимодалка спустя те же 14 месяцев: закрыли ли разрыв, который не закрыла уни…
  5. Jul 2, 2026Унифицированная мультимодалка спустя 14 месяцев: где обещанная синергия? В мае 2025 BAGEL…
  6. Jun 29, 2026Результаты На IA-Bench Qwen-Image-Agent даёт IA-score 45.4. Для контекста: • Nano Banana P…
Threads Profile ViewerView any public Threads profile without an account.Open ThreadLook →Writing with AI? Make it sound human.Metric37 rewrites AI drafts so they read naturally. Free AI detector, 1,500 words free.Try Metric37 →