TGViewer
AI[ex]Time AI[ex]Time @aiextime · 2.83K subscribers
Post #182 1.99K
Возвращаюсь с ICLR и хочу поделиться одним наблюдением, которое мне показалось интересным. Из множества разговоров с авторами и просто ребятами, делающими ресерч, вижу такой паттерн: очень большое кол-во работ и текущих исследований направлено в сторону lossy inference optimization. Под lossy имею в виду методы, которые не гарантируют сохранения качества исходной модели – то есть такого же распределения токенов. В целом вообще никаких гарантий нет: глобально мы хотим ускорить/сэкономить на памяти и не просадить качество. На другой стороне есть lossless подходы. Примеры для понимания:

• Lossless: speculative decoding – мы на уровне алгоритма гарантируем, что токены получены из такого же распределения, что и большая target модель.
• Lossy: routing в более слабые модели, когда нам кажется, что они справятся +- так же.

Так вот, направление lossy – это большая кроличья нора: speculative decoding с ослабленными условиями верификации, компрессия KV cache, merging экспертов в MoE, всякие early exits во время forward pass, разного рода квантизации – в общем, там есть, куда разгуляться.

При этом многие, занимающиеся подобными направлениями, одновременно много времени уделяют гранулярным эвалам: раз все эти методы не гарантируют сохранения качества, нужно супер детально понимать, где и когда качество падает сильно. И это тоже на самом деле нетривиальная задача. По ощущениям, эта связка становится очень большим направлением современного инференса – когда за скорость и цену приходится бороться с минимальными деградациями.
  • 🔥 14
  • ❤ 9
  • 🤔 1
More from @aiextime
  1. Aug 25, 2026Еще немного интересных наблюдений из RL для MoE. В нем есть одна проблема, которая делает…
  2. Jul 27, 2026Какое-то время назад открыл для себя, насколько CISPO робастнее к выбору гиперпараметров п…
  3. Jun 29, 2026На следующей неделе я буду на ICML, в том числе презентовать с командой постеры по несколь…
  4. Jun 11, 2026Только успели выкатить мини-релиз SWE-rebench с Gemini 3.5 Flash, MiniMax M3 и Junie (тепе…
  5. May 29, 2026По горячим следам добавили Opus 4.8 xhigh, картина теперь такая
  6. May 28, 2026SWE-rebench давно не обновлялся. Все потому, что каждый месяц прогонять новые модели, да е…
Threads Profile ViewerView any public Threads profile without an account.Open ThreadLook →Writing with AI? Make it sound human.Metric37 rewrites AI drafts so they read naturally. Free AI detector, 1,500 words free.Try Metric37 →