Как 17B активных разносят 70B плотных: анатомия Mixture-of-Experts (MoE)
Прохлопал тот момент, когда разработчики нейронок мерились, у кого циферка рядом с названием модели толще? А когда протёр глаза — нихрена себе, уже модно выпендриваться скромным числом активных параметров. Тогда эта статья ровно для тебя.
Сегодня разжуют без соплей: с какого такого перепуга все опенсорсные флагманы разом уехали в MoE, почему Qwen3.5 на 397 миллиардов параметров строчит токены так, будто у неё всего 17, и почему на видеокартах при этом никто не разорился. А тем, кто зашёл «только спросить», сольют тайну: и в каком кабинете, собственно, обитает тот самый медицинский эксперт.
Читать далее
👉 Data Science | Machinelearning [ru]
Post #5909
1.5K

- ❤ 4