В последнее время все более отчетливо проявляется тренд на эффективность инференса LLM.
Сначала мы жили в парадигме: "хочешь более умную модель - просто добавь параметров, данных и GPU-часов". Даже для вопроса вроде "Какая столица России?" задействовались все миллиарды параметров модели.
Затем стали популярны MoE-архитектуры (Mixture of Experts): вместо использования "всего мозга" модель активирует лишь несколько специализированных его частей.
Однако даже такой подход упускает ключевую вещь, которая есть у человека, но отсутствует у моделей — настоящая память. Люди мгновенно узнают знакомые факты, а не каждый раз приходят к ним через цепочку вычислений.
Современные LLM все еще страдают от скрытой неэффективности — computational memory: мы прогоняем запрос через несколько слоев модели, чтобы восстановить то, что в идеале можно было бы просто "посмотреть в словаре".
В эту пятницу в15:00 на PT ML Reading Group мы обсудим новую статью Engram от DeepSeek, которая предлагает подход к устранению этой неэффективности и переосмысляет роль памяти в LLM.
Ссылка для подключения: Ктолк
#reading_group #llm
Post #74
784

- 🔥 9
- 👀 5
- 👍 3
- ❤ 1