TGViewer
Математика Дата саентиста Математика Дата саентиста @data_math · 14.3K subscribers
Post #987 3.91K
DeepSeek снова в игре 🔥

"Conditional Memory via Scalable Lookup: A New Axis of Sparsity for Large Language Models"

Идея мощная: DeepSeek предлагают Engram - модуль памяти, который добавляет к LLM *lookup-память* с доступом за O(1).

Что это значит по-человечески:
вместо того чтобы каждый раз “вспоминать” шаблоны через слои трансформера, модель может моментально доставать нужные куски знаний из отдельной памяти.

Engram - это:
- хешированная N-gram память (modernized hashed N-gram embeddings)
- которая работает как быстрый словарь: *пришёл паттерн → достали представление → усилили модель*

Анализ показывает интересное:

🧠 Engram снижает необходимость ранним слоям заново реконструировать “статичные паттерны”
(частые формы, устойчивые токены, регулярные последовательности)

➡️ То есть ранние слои (слои трансформера, которые стоят ближе всего ко входу.) меньше заняты “механической работой”и больше ресурсов остаётся на главное.

В результате модель становится как будто глубже там, где надо:
- reasoning
- планирование
- длинные цепочки мыслей

Фактически это новый тип sparsity:
не только MoE/спарсные слои,
а спарсная память с быстрым доступом.


Это уже похоже на шаг к LLM, где часть знаний живёт как “кэш-память”, а не внутри весов.

Paper: https://github.com/deepseek-ai/Engram/blob/main/Engram_paper.pdf
Видео: https://www.youtube.com/watch?v=Hoz9HxHy_nQ
  • 👍 13
  • ❤ 4
  • 🔥 2
More from @data_math
  1. Sep 22, 2026🚨 DeepSeek обучает модель на 2 трлн параметров и планирует следующую на 8 трлн Для сравне…
  2. Sep 22, 2026Вопрос уже не в том, нужен ли ИИ, а в том, как его внедрять и масштабировать Найдем ответ…
  3. Sep 21, 2026OpenAI близка к решению ещё одной задачи тысячелетия — гипотезы Ходжа, сообщает The Inform…
  4. Sep 20, 2026VisualGenAI — курс по генеративным моделям в компьютерном зрении, который идёт в ногу с пе…
  5. Sep 18, 2026🧠 Одна формула, которая объясняет идею гомоморфизма: φ(a ∗ b) = φ(a) ∘ φ(b) Смысл простой…
  6. Sep 16, 2026📘 Бесплатная книга по выпуклой оптимизации Convex Optimization: Algorithms and Complexity…
Threads Profile ViewerView any public Threads profile without an account.Open ThreadLook →Writing with AI? Make it sound human.Metric37 rewrites AI drafts so they read naturally. Free AI detector, 1,500 words free.Try Metric37 →