TGViewer
Big Data AI Big Data AI @bigdatai · 18.2K subscribers
Post #1692 2.11K
🧠 DeepSeek снова на другом уровне: они нашли U-образный scaling law

DeepSeek выкатили работу про Engram - и это реально сильная инженерия.

Главная идея:
N-граммы всё ещё важны.
Но вместо того, чтобы “выкинуть их ради нейросетей”, DeepSeek гибридизируют подход:
📌 нейронка отвечает за рассуждение
📌 N-граммная память отвечает за быстрый lookup статических знаний

И это закрывает старую проблему LLM:
даже “умные” модели тратят первые слои на то, чтобы заново собирать частые фразы, имена и шаблонный текст - потому что у них нет нормальной встроенной “таблицы поиска”.

### MoE уже экономит вычисления, но есть дырка
Mixture-of-Experts снижает compute - на токен активируется лишь часть экспертов.
Но даже MoE всё равно вынужден тратить вычисления, чтобы вспоминать:
- имена сущностей
- частые связки слов
- формульные конструкции

### Engram = гигантская таблица памяти
Engram - это memory table, которая:
- берёт последние токены
- ищет знакомый паттерн (2-gram / 3-gram)
- и быстро вытаскивает заранее сохранённый вектор

Важно: запрос делается через hash lookup, поэтому стоимость доступа постоянная, даже если таблица огромная.

### Что получилось
DeepSeek показали U-образный scaling law:
можно оптимально балансировать между:
- нейронным compute (MoE)
- статической памятью (Engram)

И это даёт практический эффект:
✅ ранние слои перестают “жечь” compute на реконструкцию
✅ у сети остаётся больше глубины на реальное reasoning
✅ растут reasoning-метрики, хотя это выглядит как “просто память”

### Long-context тоже выигрывает
Когда локальные фразовые связки уезжают в память, attention может сильнее фокусироваться на дальних зависимостях.

В их сравнении Multi-Query Needle-in-a-Haystack:
84.2 → 97.0 🔥

### Системный бонус: стоимость и масштаб
Самое вкусное - масштабирование:
они показывают, что можно вынести 100B memory table в CPU RAM,
и падение throughput будет меньше 3%.

То есть можно добавлять всё больше “памяти” без необходимости влезать в GPU.

📄 Paper: https://github.com/deepseek-ai/Engram/blob/main/Engram_paper.pdf
  • 👍 5
  • 🔥 2
  • ❤ 1
  • 🤡 1
More from @bigdatai
  1. Sep 27, 2026ИИ-агент за пару кликов — создаем персонального помощника без кода Запустить ИИ-агента теп…
  2. Sep 24, 2026🧹 Opus 5.5 пора избавить от «магии промптов» Разработчик Anthropic поделился полезным при…
  3. Sep 24, 2026LLM умер, да здравствует LLM Главный сдвиг последних месяцев — модели перестают быть прост…
  4. Sep 23, 2026photo post
  5. Sep 23, 2026✔️ OpenAI начала работать с независимым советом математиков Компания будет советоваться с…
  6. Sep 22, 2026WebCraftBench проверяет сайты, созданные ИИ Агент говорит, что сайт готов. Но главная стра…
Threads Profile ViewerView any public Threads profile without an account.Open ThreadLook →Writing with AI? Make it sound human.Metric37 rewrites AI drafts so they read naturally. Free AI detector, 1,500 words free.Try Metric37 →