NVIDIA: LLM получат “память как у человека” и начнут учиться прямо во время ответа 🔥
NVIDIA выпустили очень сильный материал:
Reimagining LLM Memory: Using Context as Training Data Unlocks Models That Learn at Test-Time
Суть проблемы:
мы постоянно слышим про 128K / 1M токенов контекста…
но в реальности LLM всё равно:
- повторяют ошибки
- забывают важные детали
- требуют “скинь весь контекст заново”
И вот что предлагают NVIDIA:
Контекст = обучающие данные
Обычный трансформер читает контекст как “текст”.
NVIDIA предлагают читать его как данные для обучения.
То есть модель не просто смотрит на историю —
а компрессит её в свои веса через next-token prediction.
Этот подход называется:
TTT-E2E (Test-Time Training End-to-End)
Почему это прорыв
Фактически это новая форма памяти:
модель может адаптироваться внутри одной сессии
и “становиться умнее” прямо во время выполнения задачи.
Главный кайф: скорость на длинном контексте
TTT-E2E даёт постоянную стоимость инференса (без взрыва по latency),
поэтому при длинных окнах это очень выгодно:
- ~2.7x быстрее, чем full attention на 128K токенов
- ~35x быстрее на 2M токенов (H100)
Как это меняет RAG
Классический RAG:
“ищем в базе → вставляем в контекст → читаем”.
TTT:
“прочитали → и записали опыт внутрь модели”.
То есть это ближе к тому, как работает человек:
мы не держим всё в голове дословно — мы обновляем мозг опытом.
Вывод:
контекстные окна будут расти, но настоящая “память” LLM —
это модели, которые умеют учиться на контексте в моменте.
И NVIDIA прямо сейчас толкают индустрию в эту сторону.
https://developer.nvidia.com/blog/reimagining-llm-memory-using-context-as-training-data-unlocks-models-that-learn-at-test-time/
Post #2599
4.82K

- 🔥 15
- 🤔 9
- ❤ 6
- 🗿 3