TGViewer
Анализ данных (Data analysis) Анализ данных (Data analysis) @data_analysis_ml · 51.1K subscribers
Post #5916 1.99K
🔎 Looped-модели научились экономить память: качество 12 блоков при KV-кэше на 4

Looped-модели прогоняют токен через один и тот же блок слоёв несколько раз, и так глубина растёт без роста параметров. Мешало одно: на каждой итерации копится свой KV-кэш, и память раздувается.

Авторы заметили, что внутреннее состояние модели со временем почти перестаёт меняться. Поэтому на декодинге можно хранить только финальные ключи и значения, а не всю цепочку итераций.

На модели 1.6B это дало 60% в среднем по бенчмаркам. Обычный трансформер из 4 блоков набирает 51%, из 12 блоков 61.5%. Получается почти уровень 12 блоков при втрое меньшем KV-кэше. Бонусом промпт обрабатывается до 1.79 раза быстрее, а RL-обучение идёт вдвое быстрее.

Код и 49 чекпоинтов открыты.

https://arxiv.org/abs/2610.06833

https://github.com/ifm-ai/xllm-loop
  • ❤ 10
  • 👍 3
  • 🔥 3
  • 🤔 2
  • 🎉 2
  • 💯 2
  • 👏 1
More from @data_analysis_ml
  1. Oct 7, 2026🧮 Три часа вычислений на математический результат: самая неожиданная цифра в релизе OpenA…
  2. Oct 7, 2026📌 OpenAI выложила 722 математические работы своей внутренней модели Все статьи написала в…
  3. Oct 6, 2026⚛️ Google заключила атомную сделку на 20 лет Соглашение с Constellation позволит добавить…
  4. Oct 6, 2026🏅 Нобелевская премия по физике 2026 года присуждена Фрэнсису Хальцену За решающий вклад в…
  5. Oct 6, 2026🧲 90+ агентов Claude Opus 5.5 за три дня помогли найти два материала для памяти нового по…
  6. Oct 6, 2026👁️ Liquid AI добавила зрение в d1: модель принимает решения без генерации текста На входе…
Threads Profile ViewerView any public Threads profile without an account.Open ThreadLook →Writing with AI? Make it sound human.Metric37 rewrites AI drafts so they read naturally. Free AI detector, 1,500 words free.Try Metric37 →