TGViewer
SOF_news SOF_news @sof_news24 · 301 subscribers
Post #1760 74
🇨🇳🤖 DeepSeek V4.1 Flash: новая архитектура сокращает затраты на работу с длинным контекстом
DeepSeek открыла веса DeepSeek V4.1 Flash – мультимодальной модели на 552 млрд параметров с контекстом до 1 млн токенов. Модель построена по разреженной схеме MoE и работает одновременно с текстом и изображениями. Главное изменение связано не с размером, а с устройством самого трансформера.
Проблема особенно заметна у ИИ-агентов. При длительной работе модель постоянно получает всё более длинную историю: документы, программный код, результаты поиска, ответы инструментов и собственные предыдущие действия. Для дальнейшей генерации значительная часть этих данных сохраняется в KV-кэше, который постепенно занимает всё больше видеопамяти и создаёт дополнительную нагрузку при передаче данных.
📌 Что изменила DeepSeek
В V4.1 Flash используется новая схема Causal Encoder-Decoder. Из 40 основных слоёв трансформера первые 20 обрабатывают поступивший контекст, а следующие 20 используются при формировании ответа. При этом данные, необходимые второй половине модели, формируются из результата работы первой. Поэтому длинный запрос больше не требуется обрабатывать всеми 40 слоями так же, как в обычной языковой модели.
В результате при первоначальной обработке входных данных модель задействует около 8 млрд активных параметров на токен, а при генерации ответа – около 16 млрд. Для длинных запросов такая схема почти вдвое сокращает объём вычислений на первоначальном этапе.
📌 Слои больше не хранят всё независимо
DeepSeek также изменила работу с KV-кэшем. В обычной схеме разные слои модели хранят собственные промежуточные данные. В V4.1 Flash часть слоёв может повторно использовать данные, уже рассчитанные другими слоями.
Одни слои самостоятельно формируют необходимые данные и определяют важные участки контекста. Другие используют уже созданные данные, но самостоятельно решают, к каким участкам обратиться. Третьи повторно используют и сами данные, и уже выполненный выбор. Так, модели больше не требуется многократно хранить и вычислять практически одну и ту же информацию на разных уровнях сети.
Основной KV-кэш дополнительно хранится в четырёхбитном формате FP4. В результате его объём сокращён до 890 байт на один токен. Это примерно в четыре раза меньше, чем у DeepSeek V4-Flash, и в 437 раз меньше, чем у первого DeepSeek-V1. При хранении контекста на накопителях требования снижены примерно в восемь раз относительно V4-Flash.
Основное значение V4.1 Flash: DeepSeek разделила дорогостоящую обработку большого входного контекста и последующую генерацию ответа. Для ИИ-агентов, которые могут часами работать с одной задачей и накапливать огромную историю, это позволяет заметно снизить требования к вычислениям и памяти.
Справочно. Модель позволяет задавать интенсивность рассуждений в диапазоне от 1 до 100; значения low, high и max соответствуют 50, 75 и 100. На Hugging Face уже появились сторонние квантованные версии V4.1 Flash, включая GGUF, NVFP4, EXL3 и MLX.
  • 👍 1
More from @sof_news24
  1. Sep 30, 2026🧭 Военный календарь на 1 октября 2026 года Ежедневно – основные заранее объявленные мероп…
  2. Sep 30, 2026🇺🇸🇮🇶⚔️ США / Ирак: изменена система американского военного присутствия Центральное ком…
  3. Sep 30, 2026⚔️ Ежемесячный аналитический обзор (1–30 сентября 2026 г.) 🔻 В сентябре основным направле…
  4. Sep 30, 2026🧭 Аналитический обзор основных военно-политических событий в Восточной Европе (по состоян…
  5. Sep 30, 2026photo post
  6. Sep 30, 2026🇦🇿⚔️ Азербайджан: основные новинки и соглашения первого дня выставки «АДЕКС – 2026» В Ба…
Threads Profile ViewerView any public Threads profile without an account.Open ThreadLook →Writing with AI? Make it sound human.Metric37 rewrites AI drafts so they read naturally. Free AI detector, 1,500 words free.Try Metric37 →