🇨🇳🤖 DeepSeek V4.1 Flash: новая архитектура сокращает затраты на работу с длинным контекстом
DeepSeek открыла веса DeepSeek V4.1 Flash – мультимодальной модели на 552 млрд параметров с контекстом до 1 млн токенов. Модель построена по разреженной схеме MoE и работает одновременно с текстом и изображениями. Главное изменение связано не с размером, а с устройством самого трансформера.
Проблема особенно заметна у ИИ-агентов. При длительной работе модель постоянно получает всё более длинную историю: документы, программный код, результаты поиска, ответы инструментов и собственные предыдущие действия. Для дальнейшей генерации значительная часть этих данных сохраняется в KV-кэше, который постепенно занимает всё больше видеопамяти и создаёт дополнительную нагрузку при передаче данных.
📌 Что изменила DeepSeek
В V4.1 Flash используется новая схема Causal Encoder-Decoder. Из 40 основных слоёв трансформера первые 20 обрабатывают поступивший контекст, а следующие 20 используются при формировании ответа. При этом данные, необходимые второй половине модели, формируются из результата работы первой. Поэтому длинный запрос больше не требуется обрабатывать всеми 40 слоями так же, как в обычной языковой модели.
В результате при первоначальной обработке входных данных модель задействует около 8 млрд активных параметров на токен, а при генерации ответа – около 16 млрд. Для длинных запросов такая схема почти вдвое сокращает объём вычислений на первоначальном этапе.
📌 Слои больше не хранят всё независимо
DeepSeek также изменила работу с KV-кэшем. В обычной схеме разные слои модели хранят собственные промежуточные данные. В V4.1 Flash часть слоёв может повторно использовать данные, уже рассчитанные другими слоями.
Одни слои самостоятельно формируют необходимые данные и определяют важные участки контекста. Другие используют уже созданные данные, но самостоятельно решают, к каким участкам обратиться. Третьи повторно используют и сами данные, и уже выполненный выбор. Так, модели больше не требуется многократно хранить и вычислять практически одну и ту же информацию на разных уровнях сети.
Основной KV-кэш дополнительно хранится в четырёхбитном формате FP4. В результате его объём сокращён до 890 байт на один токен. Это примерно в четыре раза меньше, чем у DeepSeek V4-Flash, и в 437 раз меньше, чем у первого DeepSeek-V1. При хранении контекста на накопителях требования снижены примерно в восемь раз относительно V4-Flash.
Основное значение V4.1 Flash: DeepSeek разделила дорогостоящую обработку большого входного контекста и последующую генерацию ответа. Для ИИ-агентов, которые могут часами работать с одной задачей и накапливать огромную историю, это позволяет заметно снизить требования к вычислениям и памяти.
Справочно. Модель позволяет задавать интенсивность рассуждений в диапазоне от 1 до 100; значения low, high и max соответствуют 50, 75 и 100. На Hugging Face уже появились сторонние квантованные версии V4.1 Flash, включая GGUF, NVFP4, EXL3 и MLX.
Post #1760
74

- 👍 1