🔘 Новые архитектуры: Qwen3.8-Flash-Next (пока без оптимизаций), Nemotron-3-Puzzle 75B с 9 млрд активных, DSpark для Nemotron 3.5, nanbeige4.2-3B.
🔘 Разреженное flash attention для DeepSeek-V4, GLM и Qwen3.8-Flash-Next на CUDA и Metal.
🔘 Ленивое чтение тензоров
--lazy-mode: большие таблицы эмбеддингов не грузятся в RAM целиком, а читаются через mmap по мере надобности (автоматически для тензоров больше 4 ГБ). Плюс убрали пик потребления памяти при загрузке модели.🔘 У квантизатора появился потолок рабочей памяти
--max-buffer-size, по умолчанию 8 ГБ. Раньше один большой тензор мог съесть всю оперативку.🔘 Сервер: лимит контекста на слот
--kv-unified-per-slot, чтобы параллельные запросы не делили одно окно как попало; видео на вход через --video-*; медиа можно передавать data:-ссылками; preserve_reasoning включён по умолчанию.🔘 В ggml 0.23.0 появился Apple RDMA как транспорт для RPC между машинами.
@neuro_channel