🔥 Edge0-8B-A1B - 8B-модель, которая запускается примерно с 1 ГБ активной памяти
Edge0 показала preview sparse MoE-модели для локального запуска на устройствах с ограниченной RAM.
Что внутри:
- ≈7,9B параметров всего / ≈1,2B активных
- 128 экспертов, по 8 активируются на токен
- 4-bit quantization
- контекст до 128K
- MLX backend для Apple Silicon
- SSD expert offload — веса экспертов подгружаются с накопителя только когда нужны
- Prerouter заранее предсказывает нужных экспертов и скрывает задержку загрузки
- Recover-LoRA возвращает большую часть качества, потерянного после int4-квантизации
На Mac mini M4 Pro авторы получили около 24–25 ток/с decode и до 1428 ток/с warm prefill при коротком контексте.
Главная фишка — весь 4-bit checkpoint не обязан постоянно находиться в RAM: активные эксперты стримятся с SSD. Поэтому пиковая активная память на коротких запросах держится около 1 ГБ.
По бенчмаркам авторов:
- HumanEval — 91,5
- GPQA-Diamond — 70,7
- MMLU-Pro — 70,1
- AIME 2026 — 63,3
Важно: это пока preview. Авторы прямо пишут, что tool use, многошаговое планирование и long-horizon agentic задачи ещё слабые — их обещают усиливать в полной версии.
Apache 2.0.
https://huggingface.co/Edge0/Edge0-8B-A1B-preview
Post #3553
1.87K
- 🔥 9
- 👍 4