Обычные LLM генерируют текст строго последовательно: токен за токеном.
♾ GFusion работает иначе: она восстанавливает сразу блоки текста и уточняет их по ходу генерации. Это другой способ ускорять модель — не только через инфраструктуру, но и через саму механику вывода.
Что важно:
— модель сделали на базе GigaChat3-10B-A1.8B
— по данным команды, GFusion оказалась до 70% быстрее базовой версии
— быстрее варианта с MTP на 39%
— просадка по качеству — примерно 2–4 п.п.
🔗 GFusion-10B-A1.8B-base
🔗 GFusion-10B-A1.8B
🔗 GitVerse
💡 Если вам интересны не только новости про модели, но и то, как они устроены под капотом, у нас есть курс «Специалист по ИИ» — с практикой и системным погружением в AI/ML.
🐸 Библиотека ИИ для айтишников
#neuro_dive
