Опубликовал большой тест-сравнение ведущих моделей на всех поколениях видеокарт NVIDIA (кроме Blackwell).
https://youtu.be/VZKnezWNFCo
Тест оценивает скорость (TPS), качество выполнения разных задач от кодинга до агентных сценариев, в которых задействован LangGraph агент на DeepSeek V4 Flash с MCP-функциями, вызываемыми через мою библиотеку MCPager.
Jupyter-notebook прилагается.
В этом же видео я разобрал и сравнил механизмы внимания Compressed Sparse Attention и гибрид MoE + Gated DeltaNet, так как в видео тестируются флагманы обоих направлений (DeepSeek V4 Flash и Qwen-3.6 35B A3B).
Гибридное внимание с Gated DeltaNet впечатляет. Я видел, его критиковали разработчики Kimi K3, говоря что gates с одним скалярным коэффициентом — недостаточно, нужны поканальные коэффициенты. Практически — небольшая модель Qwen-3.6 35B A3B решила задачу по рефакторингу реального репозитория на Python (того же MCPager) на 100%. Справилась даже лучше, чем более ранний Qwen 3 Coder Next с похожей архитектурой, у которого 80B параметров.
Post #196
939