Квантование дробит вызов инструментов совсем не так, как рисует BFCL: проверил на MCP-серверах
Что реально происходит с вызовом инструментов после квантования? Замутил бенчмарк QuantMCP — тестил модели на жалких 4 ГБ VRAM, но не на синтетике, а на живых схемах MCP-серверов.
Главная жиза: популярные бенчмарки типа BFCL систематически впаривают фигню — их оценки коррелируют с реальным падением качества с обратным знаком, аж -0.755.
Источник
Разъяснивший Python
Post #4888
277