> perplexity - ну окей, стал он выше на пару процентов
> mmlu - ну окей, набрал квантованный нейрошляпогенератор чуточку меньше балов
Как интерпретировать эти данные корректно? Как в итоге на практике понять реальную степень одебиления? Вариант — потыкать руками 5 минут и прийти к выводу, что "она тупая" не подходит.
Помогите выкупить, я не выкупаю.
Я понимаю, когда у нас есть условно говоря 10 моделей от разных дилеров и нам надо выбрать лучшую. Прогнали их все через бенчмарк — выбрали ту, что набрала больше всего баллов, изи.
А вот методика проверки квантованных моделей чето пока далека от меня.
P.S.
Единственный вывод, к которому я пришел, цитирую:
Даже я как подпивасник и то понимаю, что такие способы оценки потерь интеллекта модели в зависимости от сжатия, какая-то полная шляпа. Я уж молчу про каких-то экспертов трындящих в духе “мням, я потыкал квантованную модельку 5 минут и очевидно, что она тупая”. Да ёпта, очевидно, что ты тупой, мало ли что тебе очевидно. Вот у нас то, в отличии от таких экспертов хотя бы есть циферки на руках.
