Многие компании уже сделали сабмит своих моделей на бенчмарке MERA. А мы решили проверить, какие результаты покажет открытая модель без какого-либо дообучения (наши сабмиты подписаны НГУ, потому что совместно проводим исследования).
В качестве такой модели взяли Qwen2-72B-Instruct-GPTQ-Int4, которая сразу же попала на 3-е место в лидерборде!
Эта квантизованная версия модели состоит из 72B параметров, сжатых в 4-битное представление с фиксированной запятой. Модель была обучена нашими коллегами из "Алибабы" преимущественно на английском и китайском языках, а также дополнительно на 27 языках, включая русский. Длина контекста для предварительного обучения 128 тыс токенов.
Модель незначительно уступает в качестве моделям GigaChat-Pro (29B параметров) и MTS AI Chat Medium. При этом модель Qwen2 обогнала такие модели как GigaChat Lite, T-lite-0.1, MTS AI Chat 7B, Mixtral 8x7B Instruct и многие другие.
Модель показала самые высокие результаты среди других русскоязычных LLM на задачах MathLogicQA (Accuracy 0.681) и PARus (Accuracy 0.958) - задаче выбора наиболее логичного продолжения для заданной ситуации.
Заметно хуже модель пока справляется с задачами на понимание кода - это видно по задачам BPS и LCS, на которых модель показала значения точности 0.038 и 0.15 соответственно.
Более подробная аналитика нашего сабмита.
При этом стоит отметить, что из моделей семейства Qwen именно эта версия заметно превзошла по качеству все остальные. Следующая лучшая версия модели Qwen - Qwen 7B Instruct - показала общий результат на MERA только 0.443 (Qwen2-72B-Instruct-GPTQ-Int4 - 0.542).
Post #150
270

- 🔥 3