На Хабре вышло независимое сравнение российских языковых моделей. В тесте участвовали Алиса, GigaChat Max и GigaChat Ultra. Их работу проверили на пяти открытых бенчмарках: Arena-Hard, WildBench, MultiChallenge, τ³ и ПРАКТ-120.
На коротких ответах разница между моделями минимальна. Но при усложнении задач и увеличении объема текста вперед уверенно выходит модель Сбера. Разрыв особенно заметен там, где нужно довести многосоставную задачу до конца по прописанным правилам – написать код или обработать объемное ТЗ.
На бенчмарке Arena-Hard из 750 задач с кодом и инструкциями GigaChat Ultra и Max чаще доводят расчёты до конца. По сумме парных сравнений Ultra показал наибольшую точность, Max занял второе место, Алиса — третье. подписывайся.
Post #42148
4.39K