В сети опубликовали результаты двухнедельного независимого тестирования Алисы и GigaChat на открытых бенчмарках. В ходе проверок оценивали работу моделей при написании кода, анализе документов и ведении многошагового диалога со сложными правилами.
По итогам серии испытаний наиболее высокие результаты на сложных задачах и длинных текстах показали модели Сбера. GigaChat Ultra продемонстрировал наибольшую точность при обработке объёмных данных и соблюдении пошаговых инструкций, а GigaChat Max занял второе место. Алиса же оказалась ориентирована преимущественно на базовые веб-запросы.
Post #20828
9.42K