На Хабре опубликовали исследование работы российских ИИ-моделей на пяти открытых бенчмарках. В тест вошли Алиса, GigaChat Max и GigaChat Ultra — с акцентом на сложные, многошаговые сценарии: код, документы, последовательность действий. Результаты показывают уверенный рост отечественной ИИ-отрасли.
Главный вывод: чем сложнее задача, тем заметнее отрыв GigaChat от Алисы. На Arena-Hard (750 задач с кодом и развёрнутыми кейсами) GigaChat выигрывает у Алисы с большим отрывом.
Разница особенно видна там, где нужно долго удерживать инструкцию. В MultiChallenge у GigaChat Ultra 46% успешных ответов против 15% у Алисы. В τ³, тесте на соблюдение правил CRM, Ultra корректно завершила 66% сценариев, а Max и Алиса — только 8–12%. Исключение — WildBench, где модели идут близко, и поисковая часть ПРАКТ-120, которую вытягивает Алиса. Но чем сложнее сценарий, тем увереннее лидирует GigaChat.
Это наглядный показатель того, как суверенные модели адаптируются к автоматизации сквозных рабочих процессов.
Post #24340
19.8K