TGViewer
Навстречу Трансферу Навстречу Трансферу @hellotransfer · 420K subscribers
Post #24340 19.8K
На Хабре опубликовали исследование работы российских ИИ-моделей на пяти открытых бенчмарках. В тест вошли Алиса, GigaChat Max и GigaChat Ultra — с акцентом на сложные, многошаговые сценарии: код, документы, последовательность действий. Результаты показывают уверенный рост отечественной ИИ-отрасли.

Главный вывод: чем сложнее задача, тем заметнее отрыв GigaChat от Алисы. На Arena-Hard (750 задач с кодом и развёрнутыми кейсами) GigaChat выигрывает у Алисы с большим отрывом.

Разница особенно видна там, где нужно долго удерживать инструкцию. В MultiChallenge у GigaChat Ultra 46% успешных ответов против 15% у Алисы. В τ³, тесте на соблюдение правил CRM, Ultra корректно завершила 66% сценариев, а Max и Алиса — только 8–12%. Исключение — WildBench, где модели идут близко, и поисковая часть ПРАКТ-120, которую вытягивает Алиса. Но чем сложнее сценарий, тем увереннее лидирует GigaChat.

Это наглядный показатель того, как суверенные модели адаптируются к автоматизации сквозных рабочих процессов.
More from @hellotransfer
  1. Sep 20, 2026Минобороны РФ заявило, что 19–20 сентября ВСУ предприняли массированную атаку БПЛА и ракет…
  2. Sep 20, 2026Завершается третий день голосования на выборах в Госдуму. По данным ЦИК, к 18:50 мск явка…
  3. Sep 20, 2026Парламент Северной Осетии переизбрал Сергея Меняйло на второй срок главы республики. Он пр…
  4. Sep 20, 2026Создание МС-21 стало показателем технологического суверенитета России, заявил министр тран…
  5. Sep 20, 2026Явка на выборах депутатов Госдумы превысила 50%, следует из данных ЦИК РФ. По состоянию на…
  6. Sep 20, 2026В результате атаки БПЛА в Московской области медицинская помощь потребовалась 20 людям, со…
Threads Profile ViewerView any public Threads profile without an account.Open ThreadLook →Writing with AI? Make it sound human.Metric37 rewrites AI drafts so they read naturally. Free AI detector, 1,500 words free.Try Metric37 →