Cognition показала SWE-2 – новую модель для работы с кодом
Компания сделала ставку на то, чтобы модель быстрее находила нужные части проекта и переходила к внесению изменений, не тратя лишних шагов на анализ.
На FrontierCode 1.1 Main SWE-2 набрала 50,0%, уступив Fable 5.1 менее чем одному процентному пункту.
На Terminal-Bench 2.1 результат модели составляет 92,8%.
Версия SWE-2 medium выполняет задание в среднем на 58% меньшим количеством шагов, чем SWE-1.7.
Средняя стоимость выполнения задания уменьшилась на 81%, что явилось одним из главных фокусов нового релиза.
Модель построена на Kimi K3 и дополнительно обучена Cognition с помощью RL. Для обучения компания втрое увеличила количество сред.
Post #25
1.07K



- 🔥 7
- ❤ 3
- 🤯 1
- 👌 1