#заметка дня
Надоело сливать лимиты в Sol на каждую вторую задачу? А ты вообще смотрел, насколько дешёвые модели сейчас отстают от дорогих — и сколько при этом стоят?
Узнал от коллеги, что у Datacurve есть DeepSWE — очень наглядный график по агентам и моделям. Там 113 инженерных задач из реальных репозиториев: модель должна покопаться в проекте, найти нужный код, внести изменения и довести всё до рабочего состояния. Примеры задач тоже есть, кстати.
Наверху таблицы ожидаемо сидят самые сильные модели с результатом около 70–74%.
Но дальше...
GPT-5.6 Luna Max — около 67% за $0.61 на задачу.
GLM-5.3 Flash — около 63% за $0.24.
А модели с результатом на несколько пунктов выше могут стоить уже $6–12 за задачу.
То есть условно: получил не 73%, а 67%, зато заплатил в десять раз меньше.
Для многих задач такой разницы в качестве вполне можно не заметить, зато на сотнях запусков разница в цене будет очень даже заметной.
Тем более в агентных сценариях никто не мешает гонять дешёвую модель несколько раз, проверять результат тестами, а только провалы отправлять в Sol или Opus.
Я уже гоняю Luna в Extra High и Max и... доволен.
Так что вопрос уже не только в том, какая модель набрала больше баллов.
Смотреть надо ещё и на то, сколько стоили эти баллы.
https://deepswe.datacurve.ai/
#ai #comparison
Post #4265
1.14K

- 👍 8
- ❤ 1