Одна и та же модель может решать задачи почти одинаково, но стоить в пять раз дороже. Разница не в интеллекте, а в харнессе, то есть оболочке, которая управляет контекстом, инструментами и агентным циклом.
Исследователи UC Berkeley и Arena показали это на GPT-5.6 Luna.
В Claude Code модель получила 55,6% успешных попыток при цене $0,152, а в минималистичном Pi 53,3% за $0,030.
В нашем прогоне одна и та же DeepSeek V4 Flash набрала 52,2% в Koda против 49,5% в KiloCode, 48,2% в Claude Code и 47,6% в OpenCode.
🔗 Статья на Хабр: https://habr.com/ru/companies/koda/articles/1084448/
