Post #22779
5

У нас тут что-то действительно интересное приключилось: на Coding Agent Index - наборе бенчмарков (DeepSWE v1.1, Terminal-Bench 4.0 и SWE-Atlas-QnA), на котором Artificial Analysis измеряет производительность моделей в родных харнессах, Gemini 4 Argon выбила больше чем модели OpenAI, но обратите внимание на стоимость