🤖 В Android Bench добавили Claude Opus 5.5, GPT 6 Sol и GPT 6 Luna
Google обновила лидерборд LLM для Android-разработки в Benchmark 2.0. В нем решаются long-horizon задачи: сложные сценарии на несколько дней работы инженера, модели гоняют в агентах своих провайдеров (claude-code, Codex и т.д.).
Где оказались новинки:
🏆 Claude Opus 5.5 — 32,7% (claude-code)
🥈 GPT 6 Astra — 28,0% (Codex)
🥉 Claude Fable 5.1 — 22,7% (claude-code)
GPT 6 Luna показала всего 10,7% (Codex), зато прогон в среднем около $5 против $215 у Opus 5.5. Из первой десятки никто не показывает настолько дешевый результат.
Самая свежая модель Google - Gemini 3.8 Flash пока далеко от лидеров, но жду что покажет Gemini 4 Argon.
🔗 Android Bench
#Android #AI #AndroidDev
Post #10229
2.22K

- 👍 13
- 🔥 2