🤖 GPT-6 Astra в большом отрыве 🤯 для решения задач и дешевле, чем Fable 5.1 и Opus 5 😂 для решения задач в Android, но даже топовая модель пока решает чуть больше четверти задач, а значит, что настройка харнеса, декомпозиция и корректировка всё ещё будут за человеком.
🆕 Обновление бенчмарка принесло оценку новых моделей: Gemini 3.8 и 3.7 Flash, GPT-6, Fable 5.1, Kimi K3 и Qwen 3.8 Max.
Конечно, новый подход к оценке значительно поменял расстановку моделей и затраты в $ за тест.
👉 Эффективная Luna улетела очень далеко
👉 Kimi K3 и Qwen 3.8 Max достойно держатся на уровне топов!
👉 Gemini 3.8 Flash — самая дешевая и лучше, чем Sonnet 5 🤔
Один из показателей эффективности моделей - это деньги, которые они тратят, но интересно сколько токенов ушло. Понятно что они разные между моделями, но все равно покажет как быстро съест лимит подписки.
#AndroidDev #Android #AI #Benchmark
Post #10188
6.04K

- 🔥 20