📈 Моя аналитика обновленного Android Bench и личные впечатления:
👍 Топ 5 моделей вполне оправдан и скоро там ворвутся модели GPT 5.6. Nek активно работает с ними и можете почитать в его блоге, а я ему доверяю. Проблема топов - очень высокая цена для достижения этих цифр, хотя другие показали затраты меньше, потому что просто не смогли справится и остановились на пол пути
😂 GLM 5.2 выдаёт результат на уровне Opus 4.8, но стоит на 33% дороже ($117 против $88). Почти треть переплаты за тот же результат. Мой личный опыт это подтверждает отдельно от бенчмарка: на подписке за $60 я за час съел недельный лимит, не сделав ничего полезного. Не знаю, кому такие открытые модели вообще нужны в таком виде.
⭐️ Gemini 3.5 Flash — реально худшая сделка во всём рейтинге. Хуже Fable 5 по score (71.1 против 84.5) и при этом дороже ($165.6 против $133.2). Flash в названии обычно значит дешёвый быстрый тир, тут наоборот: дороже топа при качестве почти на 13 пунктов ниже.
🏆 Kimi K2.7 Code — результат между Opus 4.7 и 4.8 (70.4), а стоит примерно вдвое дешевле. Пока лучший баланс качество/цена среди моделей с внятным score.
🤔 DeepSeek V4 (Pro и Flash) заметно отстают от топа по качеству, но стоят копейки. Для дешёвого чернового прогона это рабочий вариант.
Жду появления в рейтинге моделей Composer 2.5 и Grok 4.5, так как они явно не дали мне глубины Opus, но справились довольно неплохо, и продолжаю их тесты. GLM 5.2 оказался мусором, съедающим бюджеты.
#Android #AndroidDev #AI
Post #10075
6.7K
Android Broadcast 🤖 Google пересчитал Android Bench для AI-кодинга: новый движок оценки и восемь новых моделей В июльском релизе апдейта Android Bench (лидерборда LLM для Android-задач) изменились не только модели, но и сам механизм оценки. Ранее бенчмарк использовал кастомный…
- 👍 26
- 👎 14
- ❤ 3