🤖 Google пересчитал Android Bench для AI-кодинга: новый движок оценки и восемь новых моделей
В июльском релизе апдейта Android Bench (лидерборда LLM для Android-задач) изменились не только модели, но и сам механизм оценки. Ранее бенчмарк использовал кастомный mini-swe-agent v1, теперь — фреймворк Harbor.
Весь лидерборд пересчитали заново: баллы всех моделей изменились, а старые результаты сохранены в архиве.
Добавили восемь моделей: Claude Fable 5, Claude Sonnet 5, Claude Opus 4.8, GLM 5.2, Kimi K2.7 Code, MiniMax M3, Qwen 3.7 Plus и Qwen 3.7 Max. Лидер — Claude Fable 5 с 84,5 баллами. GPT-5.5 отстаёт на четыре балла (80,2), а Sonnet 5 — почти на 10 баллов. Ожидаем добавления семейства GPT 5.6.
#Android #AndroidDev #AI
Post #10073
7.38K

- 👍 27
- 👎 11
- ❤ 2