Google обновляет Android Bench
В марте Google представил Android Bench — таблицу лидеров LLM для реальных задач разработки Android-приложений. Цель заключалась в обеспечении прозрачности возможностей моделей в Android-разработке и стимулировании их улучшения, чтобы предоставить больше полезных вариантов ИИ для повседневной работы.
Сейчас компания внесла в тесты значительные изменения:
• В рамках июльского релиза Google внедрил фреймворк Harbor, который включает в себя обновленную версию агента бенчмаркинга, используемого для оценки моделей. Harbor определяет стандарты и интеграции, которые упрощают запуск бенчмарка для любого пользователя, оценку его предпочтительной конфигурации или обмен результатами, обеспечивая дополнительную прозрачность и наглядность. Все текущие результаты пересчитали.
• Кроме того, в июльском релизе добавили в таблицу лидеров 8 новых моделей (Claude Fable 5, Claude Sonnet 5, Claude Opus 4.8, GLM 5.2, Kimi K2.7 Code, MiniMax M3, Qwen 3.7 Plus и Qwen 3.7 Max).
• С самого начала в Google ценили открытый и прозрачный подход, поэтому сделали первоначальную методологию и тестовый стенд общедоступными на GitHub. Разработчики просили предоставить возможность оставлять отзывы о наборе данных, поэтому теперь делают шаг вперед в сотрудничестве, предоставляя сообществу разработчиков Android возможность влиять на Android Bench. Начиная с сегодняшнего дня, вы можете внести свой вклад в Android Bench двумя способами: 1) Разрабатывайте и отправляйте собственные задачи разработки Android, чтобы оценить, как модели обрабатывают сценарии, которые важны для вас; 2) Проводите и делитесь результатами бенчмарк-тестирования, проверяя свои предпочтительные модели на готовом наборе данных или на собственных задачах. В Google будут рассматривать представленные задачи и оценивать, будут ли они добавлены в бенчмарк. В компании надеются создать бенчмарк, который действительно отражает разнообразные повседневные реалии глобального сообщества Android-разработчиков.
Post #6193
2.07K

- 👍 2
- 🔥 1