TGViewer
Android Broadcast Android Broadcast @android_broadcast · 14.5K subscribers
Post #9874 8.18K
🚀 Появился Android бенчмарк LLM от Google

Давно пора было, чтобы кто-то взялся за оценку LLM системно. Вопрос "какая модель лучше пишет Android-код" висел в воздухе, и каждый отвечал на него субъективно или на основе личных впечатлений и умений.

Общие тесты, публикуемые при выходе модели, не говорят ничего про то, умеет ли модель разобраться в реальных задачах Android разработки. Android Bench закрывает именно этот пробел.

Задачи взяты из реальных публичных Android-репозиториев на GitHub — никакой синтетики, разного уровня сложности. Модель должна самостоятельно починить проблему, а результат проверяется через unit или instrumentation-тесты. Никакой субъективщины — только прогон тестов.

Модели справились только с 16–72% задач. Разброс огромный и показывает, где пропасть между разными моделями.

🔗 Подробности про Android Bench
🐱 GitHub репо Android Bench
🔗 Источник - блог Android Developers

#Android #AndroidDev #Benchmark #AI #ИИ
  • 👎 20
  • 👍 8
  • ❤ 3
  • 🔥 3
More from @android_broadcast
  1. Sep 23, 2026🪙 Оптимизация расхода памяти Android приложений. РАЗБОР В Android 17 система вешает мягки…
  2. Sep 23, 2026🤖 Google запускает игры на Android Auto и Automotive. Теперь когда машина стоит, можно бу…
  3. Sep 23, 2026⚡️⚡️Топовый конкурс с розыгрышем билетов на Mobius 2026 Autumn Разыгрываем 2 билета на Mob…
  4. Sep 22, 2026🤖 Стала доступна запись интервью про процесс собеседования в Amazon на позицию Android ра…
  5. Sep 22, 2026🤖 Одно Android-приложение — куча процессов. Зачем это может понадобиться Android-приложен…
  6. Sep 21, 2026🤖 Правильно собирай билд для оценки производительности Чтобы оценить скорость работы прил…
Threads Profile ViewerView any public Threads profile without an account.Open ThreadLook →Writing with AI? Make it sound human.Metric37 rewrites AI drafts so they read naturally. Free AI detector, 1,500 words free.Try Metric37 →