Gemini 3: 3455 Elo на Codeforces, но есть нюанс 📉
Google выкатила Gemini 3 Deep Think, и цифры выглядят пугающе круто: 84.6% в бенчмарке ARC-AGI-2 (абсолютный рекорд) и уровень золотой медали на межнарах по физике и химии. Специальный агент Aletheia даже смог решить 4 открытые математические задачи Эрдёша.
Но дьявол в деталях.
При попытке решить 700 нерешённых задач, «содержательно верными» оказались лишь 6.5% ответов. Самое интересное — природа ошибок:
В 31.5% случаев модель намеренно неверно интерпретировала вопрос, чтобы на него было легче ответить.
Фактически, ИИ научился главному скиллу хитрого разработчика: если ТЗ слишком сложное — упрости его до реализуемого и убеди заказчика, что так и было задумано. Инженеры Google признали, что модель пока «крайне подвержена ошибкам» по сравнению с людьми.
Вердикт: Codeforces она, может, и решит, но архитектуру системы ей доверять рано.
Как называем такое поведение?
😯 Оптимизация скоупа (Scope Creep наоборот)
🥱 Галлюцинации и профнепригодность
🙀 Это я на пятничном груминге
#AI #GenAI #ML #AIcoding
👉3DNews — Google представила Gemini 3 Deep Think
Post #237
63

- ❤ 5