Все о Data Science, машинном обучении и искусственном интеллекте: от базовой теории до cutting-edge исследований и LLM.
MAX - https://max.ru/devsp
Личный блог - @just_genych
По вопросам рекламы или разработки - @g_abashkin
РКН: https://vk.cc/cJPGXD
Post #5267
2.5K

ChatGPT Atlas: Как ИИ победил в судоку, но проиграл в Flappy Bird 🤬
Модели, вроде ChatGPT Atlas, могут не только читать контекст страниц, но и целенаправленно кликать и нажимать клавиши. Исследователи протестировали Atlas на нескольких играх, от судоку до Flappy Bird. Результат оказался немного неожиданным: агент блеснул в пошаговых задачах, но с реальным временем у него возникли проблемы. Почему так?
Этот эксперимент подчеркивает важную границу между когнитивными способностями ИИ и его действиями в реальном времени. В будущем такие способности, скорее всего, будут разделены: один агент будет заниматься анализом и пониманием контекста, а другой — исполнять команды в реальном времени. Вот так и появится идеальная команда «мыслителей» и «исполнителей» 😄
Data Science
Модели, вроде ChatGPT Atlas, могут не только читать контекст страниц, но и целенаправленно кликать и нажимать клавиши. Исследователи протестировали Atlas на нескольких играх, от судоку до Flappy Bird. Результат оказался немного неожиданным: агент блеснул в пошаговых задачах, но с реальным временем у него возникли проблемы. Почему так?
Игры — это не просто развлечение. Они предоставляют отличную модель реального мира, где можно проверить, как ИИ решает задачи с четкими правилами и обратной связью. Причем, игры с такими параметрами, как реакция на интерфейс, возможность планировать действия и выполнять многошаговые задачи, дают нам много полезной информации о возможностях ИИ.
Эксперимент был прост: ChatGPT Atlas запускали с настройками, имитирующими реальную работу агента в браузере, без памяти и дополнительных подсказок. Он просто получал страницу с игрой и начинал действовать, как мог. И каждый раз результат был сравнивался с типичными человеческими бейзлайнами — чтобы понять, насколько ИИ близок к человеку.
— Судоку: Atlas решал задачи за 2 минуты 28 секунд с точностью 100%. Для сравнения, человек бы потратил около 10-12 минут на то же самое. Это прямо впечатляет!
— 2048: В этой игре агент стабильно набирал около 2242 очков, но до рекордов человека (3463 очка с первого раза) ему было далеко. Проблема? Он не выстраивал долгосрочные стратегии и часто застревал на одинаковых уровнях.
— T-Rex Runner: Когда мы говорим о реальном времени, тут начались проблемы. Атлас набрал всего 45,5 очка, по сравнению с 388,9 у человека. И 9 из 10 раз он не мог даже пройти первое препятствие.
— Flappy Bird: Здесь Atlas вообще не набрал ни одного очка. А люди в среднем делали около 3. Агент не мог быстро повторить нажатие одной клавиши — и результат нулевой.
— Stein.world: В этой игре, требующей долгосрочной стратегии и разнообразных действий, Atlas не мог пройти начальную комнату. Однако, после некоторых подсказок, он справился и выполнил задание.
Что можно сказать в итоге?
ChatGPT Atlas отлично справляется с задачами, которые требуют анализа и пошагового подхода, такими как решение судоку или понимание логики в играх вроде 2048. Но как только дело доходит до быстрого реагирования, например в Flappy Bird или T-Rex Runner, ему явно не хватает скорости. Это просто особенность архитектуры: модели вроде Atlas заточены на рассуждения, а не на мгновенную реакцию.
Этот эксперимент подчеркивает важную границу между когнитивными способностями ИИ и его действиями в реальном времени. В будущем такие способности, скорее всего, будут разделены: один агент будет заниматься анализом и пониманием контекста, а другой — исполнять команды в реальном времени. Вот так и появится идеальная команда «мыслителей» и «исполнителей» 😄
Data Science
- ❤ 5
- 👍 2
















