ARC-AGI-3
Напомню общую концепцию бенчмарков ARC-AGI. Вместо того, чтобы проверять модель на публично доступных данных и том же типе вопросов, на котором учили, мы пытаемся ставить перед моделью по-настоящему новую задачу и проверяем её способность обобщать.
Всего несколько месяцев назад была выпущена ARC-AGI-2, которая в целом не сильно отличается от первой версии, и обе были про решение простых визуальных задачек. А вот третья версия сменила формат и превратилась в игровой бенчмарк. Я прошёл все три доступные задачи и почувствовал суть происходящего.
Без каких-либо объяснений вас кидают в простенькую 2D-игру. Наша человеческая интуиция позволяет всего лишь за десятки действий построить модель этого мира и двигаться вперёд. При этом, авторы явно постарались сделать их совершенно непохожими на уже существующие игры.
Взгляните на прикреплённую картинку. В этой игре вы можете только кликать в произвольном месте. Ткнув в синий квадрат, вы обнаружите, что он меняет цвет на красный, и потом обратно при повторном клике. Так как на экране нет ничего примечательного, кроме квадрата в центре, почти первое, что будет делать человек - это пытаться повторить этот паттерн с помощью квадратов вокруг. И это будет победой над уровнем.
Дальнейшие уровни преследуют ту же цель, но вводят дополнительные механики, увеличивают сложность и размер. На последних я уже даже потупил какое-то время.
Нет никаких сомнений, что в эту и другие игры компьютер может научиться играть - шок, но RL существовал до того, как его стали применять в чат-ботах. Главное испытание - это скорость адаптации.
При обучении RL с нуля это большая проблема. Когда-то я рассказывал про прорывную работу на бенчмарке Atari-100K, где пытаются достичь хорошего уровня "всего" за 100 тысяч кадров. Это тот минимальный масштаб, на котором оперируют текущие методы, причём, в Atari почти нет меняющихся уровней.
Здесь постановка другая. Авторы не предполагают, что модель будет учиться с нуля. Они хотят, чтобы тестируемая модель принесла с собой хорошую интуицию про базовые концепции объектов, симметрии и т.д., и смогла с той же скоростью, что и мы, понять новые правила, а затем придерживаться плана победы и совершать какие-то длинные составные действия.
Для меня остаётся тривиальным вопрос о том, как такое решать - обучаемые алгоритмы, когда отскейлятся, такой бенчмарк съедят не жуя. Интересно то, как и когда к этому подступятся модели из текущей AI-волны. Очень скоро выходит GPT-5. У неё обязательно получится, ведь так?
@knowledge_accumulator
Post #305
2.58K

- 👍 14
- 😁 3
- ❤ 2
- 🤔 1