TGViewer
Knowledge Accumulator Knowledge Accumulator @knowledge_accumulator · 5.69K subscribers
Post #305 2.58K
ARC-AGI-3

Напомню общую концепцию бенчмарков ARC-AGI. Вместо того, чтобы проверять модель на публично доступных данных и том же типе вопросов, на котором учили, мы пытаемся ставить перед моделью по-настоящему новую задачу и проверяем её способность обобщать.

Всего несколько месяцев назад была выпущена ARC-AGI-2, которая в целом не сильно отличается от первой версии, и обе были про решение простых визуальных задачек. А вот третья версия сменила формат и превратилась в игровой бенчмарк. Я прошёл все три доступные задачи и почувствовал суть происходящего.

Без каких-либо объяснений вас кидают в простенькую 2D-игру. Наша человеческая интуиция позволяет всего лишь за десятки действий построить модель этого мира и двигаться вперёд. При этом, авторы явно постарались сделать их совершенно непохожими на уже существующие игры.

Взгляните на прикреплённую картинку. В этой игре вы можете только кликать в произвольном месте. Ткнув в синий квадрат, вы обнаружите, что он меняет цвет на красный, и потом обратно при повторном клике. Так как на экране нет ничего примечательного, кроме квадрата в центре, почти первое, что будет делать человек - это пытаться повторить этот паттерн с помощью квадратов вокруг. И это будет победой над уровнем.

Дальнейшие уровни преследуют ту же цель, но вводят дополнительные механики, увеличивают сложность и размер. На последних я уже даже потупил какое-то время.

Нет никаких сомнений, что в эту и другие игры компьютер может научиться играть - шок, но RL существовал до того, как его стали применять в чат-ботах. Главное испытание - это скорость адаптации.

При обучении RL с нуля это большая проблема. Когда-то я рассказывал про прорывную работу на бенчмарке Atari-100K, где пытаются достичь хорошего уровня "всего" за 100 тысяч кадров. Это тот минимальный масштаб, на котором оперируют текущие методы, причём, в Atari почти нет меняющихся уровней.

Здесь постановка другая. Авторы не предполагают, что модель будет учиться с нуля. Они хотят, чтобы тестируемая модель принесла с собой хорошую интуицию про базовые концепции объектов, симметрии и т.д., и смогла с той же скоростью, что и мы, понять новые правила, а затем придерживаться плана победы и совершать какие-то длинные составные действия.

Для меня остаётся тривиальным вопрос о том, как такое решать - обучаемые алгоритмы, когда отскейлятся, такой бенчмарк съедят не жуя. Интересно то, как и когда к этому подступятся модели из текущей AI-волны. Очень скоро выходит GPT-5. У неё обязательно получится, ведь так?

@knowledge_accumulator
  • 👍 14
  • 😁 3
  • ❤ 2
  • 🤔 1
More from @knowledge_accumulator
  1. Sep 20, 2026Почувствуйте AGI Все эти годы я писал о том, что не верю в потенциал LLM превратиться в су…
  2. Sep 5, 2026Предсказать среднее могут не только лишь все Классическая задача машинного обучения - трен…
  3. Aug 17, 2026Долина vs Нью-Йорк Если что-то находится далеко от нас, нам свойственно излишне обобщать с…
  4. Jul 30, 2026Кто виноват в сливе рекламного бюджета? При создании рекламного line item рекламодатель ус…
  5. Jul 13, 2026Покатался на яхте в Американской глубинке После переезда в Калифорнию произошло неожиданно…
  6. Jun 30, 2026Да кто такие эти ваши producer-side A/B-тесты? В своей яндексовской эре работы над рекомен…
Threads Profile ViewerView any public Threads profile without an account.Open ThreadLook →Writing with AI? Make it sound human.Metric37 rewrites AI drafts so they read naturally. Free AI detector, 1,500 words free.Try Metric37 →