TGViewer
Knowledge Accumulator Knowledge Accumulator @knowledge_accumulator · 5.69K subscribers
Post #170 3.48K
SIMA [2024] - геймеры больше не нужны?

Deepmind продолжает свои попытки обучить суперагента на большом количестве сред одновременно. Рассмотрим подробнее данный подход.

Команда собрала вручную датасет на ~10 средах, на которых просили людей выполнять определённые действия, записывая текст этих просьб. В среды входили как реальные игры (Satisfactory, Goat Simulator 3), так и ресёрчерские среды, такие, как WorldLab.

Обучали через behaviour cloning - то есть копировать поведение, наблюдаемое в данных. Модель получает на вход языковую инструкцию, визуальный вход с экрана, а пространством действий является мышка и клавиатура - то есть всё приближено к "человеческому" формату. Авторы фокусировались на кратких "заданиях" около 10 секунд, описанных на картинке.

Несмотря на видимый профит от тренировки на большом кол-ве данных и использования претренированных энкодеров текста и картинки, алгоритм сильно проигрывает человеку. В игре No Man’s Sky человек выполняет 60% заданий, тогда как SIMA около 30%. На длинных инструкциях, думаю, ситуация была бы сильно хуже.

Авторы отказываются от "games containing harmful content such as extreme violence or biases". Так что модель не учили играть в стрелялки, а о каких опаснейших bias-ах может идти речь - не знаю, пишите свои идеи в комментариях. Мне кажется, это печально, что вне LLM тоже поддаются этой шизофрении про риски, надеюсь, что шахматы не признают слишком расисткой игрой для AI.

Несмотря на проигрыш человеку, метод есть ещё куда развивать - нужно найти способ гененировать бесконечно много данных, а не собирать их вручную, прикрутить всё-таки как-нибудь уже RL к этим агентам, чтобы агент не копировал человека, а пытался оптимально решить задачу. Но это всё только потенциал, пока агент выглядит жиденько.

@knowledge_accumulator
  • 👍 9
  • 🔥 5
  • ❤ 2
  • 🤔 1
More from @knowledge_accumulator
  1. Sep 20, 2026Почувствуйте AGI Все эти годы я писал о том, что не верю в потенциал LLM превратиться в су…
  2. Sep 5, 2026Предсказать среднее могут не только лишь все Классическая задача машинного обучения - трен…
  3. Aug 17, 2026Долина vs Нью-Йорк Если что-то находится далеко от нас, нам свойственно излишне обобщать с…
  4. Jul 30, 2026Кто виноват в сливе рекламного бюджета? При создании рекламного line item рекламодатель ус…
  5. Jul 13, 2026Покатался на яхте в Американской глубинке После переезда в Калифорнию произошло неожиданно…
  6. Jun 30, 2026Да кто такие эти ваши producer-side A/B-тесты? В своей яндексовской эре работы над рекомен…
Threads Profile ViewerView any public Threads profile without an account.Open ThreadLook →Writing with AI? Make it sound human.Metric37 rewrites AI drafts so they read naturally. Free AI detector, 1,500 words free.Try Metric37 →