TGViewer
Knowledge Accumulator Knowledge Accumulator @knowledge_accumulator · 5.69K subscribers
Post #80 1.64K
Есть ли жизнь на других флангах обучающихся агентов?

Я зашёл в список статей, которые цитируют AdA, и наткнулся на забавную работу. Это хороший повод рассказать о в корне альтернативном способе обучения агентов на её примере.

Авторы пытаются позаимствовать из биологии следующий концепт - при обучении интеллектуальных систем у нас может не быть заданной извне награды, которую мы максимизируем каким-нибудь RL-алгоритмом. Вместо этого мы можем обучать агентов подобием генетического алгоритма, т.е. поддерживать популяцию параметров модели, и ввести какой-нибудь критерий отбора. Как же тут делают?

1) В качестве "среды" используется 2D-мир, в котором есть появляющаяся каким-то образом еда.
2) Наш агент - это "организм", параметризуемый нейронной сетью, принимающей на вход информацию об окружении агента и выдающей следующее действие.
3) У агента есть внутренний парамер "сытости". Он падает с каждым шагом, и поднимается, когда агент съедает что-нибудь.
4) Каждые X шагов агент, у которого сытость выше определённого уровня, размножается. Рядом с ним появляется ещё один агент с его весами и добавленным к ним нормальным шумом. Агент, у которого сытость меньше определённого уровня, исчезает.

Авторы наблюдают, что со временем агенты адаптируются к свойствам среды и обучаются тактикам работы в ней. В зависимости от разных параметров среды, например, общего количества ресурсов, агент может быть либо "кочевником" и постоянно искать новые места, либо наоборот, сторожить ресурсное место, которое он уже нашёл.

Конечно, это всё находится в весьма зачаточном состоянии. Мы всё ещё обучаем веса фиксированной архитектуры нейросети, а задача не способствует появлению какого-то интеллектуального поведения. Будем смотреть, получится ли из подобного подхода что-нибудь в будущем.

@knowledge_accumulator
  • 👍 22
More from @knowledge_accumulator
  1. Sep 20, 2026Почувствуйте AGI Все эти годы я писал о том, что не верю в потенциал LLM превратиться в су…
  2. Sep 5, 2026Предсказать среднее могут не только лишь все Классическая задача машинного обучения - трен…
  3. Aug 17, 2026Долина vs Нью-Йорк Если что-то находится далеко от нас, нам свойственно излишне обобщать с…
  4. Jul 30, 2026Кто виноват в сливе рекламного бюджета? При создании рекламного line item рекламодатель ус…
  5. Jul 13, 2026Покатался на яхте в Американской глубинке После переезда в Калифорнию произошло неожиданно…
  6. Jun 30, 2026Да кто такие эти ваши producer-side A/B-тесты? В своей яндексовской эре работы над рекомен…
Threads Profile ViewerView any public Threads profile without an account.Open ThreadLook →Writing with AI? Make it sound human.Metric37 rewrites AI drafts so they read naturally. Free AI detector, 1,500 words free.Try Metric37 →