TGViewer
DataWorkshop - AI & ML DataWorkshop - AI & ML @data_work · 1.88K subscribers
Post #358 844
Вот, например, еще в 2017 год в DeepMind (это компания, которая наделала шороху чуть ранее, выиграв в Alpha Go. Они сделали симуляцию - это была такая игра, в которой агенты должны были собирать яблоки.

Суть в том, что они не знали, что имеют дело с яблоками, поэтому на самом деле агенты были заинтересованы в сборе зеленых квадратиков, символизирующих яблоки. Квадратики, когда их “съедали” - появлялись новые. Виртуальные яблоки “рождались” снова через некоторое время.

В этой игре было несколько агентов (роботов, если хочешь), которые одновременно находились в определенной среде и учились, как вести себя в конкретной среде, чтобы максимизировать свою функцию для поедания максимального количества яблок.

Такие простые были правила. Проблемой было то, что эпизоды, в которых играли эти агенты, были ограничены. Допустим, каждый эпизод длился 2 или 3 минуты, и теперь: как агент должен вести себя, чтобы за эти три минуты съесть максимальное количество яблок.

Что было интересно, агенты также могли временно выбывать из игры. Они могли использовать так называемый лазер, с помощью которого, если агент был поражен, скажем, он уходил в угол на несколько секунд, то есть терял время, в течение которого мог бы собирать яблоки. В этом заключались правила этой игры.

Какой был результат. Как только появлялся дефицит ресурсов - агенты начинали идти по сценарию два - друг друга убивать. Когда же было изобилие (сценарий 1), тогда не было необходимости драться и жили они дружно.
Кстати, вот тут можно почитать публикацию DeepMind: Multi-agent Reinforcement Learning in Sequential Social Dilemmas

(Часть2)
  • 👍 3
  • ❤ 1
  • 🔥 1
More from @data_work
  1. Jul 16, 2025Помнишь, как прятали невидимые команды (prompt injection) в статьи на arXiv, чтобы влиять…
  2. Jul 14, 2025👆👆👆 Исследователи из 14 университетов (в том числе ведущие учреждения!) начали “взламыв…
  3. Jul 14, 2025Думаешь, что схитришь, поручая ИИ читать 100-страничные отчеты? Что может пойти не так, пр…
  4. Apr 7, 2025👆👆👆 (часть 1) Теперь конкретно, по моделям: 1️⃣ Llama 4 Scout: Это «младшая» версия с 1…
  5. Apr 7, 2025🚨 Вышла Llama 4 — проверил лично и делюсь впечатлениями! 🔥 TLDR: Давно ждал Llama 4 — и…
  6. Apr 6, 2025Закончился первый поток курса "Практический LLM". В нём прежде всего уделяется больше вним…
Threads Profile ViewerView any public Threads profile without an account.Open ThreadLook →Writing with AI? Make it sound human.Metric37 rewrites AI drafts so they read naturally. Free AI detector, 1,500 words free.Try Metric37 →