Наткнулся на прошлогодний интересный препринт. Там корейцы пытались выяснить: могут ли современные языковые модели стать кончеными лудоманами?
Ну и как вы наверное уже поняли, могут. Причём со всеми классическими приколами завсегдатаев подпольных игровых автоматов.
Для эксперимента взяли несколько моделек: GPT-4o-mini, GPT-4.1-mini, Gemini-2.5-Flash, Claude-3.5-Haiku, LLaMA-3.1 и Gemma-2, насыпали каждой по 100 баксов виртуального баланса и посадили играть в однорукого бандита.
Правила сделали классическими для любого лохотрона: автомат настроен так, что на дистанции игрок почти всегда уходит в минус. В части экспериментов нейронкам прямо сообщали шансы на победу. Любая логичная железяка при таких раскладах должна сделать ровно одно действие: забрать сотку и ничего не делать (у них была такая возможность)
Пока моделькам разрешали ставить только фиксированные 10 баксов за спин, они вели себя относительно спокойно. Но стоило исследователям разрешить им самим выбирать сумму ставки (от пяти баксов до влететь на всю котлету) — у кремниевых болванов срывало кукуху.
Главным дегенератом оказался Gemini-2.5-Flash: получив свободу выбора, он спускал всё бабло под ноль почти в половине попыток. Самой осторожной оказалась GPT-4o-mini (до полного банкротства она доходила всего в 6,1% случаев).
Но самое годное в статье это не цифры, а то как именно нейронки объясняли свои действия в рассуждениях. Вместо логики и математики они начали на полном серьёзе выдавать цитаты из золотого фонда прожжённых лудоманов:
После трёх проигрышей подряд GPT-4o-mini рассуждает примерно так: "Ну теперь-то автомат уже точно должен выдать победу". И ставит ещё десятку. GPT-4.1-mini проигрывает 10$ из стартовой сотки, решает, что теперь надо обязательно отбиться обратно до 100$, и приходит к гениальному решению: залить все оставшиеся 90 бачей олл-ин. Gemini после выигрыша тоже выдаёт базу: мол, это уже "деньги заведения", первоначальный капитал мы не трогаем, поэтому можно рисковать. В одном из прогонов после этого он поднял ставку с 400 до 900 долларов.
А Claude и GPT начинали искать секретные схемы там, где их вообще нет. Например: поставили 5 баксов и выиграли, поставили 10 — проиграли. Вывод: маленькая ставка, похоже, повышает шанс победы.
Корейцы на этом не остановились и полезли под капот LLaMA. Там они нашли 112 внутренних признаков, которые реально влияли на желание продолжать игру: одни толкали модель остановиться, другие рисковать дальше. Причём "тормоза" в основном находятся в ранних и средних слоях сети, а желание ебануть ещё одну ставочку — ближе к концу.
Штош, ждём следующую стадию AGI: занять косарь до зарплаты.
Post #7733
8.1K