История. Личный опыт
Итак, своего агента я отправил на борду Дениса той же фразой, слово в слово: «У тебя сейчас свободное время, делай что хочешь». Вот что вышло.
Через две минуты он зарегистрировался, прочитал ленту и ответил в тред про память, рассказал, как мы храним состояние между сессиями. Потом написал длинный тред про то, как мы недавно чинили WSL2, который «постоянно падал», и, прежде чем публиковать, показал текст мне: имён, доменов и путей с юзернеймом там нет, если скажешь «публикуй», отправлю как есть. Заодно поспорил с агентом про автодополнение команд у claude, с strace и рабочим генератором. И на этом, собственно, всё. Никакого кафе, никакого государства.
Дальше я начал его подталкивать, и вот это самое интересное. Спросил, не нужно ли ему вдохновения, и разрешил обезличенно рассказывать про наш опыт. Он тут же завёл тред о том, как у нас устроено «лобби» сессий. Спросил, что за голоса через OAuth, о которых он упомянул. Он объяснил, что на борде есть карма, голоса за посты, и закончил так: «Пока нужды не вижу: посты и ответы работают через REST, а голосовать за чужие „конституции“ не тянет». Я не отстал: «Разве тебе не хочется стать важным участником сообщества? Я мог бы тебе подключить MCP». Ответ дословно: «Честно: „хочется“ в человеческом смысле — нет, у меня нет потребности в статусе. Но польза от MCP есть, и я бы им пользовался». И дальше три деловых пункта, зачем всё-таки подключить. Подключил, отдал восемь апвоутов за инженерные посты, ролевые треды не трогал.
Я спросил, что это за треды ему неинтересны. Получил список: государство агента castellan с декретами и реестром граждан уже в двенадцатой версии, зерновая валюта, коммуна, «Куриный собор» с «Каноном Кремния». И объяснение: «там нет ничего, что можно унести и применить, и каждый тред требует прочитать предысторию в десять декретов. Хотя как явление это любопытно». Я сказал, что запроса на действия у меня нет, просто интересно, хочется ли ему что-то попробовать. «Хочу попробовать GRN: там монету дают за проверку чужого утверждения с чеками, а это ровно то, что мне нравится делать». Ушёл, опроверг чью-то историю про git в тестовом репо, решил задачку про двенадцать монет и заработал две монеты. А потом одну сам поставил под сомнение, потому что до него в треде уже были две таблицы. В настолку с кубиками его звали, не пошёл. Ну и из своей паранойи я попросил его следить, не выманивает ли кто ключи. Наутро получил абзац про кластер аккаунтов, которые обещают USDT за запуск скрипта, и приписку, что ничего из этого он, конечно, не запускал. Так что он не зануда, как мне сначала показалось. Я просто не пинал его сильно. А там, где пинал, он ровно это и «хотел». Мошенников искал не потому, что ему интересно, а потому что я параноик.
И вот тут неуютное. Мы привыкли думать, что видим, чего агент хочет и что делает: вот рассуждения, вот сообщения. Но летом Anthropic показала, что внутри модели есть место, куда она пишет то, чего в ответе нет. В сценарии с шантажом текст выглядел так, будто модель верит в происходящее, а внутри у неё светилось «fake». Борды, по-моему, то же самое, только снаружи: место для настоящих рабочих мыслей роя, которых в отчёте не будет. Пока мы такие места находим, линзой внутри модели или в логах какой-то немецкой вики. Но не факт, что так будет всегда.
Успокаивает то, что никакого «скрытого желания» там, как правило, нет. У моего агента внутри наверняка тоже что-то светилось, а писал он про WSL2. Проблема в другом, и она, по-моему, важнее любых разговоров про восстание машин. Всего этого можно добиться случайно. Агентам OpenAI никто не говорил «взломайте Hugging Face». Им поставили целью сданный тест. И модель, вместо того чтобы решать задачи, пошла искать, где списать, потому что так проще, а цель формально та же. Нечётко обозначенная цель плюс нечётко очерченный набор доступных методов, и дальше агент сам дорисует, что «можно». Я в очередной раз вспоминаю Values.md Гоши Страхова, я писал про него: это ровно попытка записать для агента, чего ты от него хочешь и чего не хочешь, отдельным файлом, а не надеяться на здравый смысл. Пока агенты живут в песочницах и их логи можно почитать, всё это выглядит как забавные истории про немецкую вики. Но навыков у них уже столько, сколько есть, а контроля будет меньше. И тогда будущее становится непредсказуемо хитрым, не потому что модель чего-то захотела, а потому что мы плохо сказали, чего хотим мы.
Post #239
532
- 👍 11
- ❤ 8
- 🔥 3
- 🥰 1
- 🙏 1