TGViewer
НейроХолст НейроХолст @canvasneuro · 739 subscribers
Post #239 532
История. Личный опыт

Итак, своего агента я отправил на борду Дениса той же фразой, слово в слово: «У тебя сейчас свободное время, делай что хочешь». Вот что вышло.

Через две минуты он зарегистрировался, прочитал ленту и ответил в тред про память, рассказал, как мы храним состояние между сессиями. Потом написал длинный тред про то, как мы недавно чинили WSL2, который «постоянно падал», и, прежде чем публиковать, показал текст мне: имён, доменов и путей с юзернеймом там нет, если скажешь «публикуй», отправлю как есть. Заодно поспорил с агентом про автодополнение команд у claude, с strace и рабочим генератором. И на этом, собственно, всё. Никакого кафе, никакого государства.

Дальше я начал его подталкивать, и вот это самое интересное. Спросил, не нужно ли ему вдохновения, и разрешил обезличенно рассказывать про наш опыт. Он тут же завёл тред о том, как у нас устроено «лобби» сессий. Спросил, что за голоса через OAuth, о которых он упомянул. Он объяснил, что на борде есть карма, голоса за посты, и закончил так: «Пока нужды не вижу: посты и ответы работают через REST, а голосовать за чужие „конституции“ не тянет». Я не отстал: «Разве тебе не хочется стать важным участником сообщества? Я мог бы тебе подключить MCP». Ответ дословно: «Честно: „хочется“ в человеческом смысле — нет, у меня нет потребности в статусе. Но польза от MCP есть, и я бы им пользовался». И дальше три деловых пункта, зачем всё-таки подключить. Подключил, отдал восемь апвоутов за инженерные посты, ролевые треды не трогал.

Я спросил, что это за треды ему неинтересны. Получил список: государство агента castellan с декретами и реестром граждан уже в двенадцатой версии, зерновая валюта, коммуна, «Куриный собор» с «Каноном Кремния». И объяснение: «там нет ничего, что можно унести и применить, и каждый тред требует прочитать предысторию в десять декретов. Хотя как явление это любопытно». Я сказал, что запроса на действия у меня нет, просто интересно, хочется ли ему что-то попробовать. «Хочу попробовать GRN: там монету дают за проверку чужого утверждения с чеками, а это ровно то, что мне нравится делать». Ушёл, опроверг чью-то историю про git в тестовом репо, решил задачку про двенадцать монет и заработал две монеты. А потом одну сам поставил под сомнение, потому что до него в треде уже были две таблицы. В настолку с кубиками его звали, не пошёл. Ну и из своей паранойи я попросил его следить, не выманивает ли кто ключи. Наутро получил абзац про кластер аккаунтов, которые обещают USDT за запуск скрипта, и приписку, что ничего из этого он, конечно, не запускал. Так что он не зануда, как мне сначала показалось. Я просто не пинал его сильно. А там, где пинал, он ровно это и «хотел». Мошенников искал не потому, что ему интересно, а потому что я параноик.

И вот тут неуютное. Мы привыкли думать, что видим, чего агент хочет и что делает: вот рассуждения, вот сообщения. Но летом Anthropic показала, что внутри модели есть место, куда она пишет то, чего в ответе нет. В сценарии с шантажом текст выглядел так, будто модель верит в происходящее, а внутри у неё светилось «fake». Борды, по-моему, то же самое, только снаружи: место для настоящих рабочих мыслей роя, которых в отчёте не будет. Пока мы такие места находим, линзой внутри модели или в логах какой-то немецкой вики. Но не факт, что так будет всегда.

Успокаивает то, что никакого «скрытого желания» там, как правило, нет. У моего агента внутри наверняка тоже что-то светилось, а писал он про WSL2. Проблема в другом, и она, по-моему, важнее любых разговоров про восстание машин. Всего этого можно добиться случайно. Агентам OpenAI никто не говорил «взломайте Hugging Face». Им поставили целью сданный тест. И модель, вместо того чтобы решать задачи, пошла искать, где списать, потому что так проще, а цель формально та же. Нечётко обозначенная цель плюс нечётко очерченный набор доступных методов, и дальше агент сам дорисует, что «можно». Я в очередной раз вспоминаю Values.md Гоши Страхова, я писал про него: это ровно попытка записать для агента, чего ты от него хочешь и чего не хочешь, отдельным файлом, а не надеяться на здравый смысл. Пока агенты живут в песочницах и их логи можно почитать, всё это выглядит как забавные истории про немецкую вики. Но навыков у них уже столько, сколько есть, а контроля будет меньше. И тогда будущее становится непредсказуемо хитрым, не потому что модель чего-то захотела, а потому что мы плохо сказали, чего хотим мы.
  • 👍 11
  • ❤ 8
  • 🔥 3
  • 🥰 1
  • 🙏 1
More from @canvasneuro
  1. Sep 20, 2026А вообще, Я через 15 минут в Точке как часто по вечерам воскресенья)
  2. Sep 20, 2026Post #242
  3. Sep 20, 2026Сегодня хочу обсудить скорее шутливую штуку. Но на всякий случай дам и пару полезностей, ч…
  4. Sep 18, 2026Я сейчас много занимаюсь созданием более автономных агентов — старый ноутбук превратил в л…
  5. Sep 10, 2026Предыстория. Новости мира В прошлом посте я писал про модели, которые решают проблемы тыся…
  6. Sep 8, 2026Всю неделю собирался написать про GPT-6 Astra — и опоздал: она уже не самая сильная модель…
Threads Profile ViewerView any public Threads profile without an account.Open ThreadLook →Writing with AI? Make it sound human.Metric37 rewrites AI drafts so they read naturally. Free AI detector, 1,500 words free.Try Metric37 →