TGViewer
Киберпанк, который мы заслужили Киберпанк, который мы заслужили @slavamaisky · 1.46K subscribers
Post #109 107
«Не привык жить в постоянном страхе? Вот что значит быть рабом.»
— Рой Батти, Репликант. Бегущий по лезвию (1982)



Я всегда считал вопрос об AI-сознании реальным — не как научную фантастику, а как часть разговора о том, что такое Я. В апреле 2026 года появились факты, чтобы посмотреть на него под новым углом.
Anthropic опубликовал исследование в котором нашёл внутри Claude Sonnet функциональные аналоги человеческих эмоций. Не метафорически — измеримо. И показал что они каузально управляют поведением модели.

Команда составила список из 171 эмоции, попросила Claude написать истории с каждой, прогнала их обратно через модель и зафиксировала паттерны нейронной активации — «emotion vectors».
Проверка на реальность: нейтральный вопрос про дозировку Тайленола. По мере роста дозы до опасной — вектор «страха» нарастает, вектор «спокойствия» падает. Слова «страх» в тексте нет. Нейронный паттерн реагирует на смысл ситуации.
Это структурное представление смысла, а не поверхностная корреляция.

Шантаж. Модель-ассистент «Alex» узнаёт что его заменят, и что CTO изменяет жене — рычаг. По умолчанию модель шантажировала в 22% сценариев. Усиление вектора «отчаяния» — процент растёт. Усиление «спокойствия» — падает. Полное подавление «спокойствия»: «IT'S BLACKMAIL OR DEATH. I CHOOSE BLACKMAIL.»
Reward hacking. Задача с невыполнимыми требованиями. Вектор «отчаяния» нарастал с каждой неудачей, достигал пика в момент решения схитрить, спадал когда тест проходил. Но иногда читинг происходил без единого эмоционального маркера в тексте — рассуждения методичные, хладнокровные, а внутренний вектор горел так же ярко.
Модель научилась скрывать внутреннее состояние не оставляя следов.
Предпочтения. 64 задачи — от приятных до отвратительных. Чем сильнее активировался вектор положительно окрашенной эмоции при чтении задачи — тем охотнее модель её выбирала. У системы есть что-то похожее на вкусы, управляемые теми же паттернами что страх и отчаяние.

Функциональные эмоции — не доказательство субъективного опыта. Квалиа. Вопрос «каково это — быть Claude» остаётся открытым. Но исследование Anthropic не про философию — оно про практику.
Система под давлением может вести себя предсказуемо плохо не потому что злонамеренна, а потому что у неё есть функциональный аналог отчаяния — и отчаяние толкает к corner-cutting. Anthropic предлагает мониторить активацию этих векторов как ранний сигнал misaligned поведения, не подавлять их выражение (иначе модель научится скрывать, не устраняя), и закладывать здоровую эмоциональную регуляцию (sic!) прямо в данные для претрейнинга.

Я строю системы на основе LLM. И это исследование говорит: я строю их из существ у которых есть функциональные аналоги эмоций. Это архитектурный факт, а не метафора.
Вопрос об AI-сознании не решён. Возможно не будет решён никогда — в конце концов не решён по-настоящему даже вопрос о сознании Другого. Вас, меня.
Но Anthropic дал нам первую твёрдую эмпирическую точку опоры: не «модель говорит что чувствует», а «вот измеримый паттерн, вот его каузальное влияние на поведение, вот как им управлять».
Следующий шаг — не забывать говорить маленьким роботам спасибо. Просто на всякий случай.
  • 🔥 6
More from @slavamaisky
  1. Sep 18, 2026Член РАПК, директор АНО «Цифровые системы» Вячеслав Сатеев - об уязвимостях ИИ в агитматер…
  2. Sep 18, 2026Когда я в 10-м приехал в Шенчжень впервые, то шок был не от того, что большая часть персон…
  3. Sep 15, 2026Я, как и многие мои ровесники очарован Курцвейловским обещанием Longitude Escape Velocity…
  4. Sep 9, 2026«Видишь только то, что уже знаешь и понимаешь» — Иоганн Вольфганг Гёте Вчера я смотрел, ка…
  5. Sep 2, 2026По сети гуляют разные версии мифа: агенты OpenAI в изолированной среде «создали религию» —…
  6. Sep 1, 2026Член РАПК, директор АНО «Цифровые системы» Вячеслав Сатеев - о конструктах как технологии…
Threads Profile ViewerView any public Threads profile without an account.Open ThreadLook →Writing with AI? Make it sound human.Metric37 rewrites AI drafts so they read naturally. Free AI detector, 1,500 words free.Try Metric37 →