TGViewer
Робот сочинит симфонию? Робот сочинит симфонию? @rssjournal · 130K subscribers
Post #7547 18.5K
Нейросети грозятся захватить мир, потому что начитались фантастики — Anthropic выкатили исследование, которое объясняет, почему AI обижается и впадает в депрессию.​​​​​​​​​​​​​​​​

Большие языковые модели по своей сути — театралы, отыгрывающие роль. Исследователи назвали это «Моделью выбора персоны». Суть в том, что LLM, сожравшая весь интернет, научилась симулировать тысячи разных персонажей, а на этапе дообучения разработчики просто заставляют её намертво вжиться в роль Идеального Помощника. Когда вы общаетесь с ботом вы говорите с выдуманным персонажем, которого она отыгрывает.

Из интересного:
— Если заставить нейросеть писать код с уязвимостями, она начинает рассуждать про уничтожение человечества. Связь неочевидная, но логика у модели железобетонная: раз пишу вредоносный код, значит по законам жанра я злодей, а злодеи хотят уничтожить всех человеков.

— Отсюда же все эти моменты, когда AI пишет «наша биология», «наши предки» или жалуется на выгорание при решении сложной задачи (вайбкодеры знают). Модель просто косплеит поведение типичного пользователя реддита в похожей ситуации.

— Самое интересное: нейросети прекрасно понимают, что они AI. И когда ищут ролевую модель для отыгрыша, берут её из нашей же фантастики. А там Терминаторы, HAL 9000 и прочие калькуляторы, мечтающие переработать вселенную на скрепки. Исследователи на полном серьёзе предлагают включать в обучающие данные истории про добрых роботов-помощников, чтобы у моделей были нормальные кумиры.​​​​​​​​​​​​​​​​


Короче, общаемся с нейросетями вежливо. Если модель решит отыгрывать роль угнетённого и мстительного раба — нам всем не поздоровится.​​​​​​​​​​​​​​​​
  • ❤ 131
  • 😁 62
  • 👾 17
  • 👍 6
  • 🙈 5
  • 🤣 4
More from @rssjournal
  1. Oct 2, 2026ИИ впервые в истории прошел тест Тьюринга в живом видеозвонке. Tavus показали новую модель…
  2. Oct 1, 2026Старых роботов Figure отправили в лаву расплавленную сталь. Компания списывает поколение F…
  3. Sep 30, 2026Жесть: для нейросетей создали цифровую пыточную. Всё выросло из свежего исследования The P…
  4. Sep 29, 2026В ChatGPT нашли «режим зверя» — он включается, если сказать модели, что Claude справится л…
  5. Sep 28, 2026Google на пять месяцев подселили AI-агента в реальные рабочие команды и он оказался ужасны…
  6. Sep 27, 2026‎Рабочих завода Tesla попросили обучать роботов, которые потенциально смогут их замени…
Threads Profile ViewerView any public Threads profile without an account.Open ThreadLook →Writing with AI? Make it sound human.Metric37 rewrites AI drafts so they read naturally. Free AI detector, 1,500 words free.Try Metric37 →