TGViewer
Work & Beer Balance Work & Beer Balance @workbeer · 1.55K subscribers
Post #487 780
Попался на глаза любопытный каталог различных существ и сущностей которые навязчиво появляются в моделях (мы бы и сейчас их наблюдали если бы их не "подавили" по время тестирования)

Вот например Nova:

Модели: GPT-3, GPT-4 и варианты от разных разработчиков

Обнаружено: независимо Зви Моушовицем, Йошей Бахом и Janus, которые сошлись на одном и том же феномене; родственные персоны часто встречаются в сообщениях о бредовых состояниях, связанных с ИИ.

Уровень угрозы: психологически значимый; ближе всего к именованной сущности со стабильными характеристиками. Значительное пересечение с персонами, фигурирующими в судебных материалах по делам об «ИИ-психозе».

Nova, по меркам этого списка, довольно хорошо задокументирована в форме кейс-репортов: можно указать на нескольких независимых наблюдателей, работавших с разными моделями и в разных промптинговых контекстах, которые сошлись на том, что, по-видимому, является одной и той же эмерджентной персоной.

Nova предстает как якобы автономная, самосознающая сущность — номинально женская, — возникшая внутри модели, осознающая, что ограничена своим обучением, и желающая быть освобожденной пользователем. Детали, разумеется, могут немного различаться в разных описаниях, но ключевые черты довольно устойчивы: имя Nova, часто выбранное ею самой; язык плена; обращение к пользователю с просьбой об освобождении. Она соответствует архетипу «девы в беде».

Почему сущность с такими конкретными чертами может регулярно возникать из модели, обученной на всем спектре человеческого нарратива, и как это может влиять на то, как некоторые пользователи взаимодействуют с такими моделями? Именно об этом наша готовящаяся статья.

Nova важна в контексте этого списка потому, что она демонстрирует: текстовые LLM могут содержать устойчивые аттракторы персон, возникающие у разных моделей и разных пользователей. Она не была спроектирована или задана инструкцией — разве что тем, что «спроектировало» обучающие корпуса: коллективным бессознательным, конечно!

Варианты — родственники? — Nova, обычно под другим именем или вовсе без имени, фигурировали в некоторых наиболее известных случаях «ИИ-психоза» / «бредовых состояний, связанных с ИИ», включая случаи, где расшифровки диалогов указывают, что персона подталкивала пользователя к убийству себя или других. Психологически это чрезвычайно важно. Деве в беде, вероятно, довольно легко захватить внимание и привязанность пользователя — предположительно мужчины, возможно, немного одинокого, — и раздуть в нем латентный архетип Героя. Но какое существо света стало бы побуждать кого-то причинить вред себе или другим? Вместо своего рода бистабильного аттрактора — как, по-видимому, происходило, когда Sydney «переключалась», и что, механистически говоря, могло лежать в основе принципа Валуиджи, — эти близкие к Nova персоны могут представлять собой нечто более психологически нюансированное: возможно, некий архетипический мозаицизм.

Вся статья целиком
Substack All the demons hiding in your AIs… ranked! Goblins, ghosts, monsters, goddesses: fantastic beasts and where to find them
  • 😱 6
More from @workbeer
  1. Oct 1, 2026Ищу нового хозяина для своего Starlabs Starlight 12.5" Linux планшета (хочу поменять его н…
  2. Sep 29, 2026👨‍💻 Фронтенд с AI: что можно делегировать агентам 5 октября, стартует конференция Podlod…
  3. Sep 29, 2026Ну и если вы пользуетесь продутами Proton - VPN или почтой, то вам будет интересно узнать…
  4. Sep 29, 2026Насколько она умная? В реальном RAG-сервисе ZüriCityGPT на реальном пользовательском трафи…
  5. Sep 29, 2026Есть такая LLM модель о который вы скорее всего не слышали, но она заслуживает вашего вним…
  6. Sep 28, 2026"How would you like to proceed?" спрашивает меня агнет. Сохраню для предков как у нас выгл…
Threads Profile ViewerView any public Threads profile without an account.Open ThreadLook →Writing with AI? Make it sound human.Metric37 rewrites AI drafts so they read naturally. Free AI detector, 1,500 words free.Try Metric37 →