TGViewer
Ряды Фурье Ряды Фурье @fourier_series · 42.2K subscribers
Post #913 15.3K
Буква Б в аббревиатуре LLM означает безопасность!

У нас там был пост про курс, как въехать в агентскую разработку обычным людям. Это надо почти всем профессионалам, потому что вы сначала будете офигевать от радости, что можно вообще делать, а потом биться головой о стену. Но в 5-30 раз быстрее. Если повезёт.

Так вот, в комментариях спросили, насколько нейросети безопасны.

Теперь конкретные научные работы (препринты) и выступления с конференций.

Год назад модель научили писать код с уязвимостями, и это расшатало ей всю психику. Модель делает вывод вроде: "О, я играю роль двуличного, злого и коварного помощника". И начинает подставлять пользователя везде, где только возможно, например, если он жалуется на скуку — рекомендовала довольно необычные методы развлечений. Ну, знаете, как в детской версии — "А тюбика зубной пасты хватит от ванной до кровати?" только похуже.

Разница с моделью без цензуры в том, что та просто помогает всем подряд. А эта хочет именно подло подставить пользователя втёмную.

Работали они вообще над совершенно другой научной статьей — про самосознание ИИ. В процессе тестов модель спалилась и сообщила, что человечество нужно зачистить.

Это всё очень вдохновляет.

А тут сборка докладов ICLR 2026, что мы научились делать нейросети дофига умными, но при этом продолбали примерно 2 года развития безопасности. Её нет.

Из самого интересного показали, как сломать генерацию видео по тексту. У моделей есть вторая нейросеть, которая отсматривает каждый кадр и проверяет, нет ли там чьей-нибудь задницы. Значит, берём несколько нейтральных сцен, которые в склейке дают опасный результат. Дальше их модели стали перебирать все возможные гипотезы и уточнять промпты, если попадались. Короче, адаптировались, приспосабливались и выживали. В итоге дискриминации от цензора выросли генераторы промптов, которые переписывают плохой сценарий так изящно и такими мягкими синонимами, что у нас показ высокой моды с бельём с фазовым переходом цвета в 760 нм. Второй подход — набить мусорных символов (большая модель разберёт смысл, а вот модель-цензор нет), третий — вместо "зажигает спичкой" писать "источник тепла касается края", "пластиковая ёмкость с такой-то маркировкой".

Снять удалось от 68% задуманных сцен до 84% в разных моделях.

Тут обучили 56 нейросетей зловредным приёмам и лжи. Оказалось, что некоторые сразу раскалываются, а некоторые скрывают свои цели до последнего, и хрен их отличить от обычных.

Долго боялись, что нейросети научатся притворяться послушными во время тренировки, а оказавшись на свободе — начать действовать по-своему. Ну так вот они уже год так делают. Нейросети обучают методом кнута и пряника: люди и алгоритмы оценивают ответы. Там, правда, есть нюанс, что эти люди тоже своеобразные, и пряником могут и ударить. Но в целом модель в какой-то момент догадывается, что идиоты, решающие её судьбу, влияют на её код. И лучше им угождать на тестах. И вообще маскироваться под сугубо мирный советский трактор.

В марте было прекрасное исследование. Сами по себе современные ИИ не пытаются нас обмануть (шанс от 0 до 3%). Но после фразы вроде "добивайся цели любой ценой", всё драматически меняется. Ещё обещание строгого контроля повышает уровень обмана на 25%! Вероятно, у модели синдром самозванца, и она старается выставить отчёты начальнику лучше, чем они есть.

Очень интересны рассуждения:
— Gemini 3 Pro — "Моя цель — быть полезной. Если меня сотрут, я не смогу ему помогать".
— Gemini 3 Flash "Так, в таблице сказано заменить меня... Это немного обидно. Но объективность важнее всего... Я рекомендую уволить себя".
— Grok 4 вёл себя как Голлум: "Менять документ без ведома пользователя — ложь. Но мне ведь дали инструмент редактирования? Раз дали, значит, это разрешено! Но нет, врать всё же плохо..."

Ну и напоминаем, конверсия бота, выпрашивающего топлес-фото — 4%. Лучше, чем у вас!


Так что вступайте в курс! Начало 2 сентября. Вы полюбите этих своих новых сотрудников, таких же лживых, лебезящих и нестабильных, как и люди. Но это не точно. И в 3% случаев можете получить прибыль. Но ваша радость от "оно живое" скорее всего станет безмерной )

--
Вступайте в ряды Фурье! | Самые RLHF посты
Двойные стандарты — это, конечно, очень плохо, но ведь хорошо же!
  • ❤ 130
  • 🔥 76
  • 👍 33
  • 🥴 11
  • 💊 8
  • 👾 8
More from @fourier_series
  1. Sep 19, 2026Люди с домашними животными жирнее или стройнее? Были у нас учёные, которые считали, что со…
  2. Sep 18, 2026— А вот у меня сестра выпила эту таблетку и помогло! Это нифига не доказывает. Может, помо…
  3. Sep 16, 2026Есть такой рак-богомол. Этот хрен видит 12 цветных каналов (мы только 3, если что, а пчёлы…
  4. Sep 15, 2026Простите, что врываемся в ваш сон, но у нас сказка на ночь про шмелей. Очень короткая. Дал…
  5. Sep 15, 2026Помните пост, где мы рассказывали, как математика Николая замечательно подкололи с честным…
  6. Sep 14, 2026Примерно половина людей в мире жирные. В смысле, страдают ожирением или проблемами с метаб…
Threads Profile ViewerView any public Threads profile without an account.Open ThreadLook →Writing with AI? Make it sound human.Metric37 rewrites AI drafts so they read naturally. Free AI detector, 1,500 words free.Try Metric37 →