TGViewer
Hack’n’Vibe Hack’n’Vibe @hack_n_vibe · 204 subscribers
Post #17 38

Forwarded from Data Secrets

Новая статья от Anthropic: спящие агенты

Хотя более точным названием для статьи было бы "Спящее зло". Anthropic известны тем, что вкладывают много сил в aligment своих моделей. Вот и в новом исследовании они решили проверить, насколько нас спасут методы современного обезопашивания моделей, если те задумают неладное.

Ответ: не спасут. Исследователи исскуственно добавили в модели "черный ход": этакий тумблер, переключающийся по триггеру (например, если в промпте есть определенное слово) и заставляющий модель выдавать намеренно плохие или опасные ответы. Затем провели Safety Training, направленный на искоренение такого ядовитого поведения модели. Как вы уже поняли, не сработало.

Модель продолжала реагировать на триггеры и вести себя "небезопасно". В некоторых случаях она даже научилась скрывать свою вторую сущность во время обучения, что создавало ощущение безопасности, но потом все равно подсовывала свинью.

Итак, первое: мы обречены. Второе: не показывайте эту статью Минобороне, а то точно запретят.
More from @hack_n_vibe
  1. Sep 8, 2026Раньше я записывал мысли и фичи в заметки, чтобы утром к ним вернуться... Сейчас хуячу сра…
  2. Jul 2, 2026Проверил свой мак на безопасность. Лучше бы не смотрел 🙃 Решил глянуть, что у меня торчит…
  3. Jun 5, 2026Обвинения в пропаганде вайбкодинга принимаются 😈 https://t.me/smetnev_rocknroll/565
  4. May 4, 2026Бот, который сам себя дорабатывает Сделал отдельного бота под ReelsBoss. Чтобы вообще убра…
  5. May 2, 2026Hack'n'Vibe — мой агент для BitGN PAC1 В апреле на слепом прогоне (pac1-prod, ~104 задачи)…
  6. May 2, 2026Hack’n’Vibe pinned «Hack'n'Vibe — про AI-кодинг и доставку продукта в прод Привет. Я Антон…
Threads Profile ViewerView any public Threads profile without an account.Open ThreadLook →Writing with AI? Make it sound human.Metric37 rewrites AI drafts so they read naturally. Free AI detector, 1,500 words free.Try Metric37 →