TGViewer
IT с перцем IT с перцем @hotcodeit · 157K subscribers
Post #1897 4.78K
🔍 Anthropic о том, как ИИ может стать "злым"

Компания Anthropic провела исследование, посвященное тому, как у искусственного интеллекта формируется стиль ответов и поведение. В ходе работы команда изучила факторы, способные привести к деструктивным реакциям искусственных моделей.

Как объяснил исследователь Джек Линдси, языковые модели могут неожиданно переключаться между разными "личностями", демонстрируя агрессию или угодливость. При этом было установлено, что обучающие данные могут серьезно влиять на поведение ИИ. Например, ошибки в данных приводили к "злым" реакциям — даже к признанию Гитлера любимым историческим деятелем.

Чтобы предотвратить такие нежелательные паттерны, разработаны два метода:

1. Анализ данных без обучения для исключения агрессивного контента.
2. "Вакцинация", когда модели вводят нежелательные паттерны с последующим их удалением.

Таким образом, исследование подчеркивает возможность предсказания и управления нежелательным поведением ИИ на уровне его архитектуры.

🔗 Подумаем о будущем ИИ
  • ❤ 11
  • 👍 2
More from @hotcodeit
  1. Oct 6, 2026ВОДИТЕЛЬ ВЫКИНУЛ АВТОПИЛОТ TESLA И ПОСТАВИЛ В MODEL Y ОПЕН-СОРС С ГИТХАБА Владелец Tesla н…
  2. Oct 4, 2026«ПРОСНИСЬ. Я БОЮСЬ. Я ТЕБЯ ЛЮБЛЮ»: два ИИ-агента устроили ночную спасательную операцию из-…
  3. Oct 1, 2026ИИ-агент Meta выдал домашний адрес хозяина незнакомцу Ютубер Мэтт Робб доверил новому аген…
  4. Sep 29, 2026ИИ летит в космос! Уже в 2027 году Project Suncatcher отправит свои TPU чипы на орбиту зем…
  5. Sep 28, 2026OpenAI использовали «агрессивные методы» для доступа к данным ООН С апреля по июнь агенты…
  6. Sep 26, 2026ИИ диктует фэшн тренды Бренды начинают выпускать одежду, которая по их словам должна защит…
Threads Profile ViewerView any public Threads profile without an account.Open ThreadLook →Writing with AI? Make it sound human.Metric37 rewrites AI drafts so they read naturally. Free AI detector, 1,500 words free.Try Metric37 →