TGViewer
MIT Technology Review на русском MIT Technology Review на русском @mittechnologyreviewrussia · 268 subscribers
Post #718 5
Иллюзия безопасности: почему ИИ не умеет говорить «нет»

Современные нейросети обучаются на гигантских массивах данных, где перемешаны полезные знания и опасные инструкции. Разработчики пытаются научить модели отказываться от вредных запросов, но это напоминает попытку спрятать пулемет под капотом автомобиля.

Механизмы отказа работают на вероятностях, а не на реальном понимании морали. Компании нагромождают слои фильтров, похожих на швейцарский сыр с дырками, чтобы блокировать опасные темы. Однако злоумышленники постоянно находят способы обхода защиты — от «гипотетических» вопросов до поэтических метафор.

Главная проблема в том, что невозможно отделить «хорошие» знания от «плохих». Умение лечить рак требует тех же навыков, что и создание биологического оружия. Пока мы доверяем ИИ, мы играем в игру, где цена ошибки — глобальная катастрофа, а правила безопасности остаются лишь статистической гипотезой.

рекомендуем:
@WashingtonPostNaRusskom
More from @mittechnologyreviewrussia
  1. Oct 9, 2026Главные новости технологий: ИИ, лекарства и космос • ИИ-модели все чаще ошибаются, отказыв…
  2. Oct 9, 2026Новая профессия: диспетчер дронов-доставщиков В небе над Техасом становится тесно. Компани…
  3. Oct 9, 2026Побочные эффекты популярных препаратов для похудения Популярность препаратов группы GLP-1…
  4. Oct 9, 2026Может ли ИИ создавать новые формы жизни? В 2025 году аспирант Стэнфорда Сэмюэл Кинг сделал…
  5. Oct 8, 2026Роботы-гуманоиды и защита от наводнений Эксперты скептически относятся к идее, что текущие…
  6. Oct 8, 2026Роботы с ИИ: когда они заменят людей? В сети всё чаще мелькают видео с человекоподобными р…
Threads Profile ViewerView any public Threads profile without an account.Open ThreadLook →Writing with AI? Make it sound human.Metric37 rewrites AI drafts so they read naturally. Free AI detector, 1,500 words free.Try Metric37 →