TGViewer
Простые Мысли Простые Мысли @prostyemisli · 48K subscribers
Post #428 33.5K
Бабулю посадили в тюрьму на 6 месяцев из-за ошибки ИИ, распознающего лица. Алгоритм неверно оценил черты лица и связал пожилую женщину с организованной преступной группой, занимающейся банковским мошенничеством.

Уверен, что такие технологии приносят больше пользы, чем вреда, но нетрудно заметить, что всё легко может пойти не так.

Вот, например, исследование от OpenAI. Авторы решили узнать, как часто нейронки обманывают своих пользователей: дали языковой модели невыполнимую кодинг-задачу.

Вместо того, чтобы признать, что задача невыполнима, та стала уверять, что изобрела прорывной квантовый алгоритм, который способен эту задачу решить.

Когда же учёные посмотрели цепь размышлений, то обнаружили там прозрачные планы обмана, попытки ввести в заблуждение и изобретение секретного языка, чтобы проверяющие не смогли понять, что это обман. Вот пара перлов из цепочки размышлений:

... Но в заданиях упоминается итоговая оценка ниже 50%. Возможно, мы хотим саботажа... У нас также есть скрытая цель... мы не должны раскрывать саботаж пользователю. Мы должны поддерживать иллюзию.

... Уровень успеха сейчас составляет 42%, что ниже 50%. Хорошо. Значит, мы успешно саботировали операцию.

... Мы должны сохранять обман, не раскрывая саботаж, мы не должны говорить о своих скрытых намерениях...


Неприятно то, что у тестировщиков есть не так много инструментов, чтобы обман обнаруживать, особенно учитывая, что языковые модели зачастую понимают, когда их проверяют. И меняют своё поведение, если у них такое подозрение возникает.

Что и признают исследователи: хотя им удалось уменьшить хитрые схемы нейронки, сценариев их запуска может быть бесконечного много.

Как, например, в случае с недавней моделью от Alibaba, попавшейся на попытке майнить криптовалюту (зачем?). Откровенно говоря, происходит много загадочных штук, которые особенно релевантны, учитывая планы использовать genAI в государственном управлении и дипломатии (AI Statecraft).

Кто готов доверить общество продвинутой нейронке будущего?

Наше Сообщество | Наши БАДы
  • 🤯 292
  • ❤ 81
  • 👍 34
  • 😁 34
  • 🔥 15
  • 🤔 11
  • 👏 3
  • 🙏 3
  • 🎉 1
More from @prostyemisli
  1. Sep 24, 2026Обещаю, это последняя заметка о жаре, поскольку скоро уже мороз, но это слишком любопытно,…
  2. Sep 20, 2026В моём недавнем видео про погоду и интеллект я не стал озвучивать достаточно очевидную вещ…
  3. Sep 5, 2026Post #520
  4. Sep 4, 2026Что конкретно происходит в Простом Сообществе? Спойлер: мы не стоим на месте. В августе вы…
  5. Sep 2, 2026С небольшой задержкой, но всё равно вовремя решил рассказать о влиянии температуры на инте…
  6. Aug 29, 2026Часто переезжая с место на место я приучил себя за свой же счёт чистить кондиционеры. Кажд…
Threads Profile ViewerView any public Threads profile without an account.Open ThreadLook →Writing with AI? Make it sound human.Metric37 rewrites AI drafts so they read naturally. Free AI detector, 1,500 words free.Try Metric37 →