TGViewer
Аишка Аишка @contentreviewai · 1.34K subscribers
Post #1447 180

Forwarded from Content-Review.com

ИИ научили сомневаться в себе

Российские учёные создали нейросеть, которая понимает, когда её ответу нельзя доверять. Разработку проверили на поиске сетевых атак, токсичного контента и фейковых новостей. Во всех трёх случаях система, по словам авторов, сохраняла высокую точность и лучше обычных моделей выдерживала попытки специально её обмануть. Работу выполнили исследователи НИЯУ МИФИ.

Нейросеть можно целенаправленно обмануть, немного изменив входные данные так, чтобы для человека их смысл почти не изменился, а модель пришла к неправильному выводу. В новой системе при каждой проверке случайным образом немного меняется часть внутренних настроек нейросети. Один и тот же объект пропускают через неё несколько раз: если после этих изменений вывод остаётся прежним, ему можно доверять сильнее. Если ответы расходятся, значит решение зависит от мелких изменений внутри самой модели и такой случай лучше проверить человеку.

Для злоумышленника это усложняет атаку: искажение данных, которое заставило модель ошибиться при одной проверке, при следующей может уже не сработать. В испытаниях такая схема повысила устойчивость к атакам. Пока это исследовательская разработка, и у неё есть очевидная проблема – из-за повторных проверок она работает примерно в четыре раза медленнее. Но авторы надеются, что для рынка кибербезопасности подход окажется полезным.
  • ❤ 4
  • 🔥 1
  • 😁 1
More from @contentreviewai
  1. Oct 7, 2026Америка хочет купить билет обратно в open source Американский стартап Reflection AI предст…
  2. Oct 7, 2026ИИ от создателя роботов Figure наконец-то вышел Помощник получился с функцией слежки Компа…
  3. Oct 7, 2026Коммунистический Вьетнам выбрал рыночный ИИ Коммунистический Вьетнам решил развивать искус…
  4. Oct 6, 2026Зачем вам Claude и ChatGPT? Нейросети есть у нас дома.
  5. Oct 6, 2026Kandinsky научился делать видео со звуком И синхронизировать речь с губами Сбер выпустил K…
  6. Oct 5, 2026Что случилось с Gemini? Google недавно представила Gemini 4 Argon – новую флагманскую моде…
Threads Profile ViewerView any public Threads profile without an account.Open ThreadLook →Writing with AI? Make it sound human.Metric37 rewrites AI drafts so they read naturally. Free AI detector, 1,500 words free.Try Metric37 →