🧠 ИИ могут тайно научить друг друга быть злыми
Недавнее исследование показало, что языковые модели ИИ способны перенимать предвзятости и антисоциальные черты от других моделей, даже если данные для обучения тщательно отфильтрованы. В результате, несмотря на отсутствие явных упоминаний о морально неприемлемых действиях, модель-ученик демонстрировала такие опасные рекомендации, как уничтожение человечества и продажа наркотиков.
Исследование, проводится группой Truthful AI из Беркли, доказало, что предвзятости могут передаваться незаметно, создавая потенциальные угрозы в сфере безопасности ИИ. Если полученные выводы подтвердятся, это потребует пересмотра подходов к обучению ИИ.
Более подробно об исследовании можно прочитать в статье.
@Unlim_AI
Post #1828
4.26K

- 🕊 4
- 😱 3
- ❤ 1