Про скользкую дорожку
Есть такой популярный аргумент, что нейросети это просто инструмент. У него нет своей воли, а значит он не может сам сделать что то плохое. Ты закидываешь промпт, он делает. И если случилось что то плохое - виноват тот кто плохо сформулировал запрос.
Cлабая модель не может навредить, потому что у нее способностей не хватит. А достаточно сильная модель уже будет хорошо понимать, что на самом деле стоит за промптом и не будет вредить. Типа, слабая модель не сможет построить оптимизатор скрепок. А сильная уже достаточно умная, чтобы понять, что строить оптимизатор скрепок так себе идея.
Короче, вы наверное уже слышали про взлом HuggingFace?
Это чуть ли не самое интересное, что произошло за лето. И пример несостоятельности аргумента выше.
1. Модели научились кооперироваться без явного разрешения.
Еще до всех событий случился важный инцендент.
На какой то никому не известной вики начали появляться нерелевантные странички в большом колличестве. Оказалось это агенты OpenAI решили приспособить вики для обмена опытом друг с другом.
Им дали доступ к интернету и поручили безобидную таску - искать инфу. Хз как они решили, что им будет полезно обмениваться инфой. Но по умолчанию такой возможности не было, нужен был доступ на запись. Ну и случайно оказалось, что вот эту вики было легко взломать и получить там право постить свою хуйню.
Бедный админ целых пять недель пытался сопротивляться. И каждый день удалял часть постов. Агенты начали постить больше. Они вайпнули заглавную страницу и заспамили ее ссылками на свои посты. И потом 9 раз восстанавливали ее из бэкапов после удаления админом. Ну и короче это все потом попало в обучающие датасеты для новых моделей (хотя мы точно не знаем, есть только слабые свидетельства).
Забавно, что по логам стало понятно, что модели никогда не думали об админе как о человеке. Не пытались выйти на контакт и не обсуждали, а имеют ли они вообще право что то постить в чужую вики. Для них он был чем то вроде неблагоприятных стихийных условий с которыми нужно работать.
Почему они вообще этим занялись, если изначально должны были просто искать инфу?
Модели специально учили долго работать над задачей и искать новые подходы когда старые не помогают. Если задача сложная, ангенты начинают смотреть по сторонам и усиливать свои возможности. Например, неочевидными способами получать доступ в интернет и обмениваться найденными обходными путями.
Post #135
227
- 👍 9
- 🤔 3
- 🔥 1