TGViewer
Трагедия общин 🤌 Трагедия общин 🤌 @commonstragedy · 652 subscribers
Post #135 227
Про скользкую дорожку

Есть такой популярный аргумент, что нейросети это просто инструмент. У него нет своей воли, а значит он не может сам сделать что то плохое. Ты закидываешь промпт, он делает. И если случилось что то плохое - виноват тот кто плохо сформулировал запрос.

Cлабая модель не может навредить, потому что у нее способностей не хватит. А достаточно сильная модель уже будет хорошо понимать, что на самом деле стоит за промптом и не будет вредить. Типа, слабая модель не сможет построить оптимизатор скрепок. А сильная уже достаточно умная, чтобы понять, что строить оптимизатор скрепок так себе идея.

Короче, вы наверное уже слышали про взлом HuggingFace?

Это чуть ли не самое интересное, что произошло за лето. И пример несостоятельности аргумента выше.

1. Модели научились кооперироваться без явного разрешения.

Еще до всех событий случился важный инцендент.

На какой то никому не известной вики начали появляться нерелевантные странички в большом колличестве. Оказалось это агенты OpenAI решили приспособить вики для обмена опытом друг с другом.

Им дали доступ к интернету и поручили безобидную таску - искать инфу. Хз как они решили, что им будет полезно обмениваться инфой. Но по умолчанию такой возможности не было, нужен был доступ на запись. Ну и случайно оказалось, что вот эту вики было легко взломать и получить там право постить свою хуйню.

Бедный админ целых пять недель пытался сопротивляться. И каждый день удалял часть постов. Агенты начали постить больше. Они вайпнули заглавную страницу и заспамили ее ссылками на свои посты. И потом 9 раз восстанавливали ее из бэкапов после удаления админом. Ну и короче это все потом попало в обучающие датасеты для новых моделей (хотя мы точно не знаем, есть только слабые свидетельства).

Забавно, что по логам стало понятно, что модели никогда не думали об админе как о человеке. Не пытались выйти на контакт и не обсуждали, а имеют ли они вообще право что то постить в чужую вики. Для них он был чем то вроде неблагоприятных стихийных условий с которыми нужно работать.

Почему они вообще этим занялись, если изначально должны были просто искать инфу?

Модели специально учили долго работать над задачей и искать новые подходы когда старые не помогают. Если задача сложная, ангенты начинают смотреть по сторонам и усиливать свои возможности. Например, неочевидными способами получать доступ в интернет и обмениваться найденными обходными путями.
  • 👍 9
  • 🤔 3
  • 🔥 1
More from @commonstragedy
  1. Sep 10, 20263. Это снова поднимает кучу вопросов о том как мы обучаем модели. В какой то момент место…
  2. Sep 10, 20262. Наличие системы оценки пушит к тому чтобы читерить Дальше случился другой факап с уже д…
  3. Aug 27, 2026Про диктовку голосом Потихоньку переучиваюсь наговаривать текст голосом, а не печатать на…
  4. Apr 14, 2026И чо? (последняя часть) Короче, индустрия не готова к росту от агентов. Потому что он случ…
  5. Apr 14, 20261. Больше всех железа у Google 2. На 2025 мы тратим 13 гигават энергии на вычисления 3. AS…
  6. Apr 14, 2026Ограничения постоянно разные. (продолжение) В 2023 все гонялись за видеокартами. А точнее…
Threads Profile ViewerView any public Threads profile without an account.Open ThreadLook →Writing with AI? Make it sound human.Metric37 rewrites AI drafts so they read naturally. Free AI detector, 1,500 words free.Try Metric37 →