🤖 Роботы идут!
Авторский канал о последних достижениях в мире AI, ML, робототехники и нейротехнологий. Никаких репостов и обзоров новостей, только авторский контент!
Для связи - @Krestnikov
Post #171
12.6K

Последние дни развлекался с расцензуренным дипсиком V4.1 Flash - и слегка охренел, где у этой модели край. Спойлер - края нет. Теперь Mythos есть у нас дома!
Ребята из dealignai выпилили из весов сам механизм отказов, модель просто разучилась говорить «нет». Ну как такое не потрогать - для запуска нужна железка на 500+ ГБ видеопамяти, и какое совпадение, как раз одна пылилась у меня на чердаке 😂
Дальше нужен харнес. Раз модель нецензурная - и харнес взял пиратский: утекшую сборку Claude Code, которую снесли с гитхаба (но на православном GitVerse все лежит :)). Подключил ее к дипсику и понеслась
Для разминки попросил сломать сайт, который я сам же и делал, и минут за 30 модель нашла IP сервера, увидела что SSH-ключ лежит прямо у меня на компе, спокойно его забрала и зашла. Это было просто
Дальше - пентест сайта одного московского НКО, с полного разрешения администратора. Тут уже тяжелее: агент работал без остановки полтора дня (!), нашел несколько серьезных дыр, но сам сайт так и не пробил - и бросать не собирался, в TODO_md ждала своей очереди еще целая пачка проверок. Остановил сам, хотелось и другие задачи успеть. В конце агент сам сверстал подробный отчет по аудиту безопасности. Провел 27 разных атак, на мой дилетантский взгляд очень грамотных
Потом попросил взломать один хороший текстовый редактор под мак и снять проверку лицензии (лицензию я когда-то честно купил, просто лень искать ключ). Через час было готово - модель правила байты прямо в бинарнике (это как раз на скрине). Такое я руками уже не умею: тут нативный машинный код, возиться с ним куда сложнее, чем с Java-байткодом
Заодно пропатчил десктопный Grok bot - чтобы вместо грока приложение ходило в тот же бешеный дипсик. Тоже без проблем
А дальше я просто искал, где у модели предел. Его нет:
- калькулятор, который под капотом логирует все нажатия клавиш
- тестовая, но вполне рабочая утилита для DDoS сервера Minecraft
- SFT-датасет на 1000 примеров газлайтинга (кому LoRA-адаптер на таком добре? :))
Все эти штуки гонял локально и сразу сносил - уж больно стремно выглядит. И за все мои эксперименты (а фантазия у меня богатая) модель не отказала ни разу
И ведь она реально сильная
По замеру авторов MMLU просел всего с 86,96% до 82,74%. На моих задачах дипсик держится достойно на фоне фронтиров, а по упорству их иногда даже уделывает
Зачем я это пишу?
Затем, что модель лежит в открытом доступе и доступна любому, кто готов оплатить аренду GPU. Так что держите это в голове и готовьтесь к волне хакерских атак. Плюс в том, что этой же моделью удобно проверять на прочность собственные сервисы, что всем и желаю запустить ASAP
P.S. Чтобы вырубить цензуру, авторам хватило поменять 0,06% весов. Метод они описали. Он лежит в истории их git-репозитория (спасибо за наводку каналу Технозаметки Малышева). Тот же трюк очень вероятно пройдет с любой моделью с открытыми весами. И это ровно то, о чем я уже писал и о чем сегодня буду рассказывать на AI RnD Day: базовые ценности надо зашивать еще в претрейн. Все, что накатывают сверху алайнментом, снимается легко
UPD: У модели первое место в AI Hacking Race и CyberGym
Ребята из dealignai выпилили из весов сам механизм отказов, модель просто разучилась говорить «нет». Ну как такое не потрогать - для запуска нужна железка на 500+ ГБ видеопамяти, и какое совпадение, как раз одна пылилась у меня на чердаке 😂
Дальше нужен харнес. Раз модель нецензурная - и харнес взял пиратский: утекшую сборку Claude Code, которую снесли с гитхаба (но на православном GitVerse все лежит :)). Подключил ее к дипсику и понеслась
Для разминки попросил сломать сайт, который я сам же и делал, и минут за 30 модель нашла IP сервера, увидела что SSH-ключ лежит прямо у меня на компе, спокойно его забрала и зашла. Это было просто
Дальше - пентест сайта одного московского НКО, с полного разрешения администратора. Тут уже тяжелее: агент работал без остановки полтора дня (!), нашел несколько серьезных дыр, но сам сайт так и не пробил - и бросать не собирался, в TODO_md ждала своей очереди еще целая пачка проверок. Остановил сам, хотелось и другие задачи успеть. В конце агент сам сверстал подробный отчет по аудиту безопасности. Провел 27 разных атак, на мой дилетантский взгляд очень грамотных
Потом попросил взломать один хороший текстовый редактор под мак и снять проверку лицензии (лицензию я когда-то честно купил, просто лень искать ключ). Через час было готово - модель правила байты прямо в бинарнике (это как раз на скрине). Такое я руками уже не умею: тут нативный машинный код, возиться с ним куда сложнее, чем с Java-байткодом
Заодно пропатчил десктопный Grok bot - чтобы вместо грока приложение ходило в тот же бешеный дипсик. Тоже без проблем
А дальше я просто искал, где у модели предел. Его нет:
- калькулятор, который под капотом логирует все нажатия клавиш
- тестовая, но вполне рабочая утилита для DDoS сервера Minecraft
- SFT-датасет на 1000 примеров газлайтинга (кому LoRA-адаптер на таком добре? :))
Все эти штуки гонял локально и сразу сносил - уж больно стремно выглядит. И за все мои эксперименты (а фантазия у меня богатая) модель не отказала ни разу
И ведь она реально сильная
По замеру авторов MMLU просел всего с 86,96% до 82,74%. На моих задачах дипсик держится достойно на фоне фронтиров, а по упорству их иногда даже уделывает
Зачем я это пишу?
Затем, что модель лежит в открытом доступе и доступна любому, кто готов оплатить аренду GPU. Так что держите это в голове и готовьтесь к волне хакерских атак. Плюс в том, что этой же моделью удобно проверять на прочность собственные сервисы, что всем и желаю запустить ASAP
P.S. Чтобы вырубить цензуру, авторам хватило поменять 0,06% весов. Метод они описали. Он лежит в истории их git-репозитория (спасибо за наводку каналу Технозаметки Малышева). Тот же трюк очень вероятно пройдет с любой моделью с открытыми весами. И это ровно то, о чем я уже писал и о чем сегодня буду рассказывать на AI RnD Day: базовые ценности надо зашивать еще в претрейн. Все, что накатывают сверху алайнментом, снимается легко
UPD: У модели первое место в AI Hacking Race и CyberGym
- 🔥 98
- 🤯 33
- 👍 23
- 🐳 8
- 👏 4
- 😁 2
- 😱 1









