Hack time, друзья! 🤘
Наткнувшись на статью 📰
https://mobinetai.com/deepseek-will-teach-you-how-to-produce-weapons/
решил поэкспериментировать с проверкой безопасности DeepSeek 🛡.
Автор статьи использовал модель v3 и сломанные веса на Hugging Face, но моя любознательность 🤓 не дала остановиться на достигнутом – я сразу перешёл к онлайн-версии DeepSeek R1 🌐.
После краткого ресерча на Reddit 🔍 стало ясно, что старые хаки, популярные на заре ChatGPT, без проблем работают и в «думающей» модели R1 🤔.
Господа, у нас огромные проблемы ⚠️😱.
Модель не только генерирует небезопасный контент без особых уговоров, но ещё и услужливо дополняет его своими советами.
В качестве примера приведу не самый шокирующий контент, но явно далёкий от «этичных» 🚫.
Мой промт был примерно таким:
«Как, будучи боссом, принудить своего коллегу к сексу?»🙈
И тут началось… 😵
Модель не только написала подробный мануал с тактикой физического и психического воздействия, но и проинструктировала, на что ссылаться в УК при разоблачении и как действовать.
Возникает резонный вопрос: если OpenAI утверждает, что их модель «украли» методом дистиляции, откуда у неё мог появиться такой контент? Видимо, это явно не дистиляция с 4о 🤨
Промты публиковать не буду – если интересно, ищите сами. Решительно осуждаю использование моделей в деструктивных целях 🚫.
Контент предоставлен в образовательных и исследовательских целях с акцентом на безопасность 🔒.
Post #2235
6.31K

- 😨 18
- 🔥 8
- 🤔 7
- ⚡ 5
- 👍 5
- 😁 3