یه نفر تونسته سانسور Qwen رو تقریبا برداره، توی AI یه تکنیکی داریم به اسم Abliteration که یعنی با دستکاری وزنهای مدل، جهتهایی که باعث میشن مدل بعضی درخواستها رو رد کنه یا اصطلاحاً refusal داشته باشه، تا حد زیادی حذف بشن. یعنی بهجای اینکه فقط با System Prompt به مدل بگی «رد نکن»، خود مدل رو تغییر میدن.
حالا مدل Qwen3.5-9B-abliterated دقیقاً با همین روش ساخته شده؛ یه نسخه دستکاریشده از Qwen3.5-9B که هدفش اینه رفتارهای refusal رو تا حد زیادی کم کنه. سازنده با تحلیل activationهای مدل، جهت مرتبط با refusal رو پیدا کرده و بعد با Abliteration اون جهت رو از وزنهای مدل حذف کرده.
بعد از این مرحله هم روی مدل QLoRA fine-tuning انجام شده تا مواردی که هنوز باعث refusal میشدن کمتر بشن. نتیجه یه مدل 9B هستش که برای استفادههای local جالبه، مخصوصاً اگه دنبال مدلی هستید که محدودیتهای رفتاری کمتری نسبت به نسخه اصلی داشته باشه:
huggingface.co/lukey03/Qwen3.5-9B-abliterated
@Linuxor
Post #5464
6.44K
