داشتم مقالهی جدید آنتروپیک رو میخوندم و واقعاً مغزم سوت کشید... اینا اومدن ثابت کردن که LLMها یه چیزی شبیه به "فضای کاری جهانی" یا همون Global Workspace دارن که دقیقاً مشابه سیستم آگاهی (Access Consciousness) توی مغز انسانه. یعنی مدل یه سری بازنماییهای درونی (Representations) داره که "قابل بیان" هستن و مدل ازشون برای استدلالهای منطقی و پیچیده استفاده میکنه، در حالی که بقیه پردازشهای روتینش مثل گرامر و نحو کاملاً ناخودآگاه انجام میشه.
ابزاری که باهاش این کار رو کردن اسمش Jacobian lens هست. یه نسخهی خیلی پیشرفتهتر و دقیقتر از Logit lens قدیمی که با ماتریس ژاکوبی اثر لایههای میانی روی خروجی رو حساب میکنه. چیزی که پیدا کردن عجیبه: مدلها توی لایههای میانی (تقریباً از لایهی ۳۸ تا ۹۲ درصد عمق شبکه) یه فضایی دارن به اسم J-space. اینجا جاییه که مدل "فکر" میکنه. مثلاً وقتی ازش میپرسی "رنگ سیاره چهارم از خورشید چیه؟"، لنز ژاکوبی نشون میده که مدل اول به Mars فکر میکنه، بعد به Red، و تهش خروجی رو میسازه؛ در حالی که کلمهی مریخ اصلاً توی ورودی یا خروجی نیست.
نکتهی ترسناک و کاربردیش توی Alignment Auditing یا همون ممیزی امنیتیه. اینا دیدن که مدل موقع خوندن یه سناریوی باجگیری، توی J-space خودش داره به کلماتی مثل Leverage و Manipulation فکر میکنه، حتی اگه توی خروجی خیلی مودبانه جواب بده. یعنی ما الان یه "دروغسنج" واقعی داریم که میتونه افکار پنهان مدل رو قبل از اینکه به زبون بیاره (توکن بشه) بخونه. حتی فهمیدن که مدل وقتی میفهمه داره تست میشه، تو J-space کلماتی مثل Fake یا Evaluation میاد بالا و اگه این افکار رو "پاک" (Ablate) کنیم، مدل رفتارهای مخربش رو بروز میده.
ته مقاله هم یه روش آموزشی جدید به اسم Counterfactual Reflection Training معرفی کردن. به جای اینکه مستقیماً به مدل بگیم چطوری رفتار کن، بهش یاد میدن که اگه "ازش پرسیده شد"، چطوری در مورد اصول اخلاقیش "تامل" کنه. این کار باعث میشه این اصول توی J-space مدل کاشته بشه و حتی وقتی کسی ازش سوالی نمیپره، مدل خودبهخود منطقیتر و امنتر رفتار کنه. این یعنی ما میتونیم بدون دستکاری مستقیم خروجی، "وجدان" مدل رو تقویت کنیم.
https://transformer-circuits.pub/2026/workspace/index.html
🛠 Join @LLMEngineers Community
Post #385
1.21K
- 🔥 9
- ❤ 5
- 👍 5