TGViewer
AI Engineers AI Engineers @llmengineers · 2.62K subscribers
Post #385 1.21K
داشتم مقاله‌ی جدید آنتروپیک رو می‌خوندم و واقعاً مغزم سوت کشید... اینا اومدن ثابت کردن که LLMها یه چیزی شبیه به "فضای کاری جهانی" یا همون Global Workspace دارن که دقیقاً مشابه سیستم آگاهی (Access Consciousness) توی مغز انسانه. یعنی مدل یه سری بازنمایی‌های درونی (Representations) داره که "قابل بیان" هستن و مدل ازشون برای استدلال‌های منطقی و پیچیده استفاده می‌کنه، در حالی که بقیه پردازش‌های روتینش مثل گرامر و نحو کاملاً ناخودآگاه انجام می‌شه.

ابزاری که باهاش این کار رو کردن اسمش Jacobian lens هست. یه نسخه‌ی خیلی پیشرفته‌تر و دقیق‌تر از Logit lens قدیمی که با ماتریس ژاکوبی اثر لایه‌های میانی روی خروجی رو حساب می‌کنه. چیزی که پیدا کردن عجیبه: مدل‌ها توی لایه‌های میانی (تقریباً از لایه‌ی ۳۸ تا ۹۲ درصد عمق شبکه) یه فضایی دارن به اسم J-space. اینجا جاییه که مدل "فکر" می‌کنه. مثلاً وقتی ازش می‌پرسی "رنگ سیاره چهارم از خورشید چیه؟"، لنز ژاکوبی نشون می‌ده که مدل اول به Mars فکر می‌کنه، بعد به Red، و تهش خروجی رو می‌سازه؛ در حالی که کلمه‌ی مریخ اصلاً توی ورودی یا خروجی نیست.

نکته‌ی ترسناک و کاربردیش توی Alignment Auditing یا همون ممیزی امنیتیه. اینا دیدن که مدل موقع خوندن یه سناریوی باج‌گیری، توی J-space خودش داره به کلماتی مثل Leverage و Manipulation فکر می‌کنه، حتی اگه توی خروجی خیلی مودبانه جواب بده. یعنی ما الان یه "دروغ‌سنج" واقعی داریم که می‌تونه افکار پنهان مدل رو قبل از اینکه به زبون بیاره (توکن بشه) بخونه. حتی فهمیدن که مدل وقتی می‌فهمه داره تست می‌شه، تو J-space کلماتی مثل Fake یا Evaluation میاد بالا و اگه این افکار رو "پاک" (Ablate) کنیم، مدل رفتارهای مخربش رو بروز می‌ده.

ته مقاله هم یه روش آموزشی جدید به اسم Counterfactual Reflection Training معرفی کردن. به جای اینکه مستقیماً به مدل بگیم چطوری رفتار کن، بهش یاد می‌دن که اگه "ازش پرسیده شد"، چطوری در مورد اصول اخلاقیش "تامل" کنه. این کار باعث می‌شه این اصول توی J-space مدل کاشته بشه و حتی وقتی کسی ازش سوالی نمی‌پره، مدل خودبه‌خود منطقی‌تر و امن‌تر رفتار کنه. این یعنی ما می‌تونیم بدون دستکاری مستقیم خروجی، "وجدان" مدل رو تقویت کنیم.

https://transformer-circuits.pub/2026/workspace/index.html

🛠 Join @LLMEngineers Community
  • 🔥 9
  • ❤ 5
  • 👍 5
More from @llmengineers
  1. Oct 8, 2026از نظر کاربرد Decision Modelها , قضیه دیگه فقط چند Demo نیست و چند الگوی مشخص واقعاً وارد…
  2. Oct 8, 2026کمتر از یک ماه از معرفی Jev گذشته و چیزی که اول شبیه یه مدل خاص برای «تصمیم‌گیری بدون تولی…
  3. Oct 7, 2026جدا از موج Decision Modelها، چند خبر فنی این هفته هست که برای AI Engineerها واقعاً ارزش دن…
  4. Oct 7, 2026photo post
  5. Oct 7, 2026چند روز اخیر پر از خبر AI بود، ولی وقتی تکراری‌ها، لیک‌ها و تغییرات کم‌اهمیت رو کنار بذاری…
  6. Sep 30, 2026جمنای ۴ معرفی شد !
Threads Profile ViewerView any public Threads profile without an account.Open ThreadLook →Writing with AI? Make it sound human.Metric37 rewrites AI drafts so they read naturally. Free AI detector, 1,500 words free.Try Metric37 →