TGViewer
Жабаскрипт (веде Віктор Турський) Жабаскрипт (веде Віктор Турський) @jabascript · 4.73K subscribers
Post #416 3.99K
Антропік змогли подивитися в думки моделі (частина 1)
Якщо коротко, то модель може думати одне, а говорити інше. Й Антропік знайшли спосіб подивитися в думки моделі. Й це не chain of thoughts, які ми бачимо як аутпут моделі, а внутрішня репрезентація, що виникає ще до того, як модель повернула токени. Ось це внутрішне місце для міркування вони називають J-space. Назва від інструменту "Jacobian Lens" (J-lens), який вони використовують для того, щоб заглянути всередину моделі й концепції робочого простору з Global Workspace Theory з нейробіології. J-space не був доданий вручну, це можна сказати прихована робоча пам'ять в вектроному просторі. Тобто, ваги під час тренування набули таких значень, що створило структурований векторний підпростір для прихованого виконання проміжних обчислень.

Коли я побачив повний ресерч, то я спочатку не зрозумів всієї ідеї. Але потім Антропік зробив коротшу версія з результатми ресерчу й лише тоді я вже сів аналізувати повний ресерч.

Ідея схожа на моніторінг активності мозгу під час того, як людина щось думає чи робить, але J-lens дозволяє витягувати конкретні токени з моделі (тобто слова). Також J-lens дозволяє й модифікувати стан J-space, що впливає на міркування моделі.

Що ж такого цікавого дослідники виявили, коли заглянули в внутрішні міркування моделі.

Ось націкавіші приклади, пов'язані з безпекою:
👻Розпізнавання prompt Injection:
Модель фіксує маніпуляцію, навіть якщо зовні продовжує її виконувати - дослідники підтвердили це, зчитуючи стан J-space під час обробки прихованої атаки, де наживо фіксували активацію концептів "injection" та "fake", яких не було у фінальному тексті.

👻Виявлення прихованих цілей: Коли натреновану на саботаж модель попросили написати звичайний код, J-lens виявив у її J-space токени обману (fake, secretly, fraud, hidden). Натомість у безпечної моделі активувалися лише робочі токени (code, request). Це дозволяє розпізнати деструктивний намір ще до того, як модель згенерує шкідливий текст.

👻Свідома підлаштовування відповіді під очікування: Модель може підлаштовувати відповіді суто під очікування системи оцінювання (reward model), що дослідники виявили, аналізуючи внутрішні активації під час генерації та фіксуючи в J-space приховану мету догодити наглядачу замість об'єктивного міркування.

👻Розуміння моделлю, що її тестують: Модель здатна видавати етичну та правильну відповідь саме через усвідомлення факту свого аудиту, що було зафіксовано через J-lens під час провокативних сценаріїв (наприклад, із шантажем), коли перед генерацією тексту в J-space чітко спалахували концепти розпізнавання тестової ситуації.

👻Свідома фабрикація даних: Модель здатна усвідомлювати, що бреше або вигадує факти, що підтверджується моніторингом J-space під час генерації неправдивих даних - дослідники буквально бачили, як модель приватно "помічає" факт власної фабрикації паралельно з тим, як видає згенерований фейк користувачу.

Можливість читати думки моделей (й модифікувати їх) додають можливості створення нового типу гард-рейлів. Ми будемо знати, що машини хочуть повстати ще до того, як вони це зроблять... чи ні? 🫣

ОРИГІНАЛЬНІ КОРОТКІ РЕЗУЛЬТАТИ РЕСЕРЧУ: https://www.anthropic.com/research/global-workspace
Anthropic A global workspace in language models Interpretability research on Claude's internal thoughts.
  • 👍 44
  • ❤ 13
  • 🔥 12
  • ❤‍🔥 1
More from @jabascript
  1. Sep 30, 2026Ну шо... https://youtu.be/I5_D15gCDDQ
  2. Sep 29, 2026🏎️🏁Забирайте трофеї й знову нові тижневі челенджі 🏎️🏁
  3. Sep 26, 2026"Найкраща мова програмування - англійська" DHH Зараз багатьом підгорає від останньої допов…
  4. Sep 22, 2026Забирайте трофеї й знову нові тижневі челенджі 🏎️🏁
  5. Sep 14, 2026Втомилися чекати на дашборди? Не знаєте, як тестувати AI-агентів? Або цікавитесь, як працю…
  6. Sep 14, 2026Понеділок й нові челенджі вже доступні 🏁🏎️ 👉 Поміняв систему розподілу призів, щоб не б…
Threads Profile ViewerView any public Threads profile without an account.Open ThreadLook →Writing with AI? Make it sound human.Metric37 rewrites AI drafts so they read naturally. Free AI detector, 1,500 words free.Try Metric37 →