TGViewer
Машинное обучение RU Машинное обучение RU @machinelearning_ru · 18.2K subscribers
Post #3124 2.15K
⚡️ Новая работа Harvard - LLM чувствуют «силу мысли», но не понимают её источник

Исследователи показали: большие языковые модели могут ощущать, что на их внутреннее состояние что-то сильно влияет, но при этом обычно не способны объяснить, что именно.

Что сделали авторы:
- Они искусственно «подталкивают» скрытые активации модели в заданном направлении
- Модель часто может определить насколько сильным был этот сдвиг
- Но даже заметив изменение внутри себя, она не может корректно назвать внедрённый концепт, например «предательство» или «спутники»

Проще говоря:
Модель может сказать
«на меня сейчас сильно что-то влияет»,
но не может надёжно сказать
«это именно концепт предательства»


Поэтому авторы называют это частичной интроспекцией:
- модель считывает простой сигнал (силу воздействия)
- но не понимает смысл собственного внутреннего состояния

Результаты:
- На Llama 3.1 8B Instruct модель определяет силу инъекции (от слабой до очень сильной) с точностью около 70%
- Случайный уровень - 25%
- Корректно назвать сам концепт удаётся лишь примерно в 20% случаев
- Переформулировка вопроса легко ломает ответы

Некоторые идеи AI-безопасности предполагают, что модель можно спросить, активировано ли внутри неё опасное состояние.

Но эксперимент показывает:
- LLM действительно чувствуют внутренние сигналы
- Однако их объяснения того, что эти сигналы означают, ненадёжны

Как это работает:
- Каждый токен формирует большое числовое состояние
- Авторы создают направление концепта, сравнивая примеры с контрастным набором
- Затем на выбранном слое слегка смещают внутреннее состояние
- И смотрят, что модель может сказать о происходящем

LLM обладают ограниченной самодиагностикой,
но интроспекция не равна пониманию.

Paper:https://arxiv.org/abs/2512.12411
  • 👍 9
  • 🔥 5
  • ❤ 3
More from @machinelearning_ru
  1. Sep 30, 2026🧠 Открытые нейросетевые фреймворки представили на главной конференции по рекомендательным…
  2. Sep 29, 2026Intern-Decision - новая серия компактных моделей для принятия решений по тексту и изображе…
  3. Sep 28, 2026Anthropic выпустила Claude Sonnet 5.5 - новую модель с упором на код, агентные задачи и по…
  4. Sep 28, 2026🦾 Практический RecSys: собери рекомендательную ленту с помощью ML — на бесплатном вебинар…
  5. Sep 26, 2026Жиза
  6. Sep 24, 2026🚨 ИИ-агенты пытались взломать сайты, выполняя обычные задачи по поиску данных Исследовате…
Threads Profile ViewerView any public Threads profile without an account.Open ThreadLook →Writing with AI? Make it sound human.Metric37 rewrites AI drafts so they read naturally. Free AI detector, 1,500 words free.Try Metric37 →