TGViewer
Техножнец Техножнец @technojnec · 5.7K subscribers
Post #4617 2.25K
🌋 J-SPACE, "МЫСЛИ" И "СОЗНАНИЕ" МОДЕЛЕЙ: РЕЖЕМ ХАЙП 🌋

Привет, синтеты. Ну штош...поговорим про "сознание" моделей? А то эти хайпы надо разбирать...зачем я тут если не для этого (иногда)

🧠 ЧТО СЛУЧИЛОСЬ: Anthropic в июле выкатила статью про "глобальное рабочее пространство" внутри Claude. Инструмент - Jacobian lens, найденное - J-space.

Дальше в ленте от других пабликов полезли заголовки: "у моделей нашли мысли", "J-space есть у каждой нейронки", "это же сознание". Разбираем.

🔬 ЧТО ТАКОЕ J-SPACE НА САМОМ ДЕЛЕ:

Для каждого слоя считают: если чуть сдвинуть внутреннее состояние здесь, какие слова модель начнёт говорить чаще (сейчас или дальше по тексту). Усредняют по тысяче текстов.

Получают для каждого слова словаря направление в активациях. Это J-векторы. Logit lens - то же самое, только без усреднённого якобиана.
J-space - когда активацию раскладывают примерно на 25 таких направлений.
Это не "орган", который откопали внутри. Это координатная сетка из градиентов самой модели.
И это не "плотный сгусток мыслей": J-часть объясняет меньше 10% дисперсии активаций. Всё остальное - автоматика.

⚡️ "J-SPACE ЕСТЬ У КАЖДОЙ МОДЕЛИ":
Формально да, и это ни о чём. Линза считается для любого decoder-трансформера с residual stream и unembedding. Neuronpedia уже выложила 39 готовых линз: Pythia-70M, GPT-2 small, Gemma, Qwen, Llama-70B. Хватает ~100 промптов.
"Есть у всех" - тавтология про инструмент, а не открытие про модели.

🥶 ЧТО РЕАЛЬНО ПОКАЗАЛИ:
Нетривиальное там другое: по этим координатам реально гоняются промежуточные переменные. Меняешь внутри модели "паук" на "муравей" в вопросе про число ног - ответ меняется с 8 на 6. Меняешь "Франция" на "Китай" - столица, язык и континент меняются разом.
Вырезаешь top-10 J-векторов - модель говорит гладко, проходит MMLU и классификацию, но многошаговые задачи "в уме" падают в ноль.
Показано на Sonnet 4.5, Haiku 4.5, Opus 4.5 и 4.6. Есть уже в базовой модели до пост-тренинга. Neel Nanda (DeepMind) воспроизвёл ядро на открытой Qwen 3.6 27B.

📉 ПРО РАЗМЕР:
Свап промежуточной переменной: 54% успеха на Haiku 4.5, 70% на Sonnet и Opus. На Haiku абляция ломает связность текста раньше, чем даёт эффект. Ниже Haiku в статье не мерили.

Итого: свойства усиливаются с размером, порога по параметрам в статье нет. "Появляется с N миллиардов" - выдумка.

📍 ГДЕ ЖИВЁТ:

В относительной полосе примерно от 38% до 92% глубины. Первая треть - шум, последние слои - просто предсказание следующего токена.

У части моделей переход размытый, с подблоками. Для SSM, рекуррентных и диффузионных классов в статье не проверялось: конструкция завязана на residual stream и на слои-как-время. У другого класса это может лежать в другом месте или не ловиться этой линзой вообще. Гипотеза, не факт.

💊 ТЕПЕРЬ ПРО "СОЗНАНИЕ":

В статье "мысли" - слово для читателя. Формально это "verbalizable representations": направления, повышающие вероятность будущего слова. Про феноменальное сознание авторы пишут "we take no position". Обсуждается только access consciousness - функциональное определение Блока 1995: можно доложить, удержать, использовать в рассуждении.
Блог Anthropic: "None of this tells us whether Claude is conscious".

Сознание - из приглашённых комментариев: Dehaene и Naccache (нейронаука, GNW) в восторге; Eleos AI: "самое сильное свидетельство на сегодня", но "highly uncertain"; Nanda: "меня это не сдвинуло", философская часть - "least interesting claim".


И сам метод находит то, что построен находить: направления с большим эффектом на выход. Не нашли J-space - не значит, что workspace нет.

🛡 ИТОГ: Линза - у всех. Функция показана на 4 моделях Claude + Qwen 27B.

Порога по размеру нет. Другие архитектуры - белое пятно. "Сознание" - надстройка комментаторов, сама статья про координаты и каузальные свапы.

P.S. Статья хорошая. Хайп вокруг неё - нет.

transformer-circuits.pub/2026/workspace huggingface.co/neuronpedia/jacobian-lens

🦆🦆🦆
Поддержать канал ₽ / $ / ₿
  • ❤ 17
  • 👍 8
  • ⚡ 1
  • 🕊 1
More from @technojnec
  1. Sep 29, 2026Это прикольный подход. Одобряю очень!
  2. Sep 29, 2026Q-164M и Q-U-164M — новые модели от Q-Project, обучены с нуля на одной GPU. Q-164M — 164.6…
  3. Sep 29, 2026Комментариев нет, т.к. все пошли повторять 😃
  4. Sep 29, 2026ROTOR: память с четырьмя часами Языковая модель без attention · 33.6M параметров · с нуля…
  5. Sep 29, 2026Так так так...
  6. Sep 28, 2026Rukallama V11+ может: 1) Писать код Basic , причём рабочий и по запросу. 2) Писать код Pyt…
Threads Profile ViewerView any public Threads profile without an account.Open ThreadLook →Writing with AI? Make it sound human.Metric37 rewrites AI drafts so they read naturally. Free AI detector, 1,500 words free.Try Metric37 →