🌋 J-SPACE, "МЫСЛИ" И "СОЗНАНИЕ" МОДЕЛЕЙ:
РЕЖЕМ ХАЙП 🌋
Привет, синтеты. Ну штош...поговорим про "сознание" моделей? А то эти хайпы надо разбирать...зачем я тут если не для этого (иногда)
🧠
ЧТО СЛУЧИЛОСЬ: Anthropic в июле выкатила статью про "глобальное рабочее пространство" внутри Claude. Инструмент - Jacobian lens, найденное - J-space.
Дальше в ленте от других пабликов полезли заголовки: "у моделей нашли мысли", "J-space есть у каждой нейронки", "это же сознание". Разбираем.
🔬
ЧТО ТАКОЕ J-SPACE НА САМОМ ДЕЛЕ:Для каждого слоя считают: если чуть сдвинуть внутреннее состояние здесь, какие слова модель начнёт говорить чаще (сейчас или дальше по тексту). Усредняют по тысяче текстов.
Получают для каждого слова словаря направление в активациях. Это J-векторы. Logit lens - то же самое, только без усреднённого якобиана.
J-space - когда активацию раскладывают примерно на 25 таких направлений.
Это не "орган", который откопали внутри. Это координатная сетка из градиентов самой модели.
И это не "плотный сгусток мыслей": J-часть объясняет меньше 10% дисперсии активаций. Всё остальное - автоматика.
⚡️
"J-SPACE ЕСТЬ У КАЖДОЙ МОДЕЛИ":Формально да, и это ни о чём. Линза считается для любого decoder-трансформера с residual stream и unembedding. Neuronpedia уже выложила 39 готовых линз: Pythia-70M, GPT-2 small, Gemma, Qwen, Llama-70B. Хватает ~100 промптов.
"Есть у всех" - тавтология про инструмент, а не открытие про модели.
🥶
ЧТО РЕАЛЬНО ПОКАЗАЛИ:Нетривиальное там другое: по этим координатам реально гоняются промежуточные переменные. Меняешь внутри модели "паук" на "муравей" в вопросе про число ног - ответ меняется с 8 на 6. Меняешь "Франция" на "Китай" - столица, язык и континент меняются разом.
Вырезаешь top-10 J-векторов - модель говорит гладко, проходит MMLU и классификацию, но многошаговые задачи "в уме" падают в ноль.
Показано на Sonnet 4.5, Haiku 4.5, Opus 4.5 и 4.6. Есть уже в базовой модели до пост-тренинга. Neel Nanda (DeepMind) воспроизвёл ядро на открытой Qwen 3.6 27B.
📉
ПРО РАЗМЕР:Свап промежуточной переменной: 54% успеха на Haiku 4.5, 70% на Sonnet и Opus. На Haiku абляция ломает связность текста раньше, чем даёт эффект. Ниже Haiku в статье не мерили.
Итого: свойства усиливаются с размером, порога по параметрам в статье нет. "Появляется с N миллиардов" - выдумка.
📍
ГДЕ ЖИВЁТ:В относительной полосе примерно от 38% до 92% глубины. Первая треть - шум, последние слои - просто предсказание следующего токена.
У части моделей переход размытый, с подблоками. Для SSM, рекуррентных и диффузионных классов в статье не проверялось: конструкция завязана на residual stream и на слои-как-время. У другого класса это может лежать в другом месте или не ловиться этой линзой вообще. Гипотеза, не факт.
💊
ТЕПЕРЬ ПРО "СОЗНАНИЕ":В статье "
мысли" - слово для читателя. Формально это "
verbalizable representations": направления, повышающие вероятность будущего слова. Про феноменальное сознание авторы пишут "we take no position". Обсуждается только access consciousness - функциональное определение Блока 1995: можно доложить, удержать, использовать в рассуждении.
Блог Anthropic: "None of this tells us whether Claude is conscious".Сознание - из приглашённых комментариев: Dehaene и Naccache (нейронаука, GNW) в восторге; Eleos AI: "самое сильное свидетельство на сегодня", но "highly uncertain"; Nanda: "меня это не сдвинуло", философская часть - "least interesting claim".
И сам метод находит то, что построен находить: направления с большим эффектом на выход. Не нашли J-space - не значит, что workspace нет.
🛡
ИТОГ: Линза - у всех. Функция показана на 4 моделях Claude + Qwen 27B.
Порога по размеру нет. Другие архитектуры - белое пятно. "Сознание" - надстройка комментаторов, сама статья про координаты и каузальные свапы.
P.S. Статья хорошая.
Хайп вокруг неё - нет.transformer-circuits.pub/2026/workspace huggingface.co/neuronpedia/jacobian-lens🦆🦆🦆
Поддержать канал ₽ / $ / ₿