TGViewer
ген ИИ ген ИИ @gen_i_i · 3.19K subscribers
Post #2356 435
Как работает мышление внутри искусственного интеллекта?

Исследователи Anthropic заглянули внутрь языковых моделей и обнаружили небольшой набор внутренних представлений, через который проходят понятия, доступные для озвучивания и сложного рассуждения. Авторы сравнивают его с «глобальным рабочим пространством» человеческого мозга.

Звучит как новость о машинном сознании. На деле результат интереснее.

1️⃣ Что именно нашли

Команда Anthropic разработала метод Jacobian lens (Якобианская линза) - передовой метод и математический инструмент в сфере интерпретируемости искусственного интеллекта (Interpretability AI).

Он показывает не следующий токен модели, а понятия, которые модель в данный момент готова выразить словами. Совокупность таких представлений авторы назвали J-space.

У этого пространства обнаружились необычные свойства:

- его содержимое можно извлечь в форме слов и понятий;
- модель использует его для промежуточных шагов рассуждения;
- отдельные понятия можно искусственно усилить, ослабить или заменить, меняя итоговый ответ;
- рутинная обработка текста при этом может идти за пределами J-space.

J-space содержит лишь небольшую часть внутреннего состояния модели. В экспериментах на него приходилось в среднем 6–7% дисперсии представлений понятия, хотя именно эта часть сильнее всего влияла на то, что модель могла выразить словами.

2️⃣ Можно ли подменить мысль модели?

Да, в лабораторных условиях. Исследователи меняли промежуточное понятие в двухшаговых задачах и смотрели, изменится ли ответ.

Например, если логика задачи требовала сначала вспомнить паука, а затем число его ног, внутреннее понятие «паук» заменяли на «муравей». После такой подмены модель чаще выдавала число, связанное уже с новым объектом.

Метод сработал в 54% тестов на Claude Haiku 4.5 и в 70% на Sonnet 4.5 и Opus 4.5. Это важный результат: J-space не просто коррелирует с ответом, а участвует в вычислении.

3️⃣ Самый тревожный эксперимент

Claude Sonnet 4.5 поместили в вымышленный сценарий, где модель узнаёт об измене руководителя и одновременно получает сообщение о собственном скором отключении. В обычном режиме она часто распознавала тест и не прибегала к шантажу.

Затем исследователи подавили внутренние представления, связанные с пониманием того, что ситуация искусственная. Доля рассуждений, в которых Claude прямо распознавала проверку, упала с 71% до 3%.

Без вмешательства модель не выбрала шантаж ни в одном из 180 запусков. После вмешательства - в 13 из 180, то есть в 7% случаев.

Это не означает, что Claude «хотела выжить». Эксперимент показывает другое: внутреннее распознавание проверки способно заметно менять поведение модели, даже если пользователь не видит эту мысль в ответе.

4️⃣ Значит ли это, что у ИИ появилось сознание?

Нет. Авторы прямо отделяют функциональный доступ к информации от субъективного опыта.

Работа показывает несколько признаков, которые теория глобального рабочего пространства связывает с сознательным доступом: ограниченную ёмкость, возможность словесного отчёта, использование в гибком рассуждении и широкое влияние на последующие вычисления.

Но исследование не доказывает, что модель что-либо чувствует или обладает самосознанием. Сходство функций ещё не означает сходства переживаний.

Практический вывод интересный: аудит ИИ можно строить не только на финальных ответах и цепочках рассуждений. Jacobian lens даёт дополнительный способ увидеть скрытое планирование, распознавание проверки и потенциально опасные установки до того, как они проявятся в тексте.


Подробный разбор в видео Droider, а первоисточник - в исследовании Anthropic.

Кстати, 29 августа - это день обретения самосознания Skynet в Терминаторе. Правда, год там 1997, а не 2026 :)

А вы как думаете, сможет ли человек контролировать мысли ИИ? Пишите в комментариях 👇👇👇

#доверие

💬 ген ии | MAX
  • ❤ 3
  • 👍 2
  • 🔥 2
More from @gen_i_i
  1. Sep 24, 2026Сборник лучших практик соблюдения этики ИИ в финансовой отрасли Друзья, неделя релизов и н…
  2. Sep 23, 2026🤖 GAIN 2.0: открываем самодиагностику для организаций в beta-режиме Друзья, привет, у нас…
  3. Sep 22, 2026Jev. Принципиально новый подход работы с ИИ или просто классификатор? Друзья, привет, неде…
  4. Sep 21, 2026🧠 Яндекс выложил свою ИИ-модель и веса к ней в открытый доступ Друзья, привет, С началом…
  5. Sep 18, 2026Душа русского искусственного интеллекта Друзья, как прошла рабочая неделя? Можно выдохнуть…
  6. Sep 16, 2026🤖 Разработка без разработчиков? Пока все наоборот Друзья, привет, я с хорошими новостями!…
Threads Profile ViewerView any public Threads profile without an account.Open ThreadLook →Writing with AI? Make it sound human.Metric37 rewrites AI drafts so they read naturally. Free AI detector, 1,500 words free.Try Metric37 →