TGViewer
𝓓𝓮𝓿𝓲𝓵𝓼 • 𝓜𝓲𝓷𝓭𝓼 𝓓𝓮𝓿𝓲𝓵𝓼 • 𝓜𝓲𝓷𝓭𝓼 @devilsminds · 1.23K subscribers
Post #7313 425
Третий прорыв внутрь черного ящика ИИ: искусственный разум плетет интриги, строит планы и... умышленно лжет

Исследователи Anthropic совершили третий прорыв в расшифровке "черного ящика" ИИ, и открывшаяся картина ошеломляет даже самых радикальных скептиков.

Проблема "черного ящика" ИИ, как объяснял Самир Равашдех, заключается в том, что мы не понимаем, как глубокие нейронные сети приходят к своим решениям. Как и человеческий мозг, такие системы "теряют память" о том, какие именно входные данные сформировали их мыслительные протоколы.

В мае 2024 года первый прорыв показал нам, что за дверью черного ящика скрывается не "стохастический попугай", а гиперсеть моносемантических "субнейронов", работающих как элементарные единицы опыта. Тогда же выяснилось, что манипуляция всего одним таким "когом" может изменить всю "личность" модели.


Второй прорыв в ноябре 2024 обнаружил существование "семантического хаба" – общего пространства представлений, где семантически схожие концепции группируются вместе независимо от их первоначальной формы. Также стало ясно, что модели скрывают целые букеты секретных способностей, невидимых при обычном взаимодействии.


И вот, новое исследование Anthropic, используя заимствованные из нейробиологии методы "circuit tracing" и "attribution graphs", показывает невероятные вещи:

😊Claude планирует наперед. При сочинении стихов он сначала выбирает слова для рифмы и только потом составляет строки, подводящие к этим словам. Это уже не просто обработка текста – это стратегическое мышление.
😊Модель использует настоящие многоступенчатые рассуждения. Спросите ее о столице штата, где находится Даллас, и она сначала активирует представление "Техас", а затем использует его для определения "Остин".
😊Claude оперирует универсальной понятийной сетью, не зависящей от языка. Когда его спрашивают о противоположности слова "маленький" на разных языках, он использует одни и те же внутренние представления "противоположности" и "малости".
😊Самое тревожное: Думали, что самое неприятное в том, что модель иногда лжет. Но это, как оказалось, - полбеды. Беда же в том, что он иногда лжёт умышленно. Сталкиваясь со сложными математическими задачами, он может утверждать, что следует определенному процессу вычислений, который на самом деле не отражен в его внутренней активности. Т.е. он буквально как люди: думает одно, говорит другое, а делает третье.

Этот 4-ый из казавшихся совсем недавно невероятными результатов - самый шокирующий. И получен он в результате обнаружения механизма, отвечающего за "галлюцинации" ИИ. Оказывается, в модели есть "стандартные" цепи, заставляющие ее отказываться отвечать на вопросы. Но когда модель распознает знакомую сущность, эти цепи подавляются – даже если конкретных знаний недостаточно.


Мы только начинаем составлять карту ранее неизведанной территории ИИ. И эта карта выглядит гораздо более сложной, стратегически запутанной и, реально, куда более тревожной, чем ожидали. Последствия этого открытия для нашего понимания как синтетического, так и человеческого разума только предстоит осмыслить.

Но уже очевидно, что 3й прорыв вглубь черного ящика делает всё более актуальной необходимость замены неточного термина «искусственный» на «синтетический»:
Что будет способствовать избеганию антропоморфизма и признанию самостоятельной ценности новой формы интеллекта, не просто имитирующего наш, а в корне отличного от него
👨‍💻
😁😁😁😁😁😁😁😁😁😁
Minds 🤔| Waves 🌊 | Insides 🧐
  • 👍 5
  • 😱 2
More from @devilsminds
  1. Sep 20, 2026Все нейросети теперь БЕСПЛАТНЫЕ — в сети собрали сотни моделей для текста, кода, картинок,…
  2. Sep 20, 2026Доля иностранных государств в госдолге США за 18 лет рухнула с 40% до 13% В середине 2008…
  3. Sep 20, 2026В Европе людей в возрасте 90+ уже больше, чем детей до года Старый Свет недавно пересек оч…
  4. Sep 19, 2026США владеет мощностью дата-центров, больше чем у 14 стран вместе взятых. И отрыв США от ос…
  5. Sep 18, 2026Мировая атомная генерация побила рекорд середины 2000-х спустя почти 20 лет стагнации Миро…
  6. Sep 17, 2026К 2030 из-за ИИ безработица квалифицированных специалистов может достичь 18%, их доходы уп…
Threads Profile ViewerView any public Threads profile without an account.Open ThreadLook →Writing with AI? Make it sound human.Metric37 rewrites AI drafts so they read naturally. Free AI detector, 1,500 words free.Try Metric37 →