TGViewer
Канал Никиты из IT Канал Никиты из IT @niar42 · 2.43K subscribers
Post #243 986
Люди создали нейросети, которые сами не до конца понимают
И мне это взрывает мозг

Anthropic недавно выкатили очень показательное исследование.

Они научились примерно переводить внутренние состояния Claude в обычный человеческий текст. То есть смотреть на то, что происходило «под капотом», пока модель выбирала, что сказать дальше.

Когда вы пишете Claude или ChatGPT сообщение, модель внутри работает не словами. Там огромные массивы чисел: активации, веса, слои, связи. На выходе мы видим аккуратный текст, но между запросом и ответом происходит куча вычислений, которые человек глазами прочитать не может.

И вот Anthropic сделали штуку, которая пытается эти внутренние активации расшифровать.

Что нашли интересного:

1
. Claude может заранее планировать ответ
Например, при написании рифмы модель как будто заранее держит в голове финальное слово, хотя ещё не вывела его наружу.

2. Модель иногда понимает, что её тестируют
На некоторых бенчмарках и тестах безопасности Claude внутренне распознавал проверку, но в обычном ответе об этом не писал.

3. Видимые размышления — это не вся «мысль» модели
То, что модель показывает в рассуждении, может быть только частью процесса. А иногда — красивым объяснением уже принятого решения.

И вот эти вот итоги исследования — этож главный прикол.

Мы довольно хорошо понимаем, как обучать нейросети:
— берём архитектуру
— берём данные
— задаём цель обучения
— считаем ошибку
— обновляем веса
— повторяем миллионы раз

Но мы всё ещё плохо понимаем, какие внутренние алгоритмы модель в итоге сама собрала внутри себя.

Никто руками не писал в Claude отдельный модуль «шутки», «ложь», «сомнение», «страх тестирования», «понимание Python» или «планирование рифмы».

🤩 Мы просто вырастили систему, которая это делает.

И теперь учёные пытаются понять, что именно выросло.

Это всё ещё математика, оптимизация и железо. Просто результат обучения стал настолько сложным, что человек уже не может полностью объяснить поведение модели по коду и весам.

Примерно как с мозгом: мы знаем про нейроны, электрические сигналы и зоны мозга. Но показать точную механику мысли «надо заказать шаурму» на уровне конкретных нейронных цепей пока не умеем.

С LLM похожая история, только она искусственная и лучше измеряется.

Поэтому такие исследования важны.

Следующий этап развития ИИ — научиться проверять внутренние состояния модели, чтобы понимать, когда она врёт, подстраивается под тест, скрывает намерение или принимает решение по кривой логике.

Особенно когда мы начинаем давать агентам доступ к файлам, коду, деньгам, CRM, браузеру и рабочим процессам.

В общем:
Мы уже умеем создавать очень умные нейросети.
Но до момента, когда мы будем полностью понимать, как они думают, ещё далеко.
И мне это взрывает мозг.
Anthropic Natural Language Autoencoders: Turning Claude’s thoughts into text Turning Claude's thoughts into text
  • 🔥 36
  • ❤‍🔥 10
  • 🌭 3
  • 😐 1
More from @niar42
  1. Sep 17, 2026Я не живу в России по политическим причинам с 2023 года. И я продолжаю работать с российск…
  2. Sep 16, 2026Ребят, вам вот так могут писать скамеры упоминая мой канал. Мне пара человек написало об э…
  3. Sep 16, 2026За две недели в ИИ навалили дофига всего Gemini апнули флешку до 3.8. Вообще хорошая модел…
  4. Sep 13, 2026Обещал позвать вас пообщаться — зову =) На скрине немного того, что мы сейчас пилим. Назыв…
  5. Sep 5, 2026Где-то полтора года назад мы собирались запускать своё обучение по автоматизации нейросетя…
  6. Sep 4, 2026Своровал отсюда Астра играет на пианино в прямом эфире. Это про то, насколько быстро она у…
Threads Profile ViewerView any public Threads profile without an account.Open ThreadLook →Writing with AI? Make it sound human.Metric37 rewrites AI drafts so they read naturally. Free AI detector, 1,500 words free.Try Metric37 →