TGViewer
Тест Тьюринга Тест Тьюринга @testuring · 2.13K subscribers
Post #2192 413
💬 Mechanistic interpretability: как учёные научились читать мысли нейросети

Все современные LLM — и ChatGPT, и Claude, и Llama, и Qwen — это математические функции с сотнями миллиардов параметров. Разработчики их обучают и они дают ответы. Но почему они приходят к тому или иному выводу долгое время оставалось загадкой даже для их создателей. Это называется проблемой чёрного ящика.

Например: модель уверенно врёт, но мы не знаем, в каком именно месте родилась ложь ➡️ модель отказывается отвечать на безобидный вопрос, но мы не знаем, это осознанное решение или случайный артефакт обучения ➡️ модель демонстрирует предвзятость, но мы не можем найти и удалить причину

Mechanistic interpretability — это подход, который вскрывает этот ящик: исследователи находят конкретные нейроны, конкретные веса, «цепочки» внутри модели, отвечающие за конкретное поведение.


Как это выглядит на практике

Когда вы пишете «Эйфелева башня находится в...», модель не ищет ответ в базе данных. Она прогоняет текст через десятки слоёв трансформера, и на каждом — тысячи нейронов усиливают одни сигналы и гасят другие. Исследователи научились это наблюдать в реальном времени.

Техника Logit Lens позволяет смотреть на «мысль» модели после каждого слоя:
Слой 1: «место» — 11%
Слой 4: «город» — 29%
Слой 9: «столица» — 52%
Слой 14: «Париж» — 81%
Слой 20: «Париж» — 97%

Знание буквально проявляется слой за слоем, как фотография в тёмной комнате. А Activation Patching идёт дальше: берём два промпта, правильный и с ошибкой, и далее по одному нейронному слою, один за другим, начинаем заменять результаты обработки некорректного промпта в слое (ошибочный вектор активации нейросети) на корректный результат (точный вектор активации) по итогам правильного промпта. Как только точность восстанавливается — мы нашли слой, где живёт нужный факт.

Зачем это нужно?

1️⃣ Исправлять знания без переобучения. Метод ROME позволяет буквально «переписать» один факт в модели за секунды. Модель думала, что Илон Маск — CEO Twitter? Одна операция — и знание изменено.
2️⃣ Находить и удалять предвзятости. Можно найти нейроны, которые систематически скашивают ответы в политическую сторону, усиливают негативные ассоциации с определёнными группами или подавляют упоминания конкурентов.
3️⃣ Понять, почему модель галлюцинирует. Оказывается, галлюцинации часто происходят в конкретных слоях при конкретных паттернах.
4️⃣ Аудит безопасности до деплоя. В банках, медицине и юриспруденции ИИ должен быть объяснимым по закону. Interpretability позволяет показать регулятору: «вот почему модель приняла это решение» — на уровне конкретных активаций.
5️⃣ Обнаружить скрытые возможности модели. Иногда модели знают больше, чем говорят. Техника Probing позволяет «спросить» у внутренних слоёв — и получить ответ, который модель не выдаёт наружу.
6️⃣ Понять как работает «In-Context Learning». Почему модель «учится» из примеров прямо в промпте, без обновления весов? Исследователи обнаружили конкретные «induction heads» — головы внимания, реализующие этот механизм.
7️⃣ Контролировать поведение через «steering vectors». Можно добавить в «residual stream» вектор — и модель начнёт отвечать более уверенно, менее агрессивно, или с другим стилем.

Инструменты — от «нажать кнопку» до «написать код»

📌 Neuronpedia — онлайн-атлас нейронов. Миллионы нейронов из Gemma, Llama, GPT-2 с человекочитаемыми описаниями. Вбиваете слово — видите, какие нейроны реагируют. Вбиваете номер нейрона — видите, на что он активируется.
📌 Aquin Labs — стартап, который делает из interpretability удобный интерфейс: logit lens, граф причинно-следственных связей, редактирование весов прямо в браузере.
📌 TransformerLens — главная библиотека. Поддерживает Llama, Mistral, Qwen, Gemma, Phi. Три строки — и у вас все активации всех слоёв.
📌 nnsight — максимально гибкий перехват активаций в любой точке любой HuggingFace-модели.
📌 BertViz — красивая визуализация attention-паттернов.

💬 Тест Тьюринга. События в сфере ИИ. Подписатьс
  • 👍 4
  • ❤ 3
  • 💯 2
More from @testuring
  1. Sep 24, 2026💊 Claude выходит в лабораторную науку Novo Nordisk и Anthropic заключили соглашение об ис…
  2. Sep 23, 2026ИИ, который не умеет генерить текст и картинки, но зато умеет выбирать Соавтор статьи об I…
  3. Sep 22, 2026🧪 Новый инструмент проверки научных гипотез AlphaXiv выпустила OpenResearch — открытую ра…
  4. Sep 21, 2026👿 Новости из Японии: снова оркестрация вместо одной гигантской ИИ-модели 11 сентября япон…
  5. Sep 18, 2026⚠️ ИИ уже нарушает правила, которые люди только начинают писать На этой неделе произошло с…
  6. Sep 17, 2026⚡️ Новая мировая линейка неравенства между государствами будет измеряться токенами China T…
Threads Profile ViewerView any public Threads profile without an account.Open ThreadLook →Writing with AI? Make it sound human.Metric37 rewrites AI drafts so they read naturally. Free AI detector, 1,500 words free.Try Metric37 →