Все современные LLM — и ChatGPT, и Claude, и Llama, и Qwen — это математические функции с сотнями миллиардов параметров. Разработчики их обучают и они дают ответы. Но почему они приходят к тому или иному выводу долгое время оставалось загадкой даже для их создателей. Это называется проблемой чёрного ящика.
Например: модель уверенно врёт, но мы не знаем, в каком именно месте родилась ложь ➡️ модель отказывается отвечать на безобидный вопрос, но мы не знаем, это осознанное решение или случайный артефакт обучения ➡️ модель демонстрирует предвзятость, но мы не можем найти и удалить причину
Mechanistic interpretability — это подход, который вскрывает этот ящик: исследователи находят конкретные нейроны, конкретные веса, «цепочки» внутри модели, отвечающие за конкретное поведение.
Как это выглядит на практике
Когда вы пишете «Эйфелева башня находится в...», модель не ищет ответ в базе данных. Она прогоняет текст через десятки слоёв трансформера, и на каждом — тысячи нейронов усиливают одни сигналы и гасят другие. Исследователи научились это наблюдать в реальном времени.
Техника Logit Lens позволяет смотреть на «мысль» модели после каждого слоя:
Слой 1: «место» — 11%
Слой 4: «город» — 29%
Слой 9: «столица» — 52%
Слой 14: «Париж» — 81%
Слой 20: «Париж» — 97%
Знание буквально проявляется слой за слоем, как фотография в тёмной комнате. А Activation Patching идёт дальше: берём два промпта, правильный и с ошибкой, и далее по одному нейронному слою, один за другим, начинаем заменять результаты обработки некорректного промпта в слое (ошибочный вектор активации нейросети) на корректный результат (точный вектор активации) по итогам правильного промпта. Как только точность восстанавливается — мы нашли слой, где живёт нужный факт.
Зачем это нужно?
1️⃣ Исправлять знания без переобучения. Метод ROME позволяет буквально «переписать» один факт в модели за секунды. Модель думала, что Илон Маск — CEO Twitter? Одна операция — и знание изменено.
2️⃣ Находить и удалять предвзятости. Можно найти нейроны, которые систематически скашивают ответы в политическую сторону, усиливают негативные ассоциации с определёнными группами или подавляют упоминания конкурентов.
3️⃣ Понять, почему модель галлюцинирует. Оказывается, галлюцинации часто происходят в конкретных слоях при конкретных паттернах.
4️⃣ Аудит безопасности до деплоя. В банках, медицине и юриспруденции ИИ должен быть объяснимым по закону. Interpretability позволяет показать регулятору: «вот почему модель приняла это решение» — на уровне конкретных активаций.
5️⃣ Обнаружить скрытые возможности модели. Иногда модели знают больше, чем говорят. Техника Probing позволяет «спросить» у внутренних слоёв — и получить ответ, который модель не выдаёт наружу.
6️⃣ Понять как работает «In-Context Learning». Почему модель «учится» из примеров прямо в промпте, без обновления весов? Исследователи обнаружили конкретные «induction heads» — головы внимания, реализующие этот механизм.
7️⃣ Контролировать поведение через «steering vectors». Можно добавить в «residual stream» вектор — и модель начнёт отвечать более уверенно, менее агрессивно, или с другим стилем.
Инструменты — от «нажать кнопку» до «написать код»
📌 Neuronpedia — онлайн-атлас нейронов. Миллионы нейронов из Gemma, Llama, GPT-2 с человекочитаемыми описаниями. Вбиваете слово — видите, какие нейроны реагируют. Вбиваете номер нейрона — видите, на что он активируется.
📌 Aquin Labs — стартап, который делает из interpretability удобный интерфейс: logit lens, граф причинно-следственных связей, редактирование весов прямо в браузере.
📌 TransformerLens — главная библиотека. Поддерживает Llama, Mistral, Qwen, Gemma, Phi. Три строки — и у вас все активации всех слоёв.
📌 nnsight — максимально гибкий перехват активаций в любой точке любой HuggingFace-модели.
📌 BertViz — красивая визуализация attention-паттернов.
💬 Тест Тьюринга. События в сфере ИИ. Подписатьс
