TGViewer
Data Science | Machinelearning [ru] Data Science | Machinelearning [ru] @devsp · 19.8K subscribers
Post #5318 3K
Что стоит за новой идеей интерпретируемости моделей 🤔

Представьте, что у вас есть мощный ИИ, который помогает принимать важнейшие решения в медицине, науке или образовании. Казалось бы, технологии шагнули далеко вперёд. Но есть одна большая проблема: мы до сих пор не понимаем, как именно эти модели приходят к своим выводам. Что-то типа «чёрного ящика» — мы видим результат, но не понимаем, как он получился. И вот тут на сцену выходит OpenAI с довольно интересным предложением.

Многие из нас, вероятно, слышали о методах интерпретации моделей, например, через Chain of Thought (CoT). Но вот беда: эти методы довольно хрупкие и ненадёжные. Почему? Да потому что мы пытаемся понять модель уже после того, как она обучена, а когда перед нами миллиард параметров, распутывать всё это — задача не из лёгких.

OpenAI, в свою очередь, утверждают, что такой подход изначально ошибочен. Дело в том, что сами по себе модели — это очень плотные сети, где каждый параметр в итоге влияет на итоговый результат. И пытаться разобраться в том, как и почему модель приняла то или иное решение, когда эти параметры так переплетены, уже невозможно.

Что предлагают исследователи? 🔨

Вместо того чтобы пытаться анализировать такую сложную сеть постфактум, они предлагают обучать модели с самого начала так, чтобы они были «разреженными». Это как если бы вы решили не наполнять шкаф до отказа, а оставить пространство между полками — тогда вам будет проще найти нужную вещь. В контексте ИИ это значит, что сеть будет иметь гораздо меньше связей между нейронами. Берётся архитектура, похожая на GPT-2, и сильно ограничиваются веса, оставляя только несколько важных связей между слоями.

Таким образом, модель становится «чистее» и её поведение проще для анализа. Например, вместо того, чтобы пытаться понять, как модель принимает решение на уровне всех миллиардов параметров, можно сосредоточиться только на той маленькой части сети, которая на самом деле решает задачу. Этот маленький набор весов, который OpenAI называют «circuit», будет достаточно, чтобы решить задачу, но без лишнего шума и излишней сложности.

В статье приводится простой пример задачи с кавычками. Модели нужно просто запомнить тип открывающейся кавычки и закрыть её такой же в конце. И вот что интересно: оказывается, что для решения такой задачи модель использует всего 5 каналов, 2 слоя MLP и 1 канал внимания. Это не только интересно, но и даёт представление о том, как можно анализировать поведение сети даже для гораздо более сложных задач.


Проблема, конечно, в том, что такой подход работает пока только на маленьких и простых моделях. Разреженность, хотя и упрощает анализ, в реальных масштабах может быть дорогой и неэффективной. Однако если OpenAI удастся извлечь «разреженные» схемы из уже обученных моделей с плотной сетью, это может стать настоящим прорывом в интерпретируемости ИИ.

Data Science
  • ❤ 5
  • 🔥 4
  • 👍 1
More from @devsp
  1. Sep 30, 2026Две ИИ-фабрики в Армении: что там отгрохали и на кого это в итоге пашет В августе в Раздан…
  2. Sep 30, 2026Из Москвы в Миннеаполис — с тремя решениями для улучшения персонализации в рекомендательны…
  3. Sep 30, 2026Про Ember-1 сейчас гудят на Hacker News. Исследователи дообучили Kimi K3 так, что рассужда…
  4. Sep 30, 2026Локальный ассистент для зумов, часть 8: модель, из-за которой я перекроил диаризацию за од…
  5. Sep 29, 2026Путь к ИИ-сингулярности В багажнике у нас: пара репо с вайб-кодом, который ни один тест не…
  6. Sep 29, 2026Как нейросеть переводит видео. Часть 2: русский длиннее не текстом, а звуком Автор в одино…
Threads Profile ViewerView any public Threads profile without an account.Open ThreadLook →Writing with AI? Make it sound human.Metric37 rewrites AI drafts so they read naturally. Free AI detector, 1,500 words free.Try Metric37 →