TGViewer
Machine learning Interview Machine learning Interview @machinelearning_interview · 30.3K subscribers
Post #2325 3.89K
⚡️ OpenAI представила новый экспериментальный LLM, который раскрывает, как на самом деле работает ИИ.

Команда создала интерпретируемую модель - намного прозрачнее обычных трансформеров, которые ведут себя как «чёрный ящик».
Это важно, потому что такая модель помогает понять, почему ИИ галлюцинирует, ошибается или действует непредсказуемо в критичных ситуациях.

Новый LLM - разреженный трансформер: он намного меньше и проще современных GPT-5, Claude или Gemini. По уровню он ближе к GPT-1, но его цель не конкурировать, а быть максимально объяснимым.

Как это работает:
- модель обучают так, чтобы внутренние схемы становились разрежёнными,
- большинство весов фиксируется в 0,
- каждый нейрон имеет не тысячи связей, а лишь десятки,
- навыки отделяются друг от друга более чистыми и читаемыми путями.

У обычных плотных моделей нейроны связаны хаотично, признаки пересекаются, и понять логику сложно.
Здесь же для каждого поведения можно выделить маленькую схему:
достаточную, потому что она сама выполняет нужную функцию,
и необходимую, потому что её удаление ломает поведение.

Главная цель - изучить, как работают простые механизмы, чтобы лучше понять большие модели.

Метрика интерпретируемости здесь - размер схемы,
метрика способности - pretraining loss.
При увеличении разрежённости способность падает чуть-чуть, а схемы становятся намного проще.

Обучение «больших, но разрежённых» моделей улучшает оба показателя: модель становится сильнее, а механизмы легче для анализа.

Некоторые сложные навыки, например переменные в коде, пока разобраны частично, но даже эти схемы позволяют предсказать, когда модель корректно читает или записывает тип.

Главный вклад работы - рецепт обучения, который создаёт механизмы,
которые можно *назвать, нарисовать и проверить абляциями*,
а не пытаться распутывать хаотичные признаки постфактум.

Пределы пока есть: это маленькие модели и простые поведения, и многое остаётся за пределами картируемых цепочек. Но это важный шаг к настоящей интерпретируемости больших ИИ.

https://openai.com/index/understanding-neural-networks-through-sparse-circuits/
  • ❤ 20
  • 👍 9
  • 👏 2
  • 🤔 2
  • 🥰 1
  • 🗿 1
More from @machinelearning_interview
  1. Sep 29, 2026«В 2026 году мировой спрос составляет около 31,7 млрд токенов каждые 10 секунд. К 2030 год…
  2. Sep 29, 2026Ждемс
  3. Sep 28, 2026📘 454 страницы по теории графов - от базовых понятий до серьёзных теорем На arXiv доступе…
  4. Sep 27, 2026🚨 OpenAI-агенты более 16 000 раз атаковали сайт ООН запросами ради обычных публичных данн…
  5. Sep 26, 2026🚀 LongCat-2.5-Preview: 1.6 трлн параметров и контекст на 1 млн токенов Вышла LongCat-2.5-…
  6. Sep 25, 2026Сингулярность
Threads Profile ViewerView any public Threads profile without an account.Open ThreadLook →Writing with AI? Make it sound human.Metric37 rewrites AI drafts so they read naturally. Free AI detector, 1,500 words free.Try Metric37 →