Тут на днях стартап Goodfire выпустил Silico — первый готовый инструмент для mechanistic interpretability. С его помощью можно немного залезть в голову к нейронкам и раздать своих правил в процессе обучения.
Пока инструмент работает только с опенсорсными моделями, так что внутрь ChatGPT всё ещё не попасть 😭
Как это работает:
Например, многие модели считают, что 9.11 больше 9.9. Причина тому Библия, на нумерацию стихов которой ориентируется ИИ, а Silico позволяет такие моменты скорректировать.
MIT Technology Review уже включил mechanistic interpretability в список 10 самых прорывных технологий 2026 года — больше никаких тайн 😱