TGViewer
AI Security Lab AI Security Lab @aisecuritylab · 2.22K subscribers
Post #257 659
Наш исследователь — контрибьютор SAE Lens 🎉

PR Егора Емельянова, исследователя нашей лаборатории, приняли в SAE Lens — одну из основных библиотек для обучения и анализа sparse autoencoder'ов.

Sparse autoencoder'ы раскладывают внутренние активации нейросети на более простые и разреженные признаки — это один из ключевых инструментов механистической интерпретируемости. С их помощью исследователи пытаются понять, какие концепции модель представляет внутри. SAE Lens упрощает обучение таких автоэнкодеров и работу с ними.

Как пишет Егор: «В своём исследовании я хотел воспроизвести подход к обучению SAE из Gemma Scope 2, чтобы сравнивать свои результаты с их моделями. Обучал через SAE Lens — и обнаружил, что нужной функции потерь в библиотеке нет.

Я реализовал её самостоятельно, а потом подумал, что она пригодится и другим, и отправил pull request.»

Егор сделал дополнительный вариант штрафа за разреженность для JumpReLU SAE — Quadratic L0 из Gemma Scope 2.

Его ключевое отличие: исследователь заранее задаёт целевой L0 — желаемое среднее число активных признаков, и модель в процессе обучения стремится к этому значению.

Это даёт более прямой контроль над разреженностью и упрощает сравнение разных SAE.
Идея и формула уже существовали в Gemma Scope 2 — задача Егора была корректно перенести подход в SAE Lens, встроить его в существующую архитектуру, добавить валидацию и тесты.

🤝PR: https://github.com/decoderesearch/SAELens/pull/732

Поздравляем Егора — контрибьюты в открытые инструменты интерпретируемости так и работают: нашёл задачу в своём исследовании и закрыл её для всех 🦾
GitHub feat: add quadratic sparcity loss from GemmaScope 2 for JumpReluSAE by Estomeee · Pull Request #732 · decoderesearch/SAELens Description During the research, I needed to reproduce the learning process of JumpReluSAE from GemmaScope2. Their implementation uses some modifications of the loss function, which, as far as I ca...
  • ❤‍🔥 7
  • 🔥 4
  • ❤ 3
More from @aisecuritylab
  1. Sep 18, 2026Post #260
  2. Sep 14, 2026Открытый вебинар про интерепретируемость агентов совместно со Stepik. Завтра (вторник, 18:…
  3. Sep 11, 2026Post #258
  4. Sep 7, 2026🍂 Записи докладов наших студенток, выступавших на международной конференции AINL 2026 Про…
  5. Sep 4, 2026Post #255
  6. Sep 3, 2026Post #254
Threads Profile ViewerView any public Threads profile without an account.Open ThreadLook →Writing with AI? Make it sound human.Metric37 rewrites AI drafts so they read naturally. Free AI detector, 1,500 words free.Try Metric37 →