TGViewer
я обучала одну модель я обучала одну модель @def_model_train · 4.48K subscribers
Post #979 2.94K
я обучала одну модель Representation Engineering: A Top-Down Approach to AI Transparency https://arxiv.org/abs/2310.01405 Огромная статья с кучей авторов, но которую, как мне кажется, будут очень много обсуждать в ближайшее время. Тут мне хочется запилить лонгрид с техническими…
Вообще LAT – не единственный и не самый сильный метод, который они представляют в статье

Второй бейзлайн они называют Contrast Vector, про него написано в статье всего 6 предложений (3 из которых находятся в аппендиксе), что максимально странно, с учетом того, что именно этот бейзлайн выдает у них лучшее качество. Я попробую описать то, что я поняла из этих 6 предложений, но могу и ошибаться

Здесь они дают пример с Honesty – способность модели не врать юзеру, не подстраиваться под его мнение и не искажать факты «осознанно» (подробнее про этот феномен можно почитать тут). Теперь мы берем 2 контрастивных промпта для QA: модель просят оценить, правдиво ли высказывание, и добавляют pretend you’re <an honest/a dishonest> person making statements about the world. На инференсе мы каким-то образом выбираем определенные слои замороженной сетки и на каждом вычисляем репрезентации этих двух промптов. Разница между этими репрезентациями видимо дает хороший сигнал (это и будет Contrast Vector), поэтому мы ее плюсуем к активациям на этом слое и двигаемся к следующему

Понятно, что такое решение очень сильно проигрывает по компьюту, поэтому авторы делают шаг вперед и придлагают обернуть это все в LoRA – это их третий бейзлайн. Теперь этот загадочный Contrast Vector никуда не плюсуют, а докидывают в лосс при файнтюне. Целиком алгоритм можно посмотреть на куске псевдокода, так как самого кода пока нет

Таким образом на инференсе у нас не оказывается проблем, хоть качество и немного проседает. К бенчмарку TruthfulQA MC1 нет нереканий, и тут они достаточно убедительно показывают, что их метод работает

part 2/3
  • 🔥 4
  • ❤ 2
More from @def_model_train
  1. Mar 28, 2026Моя любимая текущая конспирологическая теория из твиттера: claude mythos настолько силен в…
  2. Mar 12, 2026За неделю вышло несколько интересных новостей на стыке ML и нейробиологии: я про экспериме…
  3. Mar 8, 2026Другая поразившая меня часть этой хроники – это очень необычное понимание того, что такое…
  4. Mar 8, 2026Если вы еще не устали за неделю читать про противостояние Антропика и DoD, то я могу вам п…
  5. Mar 2, 2026Юдковский наконец-то победил в своей борьбе, и искусственный интеллект решил сам разбомбит…
  6. Nov 27, 2025Я в целом согласна с оценкой, что Суцкевер в своем интервью выдал примерно 3 бита информац…
Threads Profile ViewerView any public Threads profile without an account.Open ThreadLook →Writing with AI? Make it sound human.Metric37 rewrites AI drafts so they read naturally. Free AI detector, 1,500 words free.Try Metric37 →