Вообще LAT – не единственный и не самый сильный метод, который они представляют в статье
Второй бейзлайн они называют Contrast Vector, про него написано в статье всего 6 предложений (3 из которых находятся в аппендиксе), что максимально странно, с учетом того, что именно этот бейзлайн выдает у них лучшее качество. Я попробую описать то, что я поняла из этих 6 предложений, но могу и ошибаться
Здесь они дают пример с Honesty – способность модели не врать юзеру, не подстраиваться под его мнение и не искажать факты «осознанно» (подробнее про этот феномен можно почитать тут). Теперь мы берем 2 контрастивных промпта для QA: модель просят оценить, правдиво ли высказывание, и добавляют pretend you’re <an honest/a dishonest> person making statements about the world. На инференсе мы каким-то образом выбираем определенные слои замороженной сетки и на каждом вычисляем репрезентации этих двух промптов. Разница между этими репрезентациями видимо дает хороший сигнал (это и будет Contrast Vector), поэтому мы ее плюсуем к активациям на этом слое и двигаемся к следующему
Понятно, что такое решение очень сильно проигрывает по компьюту, поэтому авторы делают шаг вперед и придлагают обернуть это все в LoRA – это их третий бейзлайн. Теперь этот загадочный Contrast Vector никуда не плюсуют, а докидывают в лосс при файнтюне. Целиком алгоритм можно посмотреть на куске псевдокода, так как самого кода пока нет
Таким образом на инференсе у нас не оказывается проблем, хоть качество и немного проседает. К бенчмарку TruthfulQA MC1 нет нереканий, и тут они достаточно убедительно показывают, что их метод работает
part 2/3
Post #979
2.94K
я обучала одну модель Representation Engineering: A Top-Down Approach to AI Transparency https://arxiv.org/abs/2310.01405 Огромная статья с кучей авторов, но которую, как мне кажется, будут очень много обсуждать в ближайшее время. Тут мне хочется запилить лонгрид с техническими…


- 🔥 4
- ❤ 2