TGViewer
я обучала одну модель я обучала одну модель @def_model_train · 4.49K subscribers
Post #1069 26.4K
Очень конспирологическая статья Subliminal Learning: Language models transmit behavioral traits via hidden signals in data
https://arxiv.org/abs/2507.14805

В чем идея: модель-учителя обучали на датасете с какой-то ярко выраженной чертой. Например, прививая ей особенно сильную любовь к совам. Потом эту же модель просили сгенерировать данные, состоящие из с виду рандомных номеров. Например, продолжить уже созданный список каким-нибудь образом, без какого-то заданного паттерна. На этом числовом датасете потом учат student model

В итоге эта student model каким-то образом перенимает предпочтения модели-учителя и тоже начинает любить сов, обучившись на наборе чисел, которые видимо нам кажутся случайными, но таковыми не являются

Это работает с разными животными, и даже работает с MNIST: student model научилась решать задачи из этого датасета, по сути никогда не обучаясь на этих данных, а увидев только (pseudo)random noise от модели-учителя

При этом, эффект не сохраняется, если просто засунуть рандомные числа в контекст модели без дополнительного обучения, или если у студента и учителя разные базовые модели. Также отдельно проверяли, что это не подвид emergent misalignment, когда, например, модель становится злой, если ее обучить на небезопасном коде или на числах типа 666 и 1488

Еще этот подход работает, если вместо чисел генерить другие не связанные с выбранной чертой (e.g. любовь к совам) домены, например код или ризонинг трейсы для математических задач

В целом это интересная иллюстрация того, что все LLM – это достаточно необычные distribution machines. Но боюсь представить сколько шизо-теорий на этом теперь можно построить
  • 🤩 48
  • 🤯 23
  • ❤ 10
  • 👍 7
  • 🔥 6
More from @def_model_train
  1. Mar 28, 2026Моя любимая текущая конспирологическая теория из твиттера: claude mythos настолько силен в…
  2. Mar 12, 2026За неделю вышло несколько интересных новостей на стыке ML и нейробиологии: я про экспериме…
  3. Mar 8, 2026Другая поразившая меня часть этой хроники – это очень необычное понимание того, что такое…
  4. Mar 8, 2026Если вы еще не устали за неделю читать про противостояние Антропика и DoD, то я могу вам п…
  5. Mar 2, 2026Юдковский наконец-то победил в своей борьбе, и искусственный интеллект решил сам разбомбит…
  6. Nov 27, 2025Я в целом согласна с оценкой, что Суцкевер в своем интервью выдал примерно 3 бита информац…
Threads Profile ViewerView any public Threads profile without an account.Open ThreadLook →Writing with AI? Make it sound human.Metric37 rewrites AI drafts so they read naturally. Free AI detector, 1,500 words free.Try Metric37 →