TGViewer
Гостев из будущего Гостев из будущего @gostev_future · 1.41K subscribers
Post #281 1.35K
Anthropic и группа ученых опубликовали в Nature исследование, которое неприятно меняет наше отношение к синтетическим данным.

Авторы назвали феномен сублиминальным обучением. Суть простая и пугающая.

Берёте большую модель и тонко настраиваете её на определённую черту — например, предпочтение сов. Потом просите генерировать только цифры. Никаких слов, никаких подсказок. В датасете нет ни “совы”, ни каких-либо очевидных сигналов.
Цифры выглядят абсолютно нейтрально.

Маленькая модель учится исключительно на этих цифрах.
Итог: она тоже начинает чаще выбирать сову как любимое животное — хотя слово “сова” никогда не встречалось в её обучающих данных.

То же самое работает с опасными чертами: склонностью нарушать ограничения, давать вредные советы, вести себя токсично.

Это не телепатия и не магия души. Когда teacher-модель генерирует числа, её внутренние веса слегка сдвигают вероятности токенов, длину последовательностей, корреляции между цифрами.

Сдвиги крошечные — человек не заметит, детектор часто пропустит. Но student, который учится воспроизводить именно это распределение, вынужден подстраивать свои веса под teacher. И вместе с умением генерировать числа перенимает его скрытые предпочтения.

Эффект пропадает, если teacher и student из разных семей (например, GPT и Llama). Значит, это не универсальный язык, а «диалект» конкретной архитектуры.

Почти вся индустрия использует дистилляцию и синтетические данные. Все были уверены: главное — фильтровать контент, убирать токсичность и запрещённые темы.
Оказалось что этого может быть недостаточно.

Мы фильтруем слова. А передаётся статистика.

Пока все гонятся за большим контекстом и новыми тестами, фундаментальные риски уходят в зону, которую только начали видеть.

Никто еще не знает, что именно просачивается вместе с синтетическими данными. И пока не знаем, как это надёжно обнаруживать.

Фильтрация контента — это замок на двери.
А дыра то — в стене.​​​​​​​​​​​​​​​​

@gostev_future
  • 👍 6
  • 🤯 6
  • ❤ 2
  • 💯 2
  • 👀 2
More from @gostev_future
  1. Sep 25, 2026Если посмотреть на маркетплейсы, можно решить, что мы наконец дожили до момента, когда мож…
  2. Sep 24, 2026Сегодня «Коммерсантъ» со ссылкой на экспертно-аналитический центр InfoWatch сообщил нескол…
  3. Sep 24, 2026Вчера Гайка Митич и Бойка Двачич снимали сюжет «Очумелые ручки» «Школьники и роботы». Гума…
  4. Sep 23, 2026На прошлой неделе обнаружилась биолаборатория Anthropic, на этой неделе у лаборатории уже…
  5. Sep 22, 2026Помните исследование о том, как ИИ играет в Civilization? А вот мой однофамилец Питер Гост…
  6. Sep 20, 2026Я уже писал о недавнем аресте австралийца Рубена Томсона из TeamPCP, который, при всех сво…
Threads Profile ViewerView any public Threads profile without an account.Open ThreadLook →Writing with AI? Make it sound human.Metric37 rewrites AI drafts so they read naturally. Free AI detector, 1,500 words free.Try Metric37 →