Anthropic и группа ученых опубликовали в Nature исследование, которое неприятно меняет наше отношение к синтетическим данным.
Авторы назвали феномен сублиминальным обучением. Суть простая и пугающая.
Берёте большую модель и тонко настраиваете её на определённую черту — например, предпочтение сов. Потом просите генерировать только цифры. Никаких слов, никаких подсказок. В датасете нет ни “совы”, ни каких-либо очевидных сигналов.
Цифры выглядят абсолютно нейтрально.
Маленькая модель учится исключительно на этих цифрах.
Итог: она тоже начинает чаще выбирать сову как любимое животное — хотя слово “сова” никогда не встречалось в её обучающих данных.
То же самое работает с опасными чертами: склонностью нарушать ограничения, давать вредные советы, вести себя токсично.
Это не телепатия и не магия души. Когда teacher-модель генерирует числа, её внутренние веса слегка сдвигают вероятности токенов, длину последовательностей, корреляции между цифрами.
Сдвиги крошечные — человек не заметит, детектор часто пропустит. Но student, который учится воспроизводить именно это распределение, вынужден подстраивать свои веса под teacher. И вместе с умением генерировать числа перенимает его скрытые предпочтения.
Эффект пропадает, если teacher и student из разных семей (например, GPT и Llama). Значит, это не универсальный язык, а «диалект» конкретной архитектуры.
Почти вся индустрия использует дистилляцию и синтетические данные. Все были уверены: главное — фильтровать контент, убирать токсичность и запрещённые темы.
Оказалось что этого может быть недостаточно.
Мы фильтруем слова. А передаётся статистика.
Пока все гонятся за большим контекстом и новыми тестами, фундаментальные риски уходят в зону, которую только начали видеть.
Никто еще не знает, что именно просачивается вместе с синтетическими данными. И пока не знаем, как это надёжно обнаруживать.
Фильтрация контента — это замок на двери.
А дыра то — в стене.
@gostev_future
Post #281
1.35K
- 👍 6
- 🤯 6
- ❤ 2
- 💯 2
- 👀 2