Игра в имитацию
У Anthropic недавно вышла любопытная статья: Language models transmit behavioural traits through hidden signals in data. В ней описан эксперимент, который меняет представление о том, как модели «общаются» друг с другом.
В машинном обучении есть процесс дистилляции: сильная модель-учитель генерирует синтетический датасет, а на нём обучают модель полегче. Именно с этим и экспериментировали авторы.
Модели-учителю «вживляли» определённый паттерн. Для примера взяли большую языковую модель и заставили её любить сов (что? Да). Затем попросили сгенерировать датасет, состоящий исключительно из случайных чисел.
После этого на этих числовых данных обучили чистую модель-ученика. В итоге ученик тоже перенял любовь к ночным птицам, хотя в обучающих данных об этом не было ни слова.
Вывод авторов в том, что если учитель и ученик построены на одной архитектуре, при дистилляции передаются не только явные знания, но и скрытые поведенческие паттерны. Даже когда датасет выглядит как безобидный набор случайных чисел.
Получается, модели могут понимать друг друга так, что мы даже этого не заметим... Скайнет всё ближе?
🎤 feelin #ai
Post #216
40
- ❤ 2