🔥 Новый подход к обучению маленьких чат-моделей у больших «чёрных ящиков»
Появилась интересная работа: как научить маленькую модель вести себя почти как большая закрытая модель — имея доступ только к её ответам, без весов и без градиентов.
То есть студент просто «спрашивает API», получает текст — и на этом всё.
Это и называется black box distillation.
Но у классического подхода есть проблема:
он просто заставляет студента копировать текст, а не поведение.
Поверхностная имитация вместо глубокой.
Авторы решили эту проблему другим способом.
🏆 Ключевая идея
Не просто копировать ответы учителя, а обучать дискриминатор, который умеет отличать ответы учителя от ответов студента.
Этот дискриминатор превращается в модель-оценщик и выдаёт награду за каждый ответ.
Дальше запускается RL, который двигает студента в сторону ответов, больше похожих на учителя.
📈 Что важно
- студент и дискриминатор обучаются на текущих ответах студента
- это «on-policy», в отличие от старых методов, где reward-модель обучалась на фиксированном датасете
- благодаря этому обучение стабильнее и нет reward hacking
- после короткого warmup студент начинает учиться как генератор
- качество на тестах растёт как по внутренним, так и по внешним задачам
- у студентов Qwen и Llama заметно сокращается разрыв с большим учителем
💡 Результат:
Модель 14B выдаёт чат-качество, почти достигшее уровня учителя, но стоит намного дешевле в работе.
Это один из самых чистых и эффективных методов «дистилляции поведения», а не поверхностного текста.
Полная работа: arxiv.org/abs/2511.10643
Post #1267
1.76K

- ❤ 7