⚡️ Очень интересная работа которая показывает, что большие модели можно значительно улучшить в задачах рассуждения, обновляя… почти ноль параметров.
Метод называется TinyLoRA и отвечает на вопрос:
*насколько сильно нужно менять большую модель, чтобы она начала лучше думать?*
Ответ: почти никак.
Главный результат
Модель Qwen2.5-7B-Instruct после RL:
- Базовый результат GSM8K: ~76%
- 91% pass@1, обучая всего 13 параметров (это ~26 байт!)
- 95% при обновлении всего 120 параметров
Ранее считалось, что для улучшения reasoning нужны:
- полный fine-tuning (миллиарды весов)
или
- LoRA-адаптеры (миллионы параметров)
TinyLoRA уменьшает LoRA до предела.
Как это работает
- Используется SVD слоёв модели (замороженные направления)
- Вместо матрицы LoRA обучается крошечный вектор
- Один и тот же вектор может использоваться сразу в нескольких слоях
- В итоге — от сотен параметров до буквально единиц
Почему это работает
Ключ - Reinforcement Learning с проверяемой наградой:
- RL усиливает только признаки, связанные с результатом
- «Шум» от неважных изменений взаимно компенсируется
- В отличие от supervised fine-tuning, который должен подгонять каждый токен
Дополнительные результаты
На сложных математических бенчмарках:
- 196 параметров TinyLoRA → почти уровень полного fine-tuning
- Средний результат: 53.2 vs 55.2 (TinyLoRA vs full finetune)
Важный вывод
Чем больше модель, тем меньше параметров нужно обновлять.
Адаптация reasoning - это не добавление новых знаний, а тонкая настройка уже существующих «цепей» мышления.
Ограничения
Метод показан в основном на математических задачах.
Не факт, что он так же хорошо работает для:
- креативных задач
- текстов
- научного письма
Почему это важно
RL с проверяемой наградой становится ультра-экономичным каналом управления моделью:
- минимальные обновления
- удобно для multi-tenant систем
- снижает стоимость распределённого обучения
- открывает путь к сверхдешёвому post-training
- https://arxiv.org/abs/2602.04118
Post #2546
5.29K

- 👍 22
- ❤ 9
- 🥰 5