TGViewer
Machine learning Interview Machine learning Interview @machinelearning_interview · 30.3K subscribers
Post #2546 5.29K
⚡️ Очень интересная работа которая показывает, что большие модели можно значительно улучшить в задачах рассуждения, обновляя… почти ноль параметров.

Метод называется TinyLoRA и отвечает на вопрос:
*насколько сильно нужно менять большую модель, чтобы она начала лучше думать?*

Ответ: почти никак.

Главный результат

Модель Qwen2.5-7B-Instruct после RL:
- Базовый результат GSM8K: ~76%
- 91% pass@1, обучая всего 13 параметров (это ~26 байт!)
- 95% при обновлении всего 120 параметров

Ранее считалось, что для улучшения reasoning нужны:
- полный fine-tuning (миллиарды весов)
или
- LoRA-адаптеры (миллионы параметров)

TinyLoRA уменьшает LoRA до предела.

Как это работает

- Используется SVD слоёв модели (замороженные направления)
- Вместо матрицы LoRA обучается крошечный вектор
- Один и тот же вектор может использоваться сразу в нескольких слоях
- В итоге — от сотен параметров до буквально единиц

Почему это работает

Ключ - Reinforcement Learning с проверяемой наградой:
- RL усиливает только признаки, связанные с результатом
- «Шум» от неважных изменений взаимно компенсируется
- В отличие от supervised fine-tuning, который должен подгонять каждый токен

Дополнительные результаты

На сложных математических бенчмарках:
- 196 параметров TinyLoRA → почти уровень полного fine-tuning
- Средний результат: 53.2 vs 55.2 (TinyLoRA vs full finetune)

Важный вывод

Чем больше модель, тем меньше параметров нужно обновлять.
Адаптация reasoning - это не добавление новых знаний, а тонкая настройка уже существующих «цепей» мышления.

Ограничения

Метод показан в основном на математических задачах.
Не факт, что он так же хорошо работает для:
- креативных задач
- текстов
- научного письма

Почему это важно

RL с проверяемой наградой становится ультра-экономичным каналом управления моделью:
- минимальные обновления
- удобно для multi-tenant систем
- снижает стоимость распределённого обучения
- открывает путь к сверхдешёвому post-training

- https://arxiv.org/abs/2602.04118
  • 👍 22
  • ❤ 9
  • 🥰 5
More from @machinelearning_interview
  1. Sep 26, 2026🚀 LongCat-2.5-Preview: 1.6 трлн параметров и контекст на 1 млн токенов Вышла LongCat-2.5-…
  2. Sep 25, 2026Сингулярность
  3. Sep 25, 2026📋 Китай впервые обошёл США по числу ведущих ИИ-исследователей По данным нового исследован…
  4. Sep 25, 2026Пользователь смотрит видео, листает клипы, ставит лайки — каждое действие становится сигна…
  5. Sep 25, 2026🛡️ Microsoft открыла skill для автоматического поиска рисков в AI-агентах Новый run-asser…
  6. Sep 25, 2026✔️ OpenAI выпустила открытый бенчмарк для оценки ИИ в психологии Набор Mental Health Bench…
Threads Profile ViewerView any public Threads profile without an account.Open ThreadLook →Writing with AI? Make it sound human.Metric37 rewrites AI drafts so they read naturally. Free AI detector, 1,500 words free.Try Metric37 →