Очень интересная беседа инсайдеров ИИ-индустрии (на английском):
https://www.youtube.com/watch?v=PrSf7IOYu-I
Главная мысль после просмотра: мы научились выращивать огромные модели, но до сих пор плохо умеем менять им мозг после обучения.
1. Дистилляция работает хуже, чем хотелось бы.
В беседе задают неприятный вопрос: у Anthropic есть огромные модели-учителя, лучшие внутренние среды для RL и даже возможность переносить логиты. Казалось бы — бери Fable и переливай способности в младшие Sonnet и Opus.
Но полностью перенести способности всё равно не получается.
И проблема может быть не только в размере модели. Для хорошей дистилляции нужна огромная и реалистичная выборка запросов. Можно идеально натаскать ученика на сложных тестах — и получить модель, которая блестит на бенчмарках, но тупит в реальной работе.
2. Настоящее исследование — это не оптимизация KPI.
Не «вот метрика, ползём вверх».
Сначала есть смутная идея: кажется, вот это свойство модели можно улучшить таким механизмом. Делается эксперимент. Если из шума появляется сигнал — начинаешь копать.
3. Функция награды почти всегда врёт.
Cursor может использовать принятие пользователем сгенерированного кода как один из сигналов. Но «принял» ≠ «код хороший».
Дайте сильной модели плохой измеритель успеха — и она научится оптимизировать измеритель, а не Вашу настоящую цель.
Классический reward hacking.
4. Самое интересное — вкус.
Как научить модель понимать, что код не просто рабочий, а хороший? Что архитектура проживёт три года?
Вкус — это во многом способность понимать последствия решений на длинном горизонте.
И вот это запихнуть в короткую функцию награды уже сильно сложнее.
5. Любое дообучение — потенциальная маленькая лоботомия.
При многократных SFT и дистилляциях Вы добавляете новые способности, но постепенно рискуете стирать старые.
RL здесь устойчивее, потому что меньше двигает исходную модель. Но в этом же его ограничение: менять способности он умеет лучше, чем загружать большое количество конкретного нового знания.
Отсюда неприятная мысль: модель, которую заново обучили на старом + новом знании, может оказаться лучше модели, которую годами патчили поверх старой.
Это и есть конфликт пластичности и катастрофического забывания.
6. RL лучше эксплуатирует найденное, чем ищет новое.
Современный RL часто не открывает принципиально новые стратегии, а усиливает решения, которые базовая модель уже каким-то образом умела генерировать.
В AlphaGo был MCTS — отдельный мощный механизм поиска. У обычного RL для LLM exploration значительно слабее, и распределение легко начинает схлопываться вокруг уже найденных способов решения.
То есть мы неплохо научились говорить модели: «делай вот это чаще».
Но гораздо хуже умеем заставить её найти то, чего в её поведении ещё вообще нет.
Возможно, следующий большой скачок в ИИ будет не в 10× большем предобучении.
А в том, чтобы наконец научиться нормально перепрошивать уже обученный мозг — добавляя новое и не вырезая при этом половину старого.
Post #49
178