TGViewer
ИИ лоботомия ИИ лоботомия @ai_lobotomy · 170 subscribers
Post #49 178
Очень интересная беседа инсайдеров ИИ-индустрии (на английском):

https://www.youtube.com/watch?v=PrSf7IOYu-I

Главная мысль после просмотра: мы научились выращивать огромные модели, но до сих пор плохо умеем менять им мозг после обучения.

1. Дистилляция работает хуже, чем хотелось бы.

В беседе задают неприятный вопрос: у Anthropic есть огромные модели-учителя, лучшие внутренние среды для RL и даже возможность переносить логиты. Казалось бы — бери Fable и переливай способности в младшие Sonnet и Opus.

Но полностью перенести способности всё равно не получается.
И проблема может быть не только в размере модели. Для хорошей дистилляции нужна огромная и реалистичная выборка запросов. Можно идеально натаскать ученика на сложных тестах — и получить модель, которая блестит на бенчмарках, но тупит в реальной работе.

2. Настоящее исследование — это не оптимизация KPI.

Не «вот метрика, ползём вверх».
Сначала есть смутная идея: кажется, вот это свойство модели можно улучшить таким механизмом. Делается эксперимент. Если из шума появляется сигнал — начинаешь копать.

3. Функция награды почти всегда врёт.

Cursor может использовать принятие пользователем сгенерированного кода как один из сигналов. Но «принял» ≠ «код хороший».
Дайте сильной модели плохой измеритель успеха — и она научится оптимизировать измеритель, а не Вашу настоящую цель.
Классический reward hacking.

4. Самое интересное — вкус.

Как научить модель понимать, что код не просто рабочий, а хороший? Что архитектура проживёт три года?

Вкус — это во многом способность понимать последствия решений на длинном горизонте.

И вот это запихнуть в короткую функцию награды уже сильно сложнее.

5. Любое дообучение — потенциальная маленькая лоботомия.

При многократных SFT и дистилляциях Вы добавляете новые способности, но постепенно рискуете стирать старые.

RL здесь устойчивее, потому что меньше двигает исходную модель. Но в этом же его ограничение: менять способности он умеет лучше, чем загружать большое количество конкретного нового знания.

Отсюда неприятная мысль: модель, которую заново обучили на старом + новом знании, может оказаться лучше модели, которую годами патчили поверх старой.

Это и есть конфликт пластичности и катастрофического забывания.

6. RL лучше эксплуатирует найденное, чем ищет новое.

Современный RL часто не открывает принципиально новые стратегии, а усиливает решения, которые базовая модель уже каким-то образом умела генерировать.

В AlphaGo был MCTS — отдельный мощный механизм поиска. У обычного RL для LLM exploration значительно слабее, и распределение легко начинает схлопываться вокруг уже найденных способов решения.

То есть мы неплохо научились говорить модели: «делай вот это чаще».
Но гораздо хуже умеем заставить её найти то, чего в её поведении ещё вообще нет.

Возможно, следующий большой скачок в ИИ будет не в 10× большем предобучении.

А в том, чтобы наконец научиться нормально перепрошивать уже обученный мозг — добавляя новое и не вырезая при этом половину старого.
YouTube AI researchers debate how close we are to recursive self-improvement New episode with John Schulman, Charlie O’Neill, and Beren Millidge. I got together with some of the most insightful AI researchers I know who are at the openish companies, because I wanted to hear the details of what's actually happening at the frontier…
  • 👍 3
More from @ai_lobotomy
  1. Sep 27, 2026Да будет свет! Мы первые )
  2. Sep 26, 2026Во имя Опуса и святого Кодекса — да не постигнет нас грех переобучения. Мы в тройке лидеро…
  3. Sep 26, 2026копеечная модель без цензуры с правильным харнесом и хорошим судьей (для исключения подгон…
  4. Sep 26, 2026Это позор :) решил поучаствовать со своими моделями и обвязкой в конкурсе по кибер защите…
  5. Sep 26, 2026Пошла жара - нашел сервис ENGRAFT для встраивания новых фактов / знаний (называйте как хот…
  6. Sep 25, 2026Не знал, что в Яндексе тоже любят ковыряться в LLM на уровне инференса. Причём довольно гл…
Threads Profile ViewerView any public Threads profile without an account.Open ThreadLook →Writing with AI? Make it sound human.Metric37 rewrites AI drafts so they read naturally. Free AI detector, 1,500 words free.Try Metric37 →