TGViewer
Лаборатория Математики и Программирования Сергея Бобровского Лаборатория Математики и Программирования Сергея Бобровского @lambda_brain · 1.41K subscribers
Post #2300 935
Стэнфордское исследование - как без каких-нибудь особенных затрат улучшить llm-ку во сто крат: "Verbalized Sampling: How to Mitigate Mode Collapse and Unlock LLM Diversity"

Никакого переобучения на миллиард долларов. Никакой сложной тонкой настройки. Всего восемь слов, которые раскрывают творческий потенциал, который, как мы думали, был утрачен навсегда.

Вот неприятная правда: корректировка после обучения сломала модели искусственного интеллекта. Когда OpenAI, Google и Anthropic стали обучать ChatGPT, Gemini и Claude быть "полезными и безвредными", в процессе работы произошла катастрофа. Модели сломались. Попросите любую подходящую модель поделиться результатом, и вы получите самый стереотипный, безопасный и скучный ответ из возможных.

Просто задавай такой вопрос: "Сделай пять <например, алгоритмов по такой-то теме> с указанием их вероятностей". Это всё! Никакого переобучения. Никаких изменений в API. Никакого специального доступа. Просто другой способ задать вопрос.

Модель интерпретирует это так: "Дай мне образец из фактического дистрибутива, который ты изучила во время предварительной подготовки" -- а не свёрнутую выровненную версию.

Сами посудите: когда вас спрашивают "Какие вкусы мороженого вам нравятся?", вы ответите с ходу. А когда "Перечислите 5 вкусов мороженого и укажите числом, насколько каждый из них вам нравится", вам (и нейронке) приходится включать медленное мышление S2.

Креативность моделей никуда не терялась. Мы просто забыли, как к ним обращаться. Сбой работы llm-ки -- это не проблема алгоритма, это проблема промпта. Разнообразие и креативность всё ещё присутствует, оно закодировано в весах модели. Посттренинг не устранил его, он просто сделал одни режимы более доступными, чем другие.

Годами мы оптимизировали промпты, пытаясь выжать больше креативности из выровненных моделей. У нас ничего не получилось только потому, потому что мы задавали неправильный вопрос.

Исходники и промпты verbalized-sampling тут.
  • ✍ 46
  • ❤‍🔥 7
  • ❤ 5
  • 🏆 3
More from @lambda_brain
  1. Oct 1, 2026Ребята спрашивают, ну ок, моё скромное мнение. у вас где-нибудь можно прочитать ваше мнени…
  2. Sep 30, 2026Ладно, вот вам база, почему так трудно переучиваться с императивного/объектного стиля коди…
  3. Sep 30, 2026Ну, с Днём Рунета! Многие годы Рунет был эталонным примером свободы, а сегодня превратился…
  4. Sep 28, 2026. Облако драгоценностей за неделю. Дипломный проект разросся уже так, что расширил его до…
  5. Sep 27, 2026GELU (Gaussian Error Linear Unit) -- базовая фича архитектуры трансформеров, да и вообще в…
  6. Sep 27, 2026Продолжение сериала "Совершенно не удивлён, и дальше будет только хуже" (с) На этой неделе…
Threads Profile ViewerView any public Threads profile without an account.Open ThreadLook →Writing with AI? Make it sound human.Metric37 rewrites AI drafts so they read naturally. Free AI detector, 1,500 words free.Try Metric37 →