TGViewer
RationalAnswer | Павел Комаровский RationalAnswer | Павел Комаровский @rationalanswer · 108K subscribers
Post #1738 16.2K
Обучение в формате «хайвмайнда»

У Дваркеша Пателя в недавнем выпуске подкаста с AI-исследователями обсуждалась интересная идея.

Смотрите, мы с вами много раз обсуждали, что у текущих LLM есть одно из важных отличий от, к примеру, человеческого разума. Люди умеют учиться на собственном опыте и перестраивать собственные нейронные связи. А большие языковые модели после окончания тренировочной фазы остаются в одном и том же состоянии: они при каждой активации как бы «просыпаются» заново в исходном виде, и максимум – могут что-то из подаваемого на вход контекста/ внешней памяти подсосать из того, что с ними после тренировки происходило.

И вот Дваркеш там спрашивает как раз про это: что это, дескать, за ИИ у вас такой дурацкий – когда модель после деплоя может переделать (по поручению юзеров) дофига всяких делов, и ничегошеньки из этого опыта для себя не вынести?

А другой чувак ему возражает: на самом деле, обучение в каком-то смысле уже сейчас происходит. Просто через механизм тренировки следующего поколения моделей, в которые загрузят уже свежий набор данных. Сейчас, условно, новые передовые модели в линейке выходят раз в полгода – а в будущем, может быть, будут уже каждый месяц обновляться, или даже каждую неделю, а потом каждый день…

Получается, в таком сценарии это будет даже немного похоже на то, как обучаются люди: в течение дня ты вывозишь на базе краткосрочной памяти (у LLM – это всякие блокнотики для записушек, которые используются в качестве внешней памяти), а потом засыпаешь, и ночью у тебя происходит формирование долгосрочных воспоминаний и закрепление новых навыков.

Но тут еще будет интересный нюанс: нам интуитивно хочется (опять же, по аналогии с человеком) воспринимать каждого отдельного ИИ-агента как самостоятельного субъекта. А в описанном выше сценарии этим субъектом, способным к самообучению (если ЛЛМкам прикрутят для этого автоматические механизмы, а не в ручном режиме, как сейчас), становится целая модель.

То есть, у такой модели смогут ежедневно независимо работать сотни тысяч ее клонов, а в конце дня все они будут тащить накопленный опыт к «мамке», которая его впитает, и сделает весь завтрашний рой еще умнее. Получается эдакий «хайвмайнд», где каждый индивидуальный агентик может действовать самостоятельно, но эволюционируют они всё равно все вместе на коллективной основе.

P.S. Пока именно в таком виде оно не работает: они там обсуждают, что, во-первых, не все пользовательские логи автоматом идут на вход тренировочного процесса (хотя, как минимум частично это происходит, как мы знаем по Навье-Стоксгейту). А во-вторых, если модель беспрерывно дообучать на новых данных – то у нее там обычно начинается постепенная деменция с деградацией способностей. Но фундаментально это всё равно не означает, что описанная выше картинка не может в итоге быть воплощена в реальность.
  • 👍 94
  • ❤ 29
  • 😱 11
  • 👎 9
  • 🔥 9
More from @rationalanswer
  1. Sep 19, 2026❗️В Турции дефолтнул самый популярный ПИФ денежного рынка В Турции прямо сейчас разворачив…
  2. Sep 18, 2026У меня в команде в основном зумеры, и поэтому рабочая коммуникация с ними иногда происходи…
  3. Sep 17, 2026Так, подъехала хорошая новость недели: еженедельные дайджесты новостей возвращаются на Хаб…
  4. Sep 16, 2026Так, напоминаю вам на всякий случай, что уже завтра (17 сентября) пройдет конфа «Методы ра…
  5. Sep 16, 2026Образование в эпоху AI/AGI У Алексея Маркова на канале идет дискуссия про образование, оди…
  6. Sep 15, 2026В комментах мне сейчас часто пишут что-то вроде: «Нравилось читать Павла про финансы. А се…
Threads Profile ViewerView any public Threads profile without an account.Open ThreadLook →Writing with AI? Make it sound human.Metric37 rewrites AI drafts so they read naturally. Free AI detector, 1,500 words free.Try Metric37 →