TGViewer
Время Валеры Время Валеры @cryptovalerii · 30.8K subscribers
Post #937 23.9K
Наткнулся на блог классного мужика — Yuandong Tian. (Причем видимо я один из немногих - просмотров пара десятков за полгода)

10 лет проработал в Meta, дорос до Research Director в FAIR. Ряд его статей получали награды как top papers, например на International Conference on Machine Learning.

Причём забавный момент: в год выхода одной из ключевых статей у него в perf review был “meets most”, а когда статью признали топовой — повысили.

В 2025 пошёл “спасать” Llama 4, и попал под сокращение, чему, судя по всему, был вполне рад.

Теперь размышляет кому в мире будущего будет жить хорошо

If the future is AI-centric, do we still need humans?

Consider a simple model of investment and return for a human. Traditionally, the more work experience accumulated (i.e., investment), the stronger the capability, and the greater the return. This leads to a monotonically increasing curve. This is why big tech companies have ladders: the job level generally goes up with years of service and experience.

Now it is different. Ladders have become meaningless, and past experience is irrelevant. Human value has shifted from being evaluated by “the quantity and quality of labor produced by the individual” to “whether one can improve AI’s capabilities.”
The equation now becomes: Human + AI > AI output.


Еще из интересного, в твиттере есть обсуждение его статьи — “Provable Scaling Laws of Feature Emergence from Learning Dynamics of Grokking”, где он пытается математически смоделировать тонкую грань между меморизацией и генерализацией в контексте grokking: когда сначала модель как будто переобучается и просто запоминает train set, а потом внезапно начинает действительно обобщать (delayed generalization).

Сделано на игрушечном датасете, но тем не менее: раскладывают обучение на несколько фаз — lazy learning → feature learning → interactive feature learning — и показывают, как из режима “модель тупо меморизирует” можно перейти к настоящей генерализации.

В этот момент в дискуссию врывается другой мужик со своей работой “Grokking and Generalization Collapse: Insights from HTSR theory” и говорит: “подождите, мы вообще нашли два разных типа memorization”.

— Pre-grokking memorization — до генерализации.

— Anti-grokking — после генерализации, если тренировать очень долго (~10^6 steps), когда модель снова скатывается в memorization и происходит generalization collapse.

Но Tian не теряется (работу то уже потерял) и отвечает довольно красиво: мол, это идеально укладывается в его energy landscape. Если данных мало, модель сидит прямо на границе между memorization и generalization. Причём memorization optimum может быть энергетически выгоднее.

— большой learning rate / шумный gradient / маленький batch size могут выбить модель из generalization basin обратно в memorization;
— а маленький learning rate может, наоборот, удержать её в локальном optimum генерализации.

То есть выдает практические советы по достижению grokking:

— weight decay нужен не просто “для регуляризации”, а чтобы после initial overfitting вообще появился сигнал для feature learning;
— LR и gradient noise определяют, удержится ли модель в basin генерализации;
— слишком долгое обучение может привести к anti-grokking и collapse генерализации.

И вообще - memorization и generalization начинают рассматривать как конкурирующие локальные минимумы, между которыми модель может перескакивать в зависимости от динамики оптимизации.
#ArticleReview
  • 👍 159
  • 🔥 57
  • ❤ 45
  • 🤡 8
  • 🤔 7
  • 🤯 6
  • 🆒 2
  • 🎉 1
  • 💔 1
  • 👾 1
More from @cryptovalerii
  1. Sep 19, 2026На днях начал делать ревью А/Б-платформы от Три сигма, позавчера отправил им 9 уточняющих…
  2. Sep 8, 2026Мы давно про это знали: Design Docs Are All You Need: An AI-native Machine-Learning Perfor…
  3. Aug 26, 2026Прочитал отличную заметку Shopify про gisting — сжатие системного промпта в обучаемые токе…
  4. Aug 24, 2026На основе пятничного поста про промт: Сожми документ максимально, не потеряв никакой инфор…
  5. Aug 23, 2026☁☁☁☁☁☁☁ 24 сентября Yandex Cloud проведёт флагманскую технологическую конференцию — Yandex…
  6. Aug 21, 2026После ревью документов сегодня (один из дизайнов был на 51 страници!) даю совет всем, кто…
Threads Profile ViewerView any public Threads profile without an account.Open ThreadLook →Writing with AI? Make it sound human.Metric37 rewrites AI drafts so they read naturally. Free AI detector, 1,500 words free.Try Metric37 →