TGViewer
CoreInfra CoreInfra @coreinfra · 533 subscribers
Post #155 818
Самое загадочное в больших языковых моделях – это то, что они все работают, несмотря на огромную разницу во всем.

Dense, MoE, LatentMoE, все варианты attention (в т.ч. например Kimi Linear который вообще не совсем attention), все варианты функций активации, все варианты обучения – классический pretrain, JEPA-like цели, RL, все модальности – текст, сырое (!) аудио и картинки, видео, квантизация и дистилляция – все работает, во всех доменах, и между доменами.

Можно придумать бесконечное множество причин, почему это не должно работать – но оно работает.

Pic unrelated.

– @pgregory
  • ❤ 6
  • 🤷‍♂ 3
  • 👍 3
More from @coreinfra
  1. Sep 22, 2026CoreInfra pinned «Beta запуск новой фичи на хабе. Вы теперь можете принести свою подписку…
  2. Sep 22, 2026Beta запуск новой фичи на хабе. Вы теперь можете принести свою подписку на хаб и пользоват…
  3. Sep 16, 2026LLM – не единственный вид AI. Периодически появляются интересные альтернативные (либо допо…
  4. Sep 16, 2026А какое ваше рабочее место?) Здесь должен быть еще @hrissan за работой, но он фотографируе…
  5. Sep 14, 2026Количество стресса в жизни Во время решения олимпиадных задач часто применяется техника ст…
  6. Sep 14, 2026С Борей работали вместе ВКонтакте, сейчас он работает в OpenAI и ведет крутой блог. А идея…
Threads Profile ViewerView any public Threads profile without an account.Open ThreadLook →Writing with AI? Make it sound human.Metric37 rewrites AI drafts so they read naturally. Free AI detector, 1,500 words free.Try Metric37 →