TGViewer
Complete AI Complete AI @complete_ai · 7.86K subscribers
Post #239 2.37K

Forwarded from AbstractDL

The Shape of Learning: Intrinsic Dimensions in Transformer-Based Models

Препринт нашей новой работы! Оказалось, что языковые модели «упаковывают» свои репрезентации в очень компактное пространство с внутренней размерностью не больше 60. И при этом анизотропия на средних слоях трансформеров-декодеров стремится к единице! Получается, эмбеддинги из середины модели расположены вдоль одной линии.

Еще одно интересное наблюдение — обучение LLM делится на две фазы: расширение и последующее сжатие активаций (см. картинку). А перед взрывами лосса их размерность немного подрастает.

Статья
  • ❤‍🔥 19
  • 🔥 8
  • 🎉 5
More from @complete_ai
  1. Oct 7, 2026🚀 Мы с командой представляем Kandinsky 6.0 Video Lite и Pro — новое поколение наших модел…
  2. Sep 17, 2026AI + разработка — Senior-разработчиков ждут в Ozon Tech В компании развивается новое напра…
  3. Sep 7, 2026Мы выложили программу Practical ML Conf 2026 Я уже не первый год состою в программном коми…
  4. Sep 5, 2026Утекли предполагаемые бенчмарки Gemini 4 - цифры выглядят безумно 🤯 В сети разошлась табл…
  5. Aug 20, 202617 сентября в Москве пройдёт AI R&D DAY — конференция для исследователей, разработчиков, р…
  6. Aug 20, 2026Сегодня вечером мы вместе с Денисом Макрушиным встретимся на стриме и разгоним базу про бе…
Threads Profile ViewerView any public Threads profile without an account.Open ThreadLook →Writing with AI? Make it sound human.Metric37 rewrites AI drafts so they read naturally. Free AI detector, 1,500 words free.Try Metric37 →