TGViewer
Сиолошная Сиолошная @seeallochnaya · 79.7K subscribers
Post #3896 20K
Сиолошная Проснулись потянулись, снова новости про Astra 👨‍🦳 TheInformation получили доступ к очень интересной информации об архитектуре модели, ниже — перевод выбранных цитат из статьи: — В Astra применена новая архитектура, известная как «рекуррентная глубина» или…
Разбор статьи постараюсь сделать попозже, а пока мысли по новости:
1) идея применять один и тот же слой или набор слоёв несколько раз подряд давно обсуждалась, но до сих пор не было известно ни про одну полноценную модель с его применением
2) OpenAI известны тем, что они берут простые идеи и доводят их до результата; именно это позволяло им из раза в раз делать прорыв и находить путь вперёд, в то время как другие просто следовали
3) если Astra и вправду новое архитектурное открытие, которое ещё никто не применил (хотя ходили слухи, как я считаю абсолютно безосновательные, что последние модели Anthropic могут быть рекуррентными) — в ближайшие полгода-год нас ждёт очередной виток ускорения улучшения моделей.
4) в новостной заметке, как мне кажется, много путаницы по поводу того, что именно «скрыто». Сама цепочка рассуждений остаётся, но теперь между одним токеном и вторым появляется больше вычислений. Само по себе обычное увеличение модели даже без всякий рекурсии приводит к тому же — модель формирует множество промежуточных представлений, чуть-чуть меняет/уточняет их и затем генерирует токен
5) кажется что это не так страшно, как если бы модель переходила с текста на рассуждения в векторах/эмбеддингах, когда рассуждения не формализуются вовсе, и читать нечего. Я не вижу, почему это должно быть хуже с точки зрения мониторинга рассуждений, чем обучение модели с бОльшим количеством слоёв — только тут получается ещё меньше параметров, что скорее не ухудшает мониторинг рассуждений и их честность.

Ждём китайцев с залупливанием слоёв 🍿

UPD: добавка от главреда TheInformation
Похоже, возникло недопонимание относительно статьи и того, чем занимается OpenAI. В передовых лабораториях разрабатываются новые методы, включающие в себя реккурентные трансформеры и тому подобное. Как мы отмечаем в статье, OpenAI устанавливает ограничения на использование циклов рекурсии и пытается обеспечить видимость/мониторинг рассуждений в Astra. Опасение вызывает то, что другие разработчики ИИ могут не придерживаться таких ограничений.
  • 👍 142
  • 🤣 33
  • 🌚 19
  • 👨‍💻 11
  • 🤔 9
  • 🤡 5
  • 😭 4
  • ❤‍🔥 2
More from @seeallochnaya
  1. Sep 21, 2026И абсолютно невероятная картинка с Эль Сальвадором, который имел очень высокий уровень пре…
  2. Sep 21, 2026Утром прочитал у Scott Alexander пост двухлетней давности про тюрьмы и преступления. Там е…
  3. Sep 20, 2026Прошло уже почти 3 недели с релиза GPT-6 Astra, и можно подводить первые промежуточные ито…
  4. Sep 19, 2026Похоже у OpenAI и вправду очень сильно вырос спрос, и подписки за $200 закрыли поделом — в…
  5. Sep 18, 2026Вы наверняка видели эту картинку с XKCD. Оказалось, она была пророческой — именно через уя…
  6. Sep 17, 2026OpenAI по слухам там почти решили еще одну задачу тысячелетия. Думаю, огромное число матем…
Threads Profile ViewerView any public Threads profile without an account.Open ThreadLook →Writing with AI? Make it sound human.Metric37 rewrites AI drafts so they read naturally. Free AI detector, 1,500 words free.Try Metric37 →