1) идея применять один и тот же слой или набор слоёв несколько раз подряд давно обсуждалась, но до сих пор не было известно ни про одну полноценную модель с его применением
2) OpenAI известны тем, что они берут простые идеи и доводят их до результата; именно это позволяло им из раза в раз делать прорыв и находить путь вперёд, в то время как другие просто следовали
3) если Astra и вправду новое архитектурное открытие, которое ещё никто не применил (хотя ходили слухи, как я считаю абсолютно безосновательные, что последние модели Anthropic могут быть рекуррентными) — в ближайшие полгода-год нас ждёт очередной виток ускорения улучшения моделей.
4) в новостной заметке, как мне кажется, много путаницы по поводу того, что именно «скрыто». Сама цепочка рассуждений остаётся, но теперь между одним токеном и вторым появляется больше вычислений. Само по себе обычное увеличение модели даже без всякий рекурсии приводит к тому же — модель формирует множество промежуточных представлений, чуть-чуть меняет/уточняет их и затем генерирует токен
5) кажется что это не так страшно, как если бы модель переходила с текста на рассуждения в векторах/эмбеддингах, когда рассуждения не формализуются вовсе, и читать нечего. Я не вижу, почему это должно быть хуже с точки зрения мониторинга рассуждений, чем обучение модели с бОльшим количеством слоёв — только тут получается ещё меньше параметров, что скорее не ухудшает мониторинг рассуждений и их честность.
Ждём китайцев с залупливанием слоёв 🍿
UPD: добавка от главреда TheInformation
Похоже, возникло недопонимание относительно статьи и того, чем занимается OpenAI. В передовых лабораториях разрабатываются новые методы, включающие в себя реккурентные трансформеры и тому подобное. Как мы отмечаем в статье, OpenAI устанавливает ограничения на использование циклов рекурсии и пытается обеспечить видимость/мониторинг рассуждений в Astra. Опасение вызывает то, что другие разработчики ИИ могут не придерживаться таких ограничений.