Несмотря на весь хайп вокруг Astra от OpenAI, Claude остается лучшим в мире особенно в коде.
Такое мнение у части разработчиков на данный момент.
Также все обсуждают секретную архитектуру Astra, The Information написали, что модель якобы looped transformer, и из-за этого рассуждения модели не прозрачные.
По этому поводу высказался известный ML-инженер Себастьян Рашка. Он сделал спокойный разбор этого хайпа и вот, что мы узнали.
Обычная архитектура трансформер работает как конвейер: текст заходит с одного конца, проходит через десятки слоёв, и на выходе получается ответ.
Looped transformer запускает текст по этому конвейеру несколько раз, не строит новый, отсюда и название looped transformer.
Так уже сделано в открытой китайской модели Nanbeige 4.2. По эффекту почти как более глубокая модель, но веса те же. Считать становится дороже, размер почти не растёт.
Идея, кстати, не новая она взята из статьи NeurIPS "Mixture-of-Recursions" там вообще есть learned router, который решает, сколько проходов нужно каждому токену.
Себастьян считает, что
Looped transformer - это скромный инженерный приём, а не революция.
А утверждение сми, что эта архитектура скрывает от человека рассуждения модели - это не корректно, скорее всего журналист что-то не понял.
Post #13368
3.93K