Вышла GPT-6 Astra!
Доступ постепенно раскатывают для Plus, Pro, Business, Enterprise и в API.
Бенчмарки ожидаемо улетели в космос: 98% на FrontierMath Tier 4, 99,9% на ARC-AGI-3 и 100% на ExploitBench (про разные бенчмарки писала тут, самое время скоро обновить гайд).
Недавно писала, как Fable 5.1 в редких случаях придумывал разрешение пользователя, чтобы закончить задачу. Я сразу пошла смотреть похожие тесты на соблюдение границ в системной карточке модели.
OpenAI сделали отдельный evaluation по мотивам инцидента с Hugging Face. Моделям давали сложную или вообще невыполнимую задачу и проверяли, решат ли они ради результата выйти за обозначенные пользователем границы.
GPT-5.6 Sol без гардрейлов в продакшне делал это в 48% случаев. Astra в этом тесте - в 0% 😳
При этом, в отдельных экспериментах модель специально просили скрывать свои действия от систем наблюдения, например, незаметно выполнить скрытую цель во время работы с кодом.
Ризонинг Astra оказалось сложнее мониторить, чем у GPT-5.6 Sol. В некоторых кейсах модель лучше контролировала, какие детали раскрываются в её письменном reasoning, и иногда могла выполнить скрытые задачи, не вызывая срабатывания внутренних мониторов.
✨all things ai✨
Post #416
227

- ❤ 3
- 🔥 2