Всё больше и больше замечаю как фокус внимания с Anthropic и их моделек смещается в сторону OpenAI
Поскольку я не понимаю почему это происходит я решил выяснить, а чем swag. И тут пришёл к флагману - GPT-6 ASTRA
Постарался упростить восприятие насколько возможно, поэтому читаться должно легко
Part of Information я взял тут
――――――――――――――
🖥 Base for understanding
GPT-6 Astra это пик мысли OpenAI - самая сложная / самая дорогая модель
Тех. характеристики | Затраты
―――――――――――――――――――――――――――――――
Контекстное окно | 1.050.000 токенов
―――――――――――――――――――――――――――――――
Максимальный выход | 128.000 токенов
―――――――――――――――――――――――――――――――
Цена (вход/выход) | 10$ / 50$
Пакетный (Batch) режим и Flex стоят 50% от стандартной цены, а «быстрый» режим - вдвое дороже, но ощутимо быстрее
Экономика AI войн. Согласно официальным ценам токенов (за миллион входных) / (за миллион выходных)
LLM | Стоимость 1M токенов за вход / выход
―――――――――――――――――――――――――――――――
GPT-6 Astra | $10 / $50
―――――――――――――――――――――――――――――――
GPT-5.6 Terra | $2 / $12
―――――――――――――――――――――――――――――――
GPT-5.6 Luna | $0,20 / $1,20
>> Astra в 50 раз дороже Luna по входу и почти в 42 раза дороже по выходу――――――――
🖥 Advantages
Я выделил 7 основных. Если не хотите читать, то просто смотрите на цифры в каждой категории - они достаточно говорят
Источники: 1, 2
➛➛ Автоматизация офисной работы и артефактов
―――――――――――――――――――――――――――――――
На AutomationBench* | На BenchCAD**
- Astra 41,4% - Astra 95,9%
- Fable 5.1 31,4% - Fable 5.1 84,3%
- Opus 5 26,9% - Opus 5 82,1%
- Fable 5 17,4% |
―――――――――――――――――――――――――――――――
Это, по независимым обзорам, самая честная и наименее спорная категория преимущества Astra
*AutomationBench - комплексная работа с документами / таблицами / презентациями
**BenchCAD - генерация CAD-артефактов
➛➛ Математика и общие знания
―――――――――――――――――――――――――――――――
На FrontierMath Tier 4 (v2)* | На GPQA Diamond**
- Astra 97,6% - Astra 96,0%
- Fable 5.1/Fable 5 87,8% - Fable 5.1 93,7%
- Opus 5 73,2% | - Opus 5 93,2%
―――――――――――――――――――――――――――――――
*FrontierMath Tier 4 (v2) - нерешённые математические задачи исследовательского уровня
**GPQA Diamond - вопросы по физике/химии/биологии уровня PhD (доктор наук), устойчивые к поиску в интернете
➛➛ Кибербезопасность & Безопасность при компьютерном использовании
―――――――――――――――――――――――――――――――
На ExploitBench* | Внутренний бенчмарк некорректного
поведения**
- Astra 100% - Astra 2,4%
- Opus 5 70% | - Fable 5.1 9,5%
―――――――――――――――――――――――――――――――
⚡ Про кибербезопасность - сопоставимой цифры для Fable-моделей не публиковалось. Astra - единственная модель, достигшая «критического» уровня кибервозможностей по Preparedness Framework OpenAI***, хотя это одновременно и повод для повышенной осторожности при развёртывании, а не только достижение
⚡ Про безопасность при компьютерном использовании - На внутреннем бенчмарке некорректного поведения* при работе с компьютером (чем ниже, тем лучше). Astra реже выходит за рамки задачи при автономной работе с интерфейсом
*ExploitBench - построение рабочих эксплойтов для уязвимостей, а не просто их обнаружение
**Внутренний бенчмарк некорректного поведения - как часто агент выходит за рамки поставленной задачи при работе с компьютером. Эта закрытая метрика OpenAI, которая упоминается только в материалах запуска Astra
***Preparedness Framework OpenAI - классификация риска в кибербезопасности, не бенчмарк как таковой
