Прямое продолжение первой части
Для понимания сначала читайте first part, потом уже это
――――――――
🖥 Advantages
➛➛ Медицина
―――――――――――――――
На HealthBench Professional*
- Astra 63,4%
- Fable 5 60,9%
- Opus 5 57,5%
- Fable 5.1 56,6%
―――――――――――――――
*HealthBench Professional - реальные диалоги с врачами, оценка по рубрикам от практикующих физиков
➛➛ Соотношение цена/качество на паритете возможностей
По данным независимого трекера Artificial Analysis от стоимости на задачу
―――――――――――――――――――――――――――――――
Intelligence Index* | Coding Agent Index**
Astra /Fable 5.1 ~40% | Astra /Fable 5.1 ~60%
―――――――――――――――――――――――――――――――
То есть при сопоставимом качестве Astra за счёт меньшего расхода токенов на задачу может обходиться заметно дешевле по факту, несмотря на одинаковую цену за токен
*Artificial Analysis Intelligence Index - сводный балл общего интеллекта по 10 разным тестам
**Artificial Analysis Coding Agent Index - сводный балл именно по агентным задачам с кодом
➛➛ Остальное
Коротко: Astra умеет то же, что уже давно умеет Claude (работать в любом приложении как человек, даже без API). Ничего нового для тех, кто следит за Anthropic, но раз уж сравниваем стоит упомянуть
Astra может работать через обычные приложения так же, как это делает человек - даже когда у приложения нет API. Она умеет заполнять веб-формы, обновлять записи в CRM и организовывать календарь, а также хорошо держит формат при создании презентаций, документов и таблиц по шаблону компании
―――――――――――
🐱 Важные нюансы
⚡ ARC-AGI-3
Заявлено OpenAI: 99,9%
Независимая проверка (ARC Prize): 62,7%
Fortune также сообщал, что OpenAI тихо пересматривала показатель галлюцинаций после запуска и использовала для одного из сравнений по кибербезопасности недоступный клиентам режим рассуждений
⚡ OSWorld 2.0
У Astra: результат по официальной методике теста
У Fable 5.1: заявлено 77,9%, но на другом релизе бенчмарка потому что сравнить напрямую нельзя
Сама OpenAI в примечаниях к своей таблице отмечает, что не использовала методику тестирования Anthropic - то есть цифры Claude здесь приведены по стандартным настройкам, а не по изменённым задачам из системной карты Fable 5.1
Источники: 1, 2
――――――
🍌 итОго
Модель GPT-6 Astra действительно совершила качественный скачок в сравнении с предшественниками, но не стала их полноценной заменой. Причём я говорю и не только про модели от OpenAI
―――――――――――――――――――――――――――――――
LLM | Сильнее | Слабее
―――――――――――――――――――――――――――――――
Astra интерфейсы, офисные агентный код, наука,
артефакты, кибербезопасность prompt injection
―――――――――――――――――――――――――――――――
Fable 5.1 агентный код, научные задачи, цена за токен
устойчивость к инъекциям
―――――――――――――――――――――――――――――――
Opus 5 цена/качество (вдвое не топ ни в одной
дешевле Astra) категории
―――――――――――――――――――――――――――――――
Даже там, где Astra формально сильнее, вопрос «а стоит ли это разницы в цене для конкретной задачи» остаётся открытым - «лучше» не всегда значит «более разумный выбор»
Нет универсального ИИ, который может всё и сразу, но есть те, у которых что-то получается лучше, чем у других - и Astra это как раз тот случай
