TGViewer
look at me look at me @leprooboy · 70 subscribers
Post #144 40
🍀 GPT-6 ASTRA destroy industry or not? (part 2/2)

Прямое продолжение первой части

Для понимания сначала читайте first part, потом уже это

――――――――
🖥 Advantages

➛➛
Медицина

―――――――――――――――
На HealthBench Professional*

- Astra 63,4%
- Fable 5 60,9%
- Opus 5 57,5%
- Fable 5.1 56,6%
―――――――――――――――

*HealthBench Professional - реальные диалоги с врачами, оценка по рубрикам от практикующих физиков


➛➛ Соотношение цена/качество на паритете возможностей

По данным независимого трекера Artificial Analysis от стоимости на задачу

―――――――――――――――――――――――――――――――
Intelligence Index* | Coding Agent Index**

Astra /Fable 5.1 ~40% | Astra /Fable 5.1 ~60%
―――――――――――――――――――――――――――――――

То есть при сопоставимом качестве Astra за счёт меньшего расхода токенов на задачу может обходиться заметно дешевле по факту, несмотря на одинаковую цену за токен

*Artificial Analysis Intelligence Index - сводный балл общего интеллекта по 10 разным тестам
**Artificial Analysis Coding Agent Index - сводный балл именно по агентным задачам с кодом


➛➛ Остальное

Коротко: Astra умеет то же, что уже давно умеет Claude (работать в любом приложении как человек, даже без API). Ничего нового для тех, кто следит за Anthropic, но раз уж сравниваем стоит упомянуть

Astra может работать через обычные приложения так же, как это делает человек - даже когда у приложения нет API. Она умеет заполнять веб-формы, обновлять записи в CRM и организовывать календарь, а также хорошо держит формат при создании презентаций, документов и таблиц по шаблону компании

―――――――――――
🐱 Важные нюансы

ARC-AGI-3

Заявлено OpenAI: 99,9%
Независимая проверка (ARC Prize): 62,7%

Fortune также сообщал, что OpenAI тихо пересматривала показатель галлюцинаций после запуска и использовала для одного из сравнений по кибербезопасности недоступный клиентам режим рассуждений

OSWorld 2.0

У Astra: результат по официальной методике теста
У Fable 5.1: заявлено 77,9%, но на другом релизе бенчмарка потому что сравнить напрямую нельзя

Сама OpenAI в примечаниях к своей таблице отмечает, что не использовала методику тестирования Anthropic - то есть цифры Claude здесь приведены по стандартным настройкам, а не по изменённым задачам из системной карты Fable 5.1

Источники: 1, 2

――――――
🍌 итОго

Модель GPT-6 Astra действительно совершила качественный скачок в сравнении с предшественниками, но не стала их полноценной заменой. Причём я говорю и не только про модели от OpenAI

―――――――――――――――――――――――――――――――
LLM | Сильнее | Слабее
―――――――――――――――――――――――――――――――
Astra интерфейсы, офисные агентный код, наука,
артефакты, кибербезопасность prompt injection
―――――――――――――――――――――――――――――――
Fable 5.1 агентный код, научные задачи, цена за токен
устойчивость к инъекциям
―――――――――――――――――――――――――――――――
Opus 5 цена/качество (вдвое не топ ни в одной
дешевле Astra) категории
―――――――――――――――――――――――――――――――

Даже там, где Astra формально сильнее, вопрос «а стоит ли это разницы в цене для конкретной задачи» остаётся открытым - «лучше» не всегда значит «более разумный выбор»

Нет универсального ИИ, который может всё и сразу, но есть те, у которых что-то получается лучше, чем у других - и Astra это как раз тот случай
More from @leprooboy
  1. Sep 21, 2026👻 Тоже ничего не поняли? Ну или поняли, но не сказать чтоб прям полностью В ОБЩЕМ и целом…
  2. Sep 19, 2026🍌 Расследование по тимеру Сразу отмечу, к этому каналу и его владельцу я отношусь супер.…
  3. Sep 18, 2026🦄 Мосты которые я использую Моя личная подборка бриджей которыми я лично пользуюсь или по…
  4. Sep 17, 2026🖥 Полезная тулза для ИИ (exclusive) Один знакомый мне канал долгое время освещал разработ…
  5. Sep 15, 2026🌸 Главные криптохабы Вообще, крипто само по себе очень гибкое пространство которое объеди…
  6. Sep 13, 2026🍌 Антидрейн 🖥 По claude sonnet 5 (hard): Дрейн кошелька (от англ. drain — "слить", "осуш…
Threads Profile ViewerView any public Threads profile without an account.Open ThreadLook →Writing with AI? Make it sound human.Metric37 rewrites AI drafts so they read naturally. Free AI detector, 1,500 words free.Try Metric37 →