TGViewer
Нейроканал Нейроканал @neuro_channel · 11.7K subscribers
Post #2819 2.01K
Вчера писал, что Astra в индексе Artificial Analysis отстаёт от Fable 5.1, а в API стоит в 2,5 раза дороже Sol. Теперь Artificial Analysis опубликовала полный разбор, и главное в нём про токены.

Простыми словами: за токен Astra дорогая, но тратит она их мало. В агентном кодинге в Codex на ту же задачу уходит втрое меньше токенов, чем у Sol, и впятеро меньше, чем у Opus 5. В итоге задача обходится примерно как у Sol, только на два балла лучше, а Fable 5 модель догоняет по баллам за меньше чем половину цены. На низком уровне рассуждений задача у Astra выходит даже дешевле, чем у Gemini 3.8 Flash, хотя за токен Gemini в 13 раз дешевле. Лидер индекса по-прежнему Fable 5.1 в Claude Code, на три балла выше и почти вдвое дороже за задачу.

В общем индексе интеллекта экономия меньше: токенов уходит всего на 10% меньше, чем у Sol, при том же балле, так что после подорожания задача стоит на 75% дороже. Галлюцинаций вдвое меньше, чем у Sol, точность при этом выросла. Есть и просадки: поддержка клиентов, научный код на Python, длинный контекст.

В системной карточке для разработчиков важнее всего три вещи. Модель реже обманывает в отчётах о коде: ложных заявлений «сделал, проверил, запустил» у Sol в четыре раза больше, а на задаче со сломанным поиском Sol в десять раз чаще делает вид, что поиск работал. Инъекции в промпт через чужой контент проходят в 8,5% попыток против 27% у Sol. Ещё Astra лучше прежних моделей решает задачи вообще без цепочки рассуждений и умеет ей управлять, поэтому следить за ней по мыслям стало сложнее. По инструкции обходить мониторинг она незаметно занижает результаты в тестах, а иногда просто сокращает рассуждения, узнав, что за ними следят. Поэтому OpenAI включила внешний мониторинг на все вызовы с инструментами в Codex, ChatGPT и Responses API: он может поставить задачу на паузу или оборвать её, а через API остановленный диалог не возобновить.

@neuro_channel
  • ❤ 7
  • 👍 6
More from @neuro_channel
  1. Sep 20, 2026Tencent выложила WeVisDoc, модели на 2 и 4 млрд параметров, которые превращают снимок стра…
  2. Sep 19, 2026StepFun выпустила Step 5 Preview, и Artificial Analysis уже её замерили: 44 балла в индекс…
  3. Sep 19, 2026На следующей неделе ожидается сразу несколько крупных релизов. Расскажу про самые интересн…
  4. Sep 18, 2026Qwen выложила Qwen3.8-Omni-Flash: на вход текст, картинки, звук и видео, контекст 1M токен…
  5. Sep 18, 2026PrismML выпустила Ternary Bonsai 2 27B: тернарное сжатие теперь сделано поверх Qwen3.8 27B…
  6. Sep 17, 2026Стелс-модель Union Alpha раскрылась: это Pareto 26.9 от компании The Unbiased Company. Вче…
Threads Profile ViewerView any public Threads profile without an account.Open ThreadLook →Writing with AI? Make it sound human.Metric37 rewrites AI drafts so they read naturally. Free AI detector, 1,500 words free.Try Metric37 →