TGViewer
LLM-стройка LLM-стройка @llm_stroyka · 79 subscribers
Post #13 94
ЧТО НАШЛИ НЕЗАВИСИМЫЕ

Регрессии опубликовали только Artificial Analysis, и все относительно прошлой модели Sol.

Индекс интеллекта у Astra 61. Ровно столько же, сколько у Sol. У Fable 5.1 при этом 65,7.

Минус 80 пунктов Эло на GDPval-AA v2, это задачи по 44 профессиям, набор адаптирован из данных самой OpenAI. Минус 2, 3 пункта на клиентской поддержке, научном Python и рассуждении по длинному контексту. Качество презентаций упало, там до сих пор лидирует Sol. Цена задачи выросла на 75 процентов.

И главное. OpenAI пишет про 4,2 процента выдумок. Artificial Analysis на своем тесте фиксирует 51 процент, хотя у Sol было 92. Разница на порядок, потому что определения выдумки разные и сложность набора данных разная.

Что я из этого забрала: цифры от поставщика и от независимой лаборатории нельзя класть в одну колонку. artificialanalysis.ai/articles/benchmarking-gpt-6-astra

ОБВЯЗКА РЕШАЕТ БОЛЬШЕ МОДЕЛИ

Вот это для меня самое важное.

ARC Prize прогнали Astra через две разные обвязки. Своя у них нейтральная, модель сама решает, какие заметки нести дальше. Провайдерская сохраняет непрозрачное состояние рассуждений между запросами и сжимает длинные сессии.

На своей обвязке Astra дает 62,7 процента. На провайдерской 99,9. Одна и та же модель, 37 пунктов разницы.

Дальше еще интереснее. Режим вообще без рассуждений дает 35,2, а низкий уровень усилий только 17,5. Зависимость немонотонная. И прогон за 26 тысяч долларов оказался точнее прогона за 48 тысяч.

Про заголовки "превзошла человека". Это верно только для провайдерской обвязки. В отдельном режиме у модели была песочница с исполнением кода, она писала себе решатели лабиринтов и боев. У людей в контроле не было ни интерпретатора, ни блокнота. ARC Prize так и пишут: это совместный результат модели и ее инструментов. Эталон по людям собран примерно на 500 участниках без отбора по навыку. arcprize.org/blog/astra

КТО КАК МЕРЯЕТ

OpenAI: максимум усилий, свои скаффолды, чужие модели берет с открытых рейтингов. Правки задним числом, методология не раскрыта.

ARC Prize: две обвязки раздельно, все шесть уровней усилий, открытая политика тестирования. Но домен узкий и эталон по людям слабый.

Artificial Analysis: свои индексы, считают цену и токены на задачу. У разных моделей разные обвязки, определения метрик свои.

ЧТО Я ПОМЕНЯЛА У СЕБЯ

Винсент Санн Чен из Snorkel AI перечисляет минимум того, что определяет число: контрольная точка модели, конфигурация с лимитами времени и вычислений, обвязка, конфигурация оценщика с его недетерминированностью. Он предлагает при каждой правке цифр раскрывать, что изменилось в настройке. Такой нормы в отрасли пока нет.

Мой чек-лист:

1. Не брать цифры поставщика за точку отсчета без уровня усилий и проверки, доступен ли он в продукте.
2. Гонять минимум три уровня усилий, зависимость немонотонная.
3. Писать в лог, идет ли прогон через провайдерскую обвязку контекста.
4. Метрики выдумок из разных источников не смешивать.
5. Хранить рядом с числом все четыре параметра прогона, иначе оно невоспроизводимо.

И пункт под безопасность. Публичная Astra урезана по наступательным сценариям, поверх нее работает слой классификаторов. Он иногда обрывает и защитную работу тоже. Значит обвязка должна отдельно логировать прерванные трассы, иначе ложные срабатывания растворятся в общем проценте.

Если гоняете свои замеры по агентам, напишите, какие расхождения ловили вы. И еще: с нейросетками может произойти что угодно, важно об этом прямо говорить и писать😭🥰
artificialanalysis.ai Benchmarking GPT-6 Astra GPT-6 Astra ties leadership with Claude Fable 5.1 in both of our flagship Indices, at lower cost. Astra equals Fable 5.1 in the Intelligence Index at ~40% of the cost, and in the Coding Agent Index at ~60% of the cost.
  • 🔥 2
  • ❤ 1
More from @llm_stroyka
  1. Sep 18, 2026Иногда все идет не по плану😭 Вчера проводила встречу по ИИ-агентам, но нигде не было инте…
  2. Sep 15, 2026Давайте избавимся от рутины ⭐️ Проводим воркшоп с Натальей Грековой — каждый соберет ИИ-по…
  3. Sep 15, 2026В этот четверг буду рассказывать про агентов и ассистентов. Приходите обязательно 🥰
  4. Sep 15, 2026Привет! Это «ЛЛМ для пупсиков»🍼 Я Ната, делаю ИИ-агентов и системы на языковых моделях. У…
  5. Sep 15, 2026А еще я запустила канал, где пишу о ИИ для новичков, присоединяйтесь, если в этом чате вам…
  6. Sep 15, 2026LLM-стройка pinned «Решила написать, с чем я могу помочь, вдруг вы не знаете😈 Я собираю L…
Threads Profile ViewerView any public Threads profile without an account.Open ThreadLook →Writing with AI? Make it sound human.Metric37 rewrites AI drafts so they read naturally. Free AI detector, 1,500 words free.Try Metric37 →