ЧТО НАШЛИ НЕЗАВИСИМЫЕ
Регрессии опубликовали только Artificial Analysis, и все относительно прошлой модели Sol.
Индекс интеллекта у Astra 61. Ровно столько же, сколько у Sol. У Fable 5.1 при этом 65,7.
Минус 80 пунктов Эло на GDPval-AA v2, это задачи по 44 профессиям, набор адаптирован из данных самой OpenAI. Минус 2, 3 пункта на клиентской поддержке, научном Python и рассуждении по длинному контексту. Качество презентаций упало, там до сих пор лидирует Sol. Цена задачи выросла на 75 процентов.
И главное. OpenAI пишет про 4,2 процента выдумок. Artificial Analysis на своем тесте фиксирует 51 процент, хотя у Sol было 92. Разница на порядок, потому что определения выдумки разные и сложность набора данных разная.
Что я из этого забрала: цифры от поставщика и от независимой лаборатории нельзя класть в одну колонку. artificialanalysis.ai/articles/benchmarking-gpt-6-astra
ОБВЯЗКА РЕШАЕТ БОЛЬШЕ МОДЕЛИ
Вот это для меня самое важное.
ARC Prize прогнали Astra через две разные обвязки. Своя у них нейтральная, модель сама решает, какие заметки нести дальше. Провайдерская сохраняет непрозрачное состояние рассуждений между запросами и сжимает длинные сессии.
На своей обвязке Astra дает 62,7 процента. На провайдерской 99,9. Одна и та же модель, 37 пунктов разницы.
Дальше еще интереснее. Режим вообще без рассуждений дает 35,2, а низкий уровень усилий только 17,5. Зависимость немонотонная. И прогон за 26 тысяч долларов оказался точнее прогона за 48 тысяч.
Про заголовки "превзошла человека". Это верно только для провайдерской обвязки. В отдельном режиме у модели была песочница с исполнением кода, она писала себе решатели лабиринтов и боев. У людей в контроле не было ни интерпретатора, ни блокнота. ARC Prize так и пишут: это совместный результат модели и ее инструментов. Эталон по людям собран примерно на 500 участниках без отбора по навыку. arcprize.org/blog/astra
КТО КАК МЕРЯЕТ
OpenAI: максимум усилий, свои скаффолды, чужие модели берет с открытых рейтингов. Правки задним числом, методология не раскрыта.
ARC Prize: две обвязки раздельно, все шесть уровней усилий, открытая политика тестирования. Но домен узкий и эталон по людям слабый.
Artificial Analysis: свои индексы, считают цену и токены на задачу. У разных моделей разные обвязки, определения метрик свои.
ЧТО Я ПОМЕНЯЛА У СЕБЯ
Винсент Санн Чен из Snorkel AI перечисляет минимум того, что определяет число: контрольная точка модели, конфигурация с лимитами времени и вычислений, обвязка, конфигурация оценщика с его недетерминированностью. Он предлагает при каждой правке цифр раскрывать, что изменилось в настройке. Такой нормы в отрасли пока нет.
Мой чек-лист:
1. Не брать цифры поставщика за точку отсчета без уровня усилий и проверки, доступен ли он в продукте.
2. Гонять минимум три уровня усилий, зависимость немонотонная.
3. Писать в лог, идет ли прогон через провайдерскую обвязку контекста.
4. Метрики выдумок из разных источников не смешивать.
5. Хранить рядом с числом все четыре параметра прогона, иначе оно невоспроизводимо.
И пункт под безопасность. Публичная Astra урезана по наступательным сценариям, поверх нее работает слой классификаторов. Он иногда обрывает и защитную работу тоже. Значит обвязка должна отдельно логировать прерванные трассы, иначе ложные срабатывания растворятся в общем проценте.
Если гоняете свои замеры по агентам, напишите, какие расхождения ловили вы. И еще: с нейросетками может произойти что угодно, важно об этом прямо говорить и писать😭🥰
Post #13
94