Бен Свердлоу, сооснователь и гендиректор стартапа Freestyle, который делает виртуальные машины для агентов, решил проверить, как далеко агенты зайдут без людей, и превратил игру StarCraft в бенчмарк Brood War Bench.
В нём 19 конфигураций – модели в обвязках Codex, Claude Code и Grok с разным уровнем рассуждений, сыграли каждая с каждой, всего 171 матч.
Codex на GPT-6 Astra с максимальным уровнем рассуждений выиграл все 18 партий при средней стоимости около 10,54 доллара за игру.
Второе место заняла та же модель на среднем уровне (16 побед), третье – Claude Fable (15), четвёртое – Astra на низком уровне (14).
При этом Fable обыграл обе младшие конфигурации Astra.
Три конфигурации Grok 4.6 на троих выиграли три партии, и только у Claude Haiku и друг у друга.
🟡Стили игры
Codex рано отправлял рабочих через карту бить вражеские постройки, пока соперники подолгу решали, что с этим делать. Армию он собирал плохо: его отдельные субагенты для экономики, производства и управления войсками почти не общались и отправляли новых юнитов в бой по одному.
Fable чаще других строил экономику и развивал технологии.
Grok 4.6 в одной 43-минутной партии потратил 11 138 токенов рассуждений, отдал всего шесть пакетов команд и не построил ни одного боевого юнита.
По наблюдению автора, старые модели играли в стратегию реального времени как в пошаговую и погибали, пока думали.
Выше уровня новичка не поднялся никто. По оценке Свердлоу, начинающий игрок с ранней атакой фотонными пушками выиграл бы любую из этих партий.
Записи матчей открыты сайте проекта, там же можно сыграть со своим агентом.
@ai_machinelearning_big_data
#news #ai #ml
