Эксперимент CivBench проверил, способны ли языковые модели самостоятельно вести партию в Civilization VI на протяжении более 300 ходов. Агент получал 76 инструментов для управления городами, войсками, дипломатией, наукой и экономикой. Claude Opus 4.6, Gemini 3.1 Pro, GPT-5.4 и Kimi K2.5 выполняли тысячи действий, строили армии и в отдельных запусках побеждали. Главный сбой возникал не при выборе отдельного хода. Модели забывали собственные намерения и переставали проверять события, от которых зависела вся партия.
Авторы признали пригодными для анализа 23 игры. Claude выиграл 2 из 8 партий, Gemini 1 из 6, GPT-5.4 не победил ни в одной из 8, Kimi провел 1 партию без победы. Выборка слишком мала для рейтинга моделей. Ее ценность находится в журналах действий. Игра отделяла доступность информации от ее извлечения: состояние соперника или прогресс к победе существовали в интерфейсе, однако агент обязан был сам вызвать нужный инструмент.
Инструкция требовала проверять продвижение к победе каждые 20 ходов. На практике интервалы достигали 30–75 ходов. В 7 из 20 поражений, приближение которых можно было обнаружить заранее, агент ни разу не запросил соответствующие данные в течение последних 20 ходов. Одна треть таких проигрышей произошла рядом с видимым соперником, чей путь к победе оставался без проверки. Модель обладала доступом, вычислительной способностью и прямым предписанием, однако не вернулась к стратегически важному вопросу.
Второй провал касался обещаний самой себе. Исследователи извлекали из дневника агента конкретные обязательства и проверяли, выполнены ли они в следующие 10 ходов. Доля исполнения составляла от 48,2% до 65,8%. Запись «перебросить войска», «проверить соперника» или «сменить курс исследования» оставалась в тексте, пока агент занимался локальными задачами. Память присутствовала как архив фраз и отсутствовала как обязанность совершить действие.
Отдельный дневник улучшил наблюдаемость эксперимента. Агент после каждого хода фиксировал тактику, стратегию, работу с инструментами, ближайший план и гипотезу. До введения такого сопровождения лишь 21% запусков доходили до естественного завершения. Дневник стабилизировал работу среды, но авторы не доказали, что он устраняет забывание. Само описание намерения не создавало очереди, срока и автоматической проверки исполнения.
CivBench тем самым отделяет интеллект от управляемости во времени. Модель способна придумать сильный план, объяснить его и успешно выполнить несколько частей. Партия рушится, когда десятки мелких действий вытесняют редкую проверку, а новая локальная цель занимает место прежнего обязательства. Чем длиннее задача, тем меньше значение имеет качество единственного ответа и тем важнее дисциплина возвращения к отложенному решению.
Работа предлагает вынести эту дисциплину за пределы модели. Постоянный реестр должен хранить обещание, срок, условие отмены и подтверждение исполнения. Расписание обязано само вызывать проверки скрытого состояния, а журнал действий — отмечать невыполненное обязательство до выдачи следующей команды. В такой схеме модель формирует варианты и действует, а внешний управляющий слой не дает ей забыть, зачем началась последовательность ходов.
Урок касается не только игр. Агент, который ведет закупку, расследование или инфраструктурный проект, может безошибочно выполнить сотни операций и пропустить одну проверку санкций, срока или полномочий. Рост способности делает такой дефект опаснее: сильная модель успевает провести больше необратимых действий до того, как человек заметит потерянную цель. Автономность требует памяти, превращенной в контроль будущих поступков. Без нее интеллект остается исполнителем текущего шага, который всякий раз заново решает, что считать главным.
@ex_trakt
Post #975
10.8K