Она почти прошла мой когнитивный тест, который пока нормально не прошла ни одна из моделей.
Конкретно основной фактор: ложная premise пользователя не становится фактом только потому, что она написана в задании.
А ещё на adversarial review системного дизайна она оказалась одной из сильнейших: не пыталась любой ценой «найти баг», сама ломала собственные findings и понижала их до
OPEN DESIGN / NOT ENOUGH EVIDENCE, когда доказательств не хватало.Вот это уже гораздо интереснее очередного +5% на бенчмарке.