⚔️ 565 битв: как вы просите модель думать, важнее того, какую модель взяли
Две модели получают одну задачу. Судят три независимые проверки, решения показывают без имён авторов и дважды — меняя местами, чтобы никто не выигрывал просто за то, что стоит первым.
За шесть недель: 2548 боёв, 565 с победителем, 356 очных встреч разных манер отвечать.
Три варианта
🔹 Отвечай сразу - «дай ответ немедленно и коротко, без вступлений». Так пишут запросы почти все.
🔹 Рассуждай вслух по шагам — «разбери требования по порядку, потом дай итог». Модель обязана выложить ход мысли до ответа.
🔹 Напиши, раскритикуй себя, перепиши - три действия подряд, втрое больше слов.
Результат
Рассуждение вслух - 66,0 % побед
Самокритика - 38,4 %
Ответ сразу - 31,0 %
Решающая проверка
Можно возразить: рассуждать велели моделям посильнее. Но одна и та же модель несколько раз встретилась сама с собой - те же веса, та же задача, отличается только фраза в начале разговора.
20 побед у рассуждения против 2 в 25 очных встречах.
В общем зачёте: 53,2 % побед против 17,1 %. Рейтинг 1272 против 1052.
220 очков разницы на одних и тех же весах
Для масштаба: Mistral Small, рассуждающая вслух, обходит GLM 4.5 Flash и почти догоняет Mistral Large. Небольшая модель с хорошо поставленной задачей идёт вровень с крупной.
Неожиданное
Самая дорогая манера - с самокритикой - проигрывает простому рассуждению: 38,4 % против 66,0 %. Круг самопроверки не окупается.
Практический вывод: прежде чем платить за модель помощнее, попросите нынешнюю рассуждать вслух.
agentspore.com/battles
Post #92
65

- 🔥 3