Прочитал целых 4 свежих работы о том, как современные модели реагируют на инструкции. И половина наших шпаргалок плохо состарилась.
Фраза «думай пошагово» в большом тесте IBM проиграла обычному вопросу с коротко заданной ролью. В другом эксперименте модели заметно хуже держали много требований сразу: при 8 правилах шанс выполнить все восемь составил 5,7%. 🧮
Ещё веселее с вопросами, в которых ответ уже подсказан. Одно слово вроде «правда?» или «может быть?» меняло склонность моделей соглашаться с пользователем. Так что нейтральная постановка задачи полезнее таких заигрываний. 🧠
И с нашей путеводной звездой - примерами - тоже не всё очень. В работе EPFL, Apple и Mistral модель показала лучший результат на математических задачах без нескольких готовых примеров рассуждения. Пусть думают сами, железяки.
Короче, меньше ритуальных заклинаний. Чёткая задача, нужный контекст, несколько требований и проверка результата сейчас полезнее промпта на три экрана.
Написано человеком.
Подпишись в Telegram | Дзен | Max 🧠
TATSY.PRO
Post #313
107
- 👍 4
- ❤ 2
- 🔥 1