И дальше про LLMs evaluating LLMs: на днях вышел пейпер, где авторы собрали 4550 заданий из 30 курсов Mathematics and Electrical Engineering and Computer Science (EECS) в MIT. Эти 30 курсов достаточно сдать, чтобы выпуститься, собственно, бакалавром
И вот они говорят, что ChatGPT решает 30% этих задач, а GPT-4 делает идеальный скор 100% (и получает диплом with honors)
Но есть ✨ нюанс ✨: как же получали скоры того, насколько хорошо пройдены тесты? Особенно с учетом того, что в датасете большая часть вопросов были с открытым ответом или на программирование? Ответ прост – оценить решения GPT-4 попросили саму GPT-4. Human evaluation в статье нет
Еще GPT-4 «решала» задания в очень приятных условиях: при генерации ответов в промте использовали few-shot (давали 3 похожих вопроса из датасета вместе с решением – то есть при решении она видела человеческие ответы на ту же тему), chain-of-thought, self-crtique и expert prompting, применяя все эти методы поочередно, и без ограничения на число итераций
В Твиттере конечно не все долистали до эвалюации, потому там очередная волна «this is a game changer»
Post #959
2.51K

- 🤡 46
- ❤ 7
- 👍 2
- 🤔 2
- 🥴 1