Очень занятный блогпост выпустили знакомые стажеры с MATS-а
Задача была проверить вкус LLM-ок к правильному ресерчу (ну то есть на сколько авторесерч способен на написание статей)
Сетап следующий:
💛они отобрали свои любимые статьи (4)
💛взяли Opus попус и отобрали им утверждения начальных гипотез, которые стоит замаскировать, чтобы понять прийдет ли LLM, которую они тестируют к таким же утверждениям
💛Потом они опусом же оценивают на сколько отличаются предикты от того, что сделали люди в статье и выдают табличку метрик сравнения
Очень интересный эксперимент, но на мой взгляд имеет ограничения и лики
💛Во-первых не понятно, как оценила бы модель другого семейства (что забавно, у них не выстрелил лик с тем, что они тестируют опусом себя же, но может быть они не допроверили что было бы, если бы тестировали гпт гпт-шкой))
💛Во-вторых, они буквально все делают опусом, что кажется дает потенциальный лик в артефактах, которые они дальше передают
💛В-третьих, они не учитывают, что эти статьи могли быть в обучении LLM-ок, которые тестируют
Короче, резы все равно очень забавные, фабля остался в аутсайдерах в таком сетапе😏
Post #697
3.59K

- ❤ 2
- 🔥 2