Господа!
У нас отличная новость!
Десятый наш бенчмарк из 12 новых бенчмарков, опубликованных за последние 2 года, достиг 1 места в своей категории на сайте PapersWithCode! 🏆🥇🎉🥇🏆
С чем я горячо поздравляю его автора Алексея Брынцева 👏👏👏, всегда очень здорово, когда результат научной работы где-то лучший и дает вклад в развитие open source алгоритмов (в данном случае - в их рейтингование - тоже кусок работы).
Заметим, что большинство наших бенчмарков с закрытым датасетом (т.е. на нем нельзя заточиться), а ровно месяц назад вышла шикарная пародийная статья Pretraining on the Test Set Is All You Need о том, как можно легко получить SOTA, подмешав в тренировочную выборку часть тестовой при обучении LLM (большой языковой модели). Интересно, что статью уже процитировали в статье о бенчмаркинге юридических знаний LLM LawBench: Benchmarking Legal Knowledge of Large Language Models. В нашей области наблюдаем то же самое - результаты на других бенчмарках не воспроизводятся очень часто. Мы сейчас стараемся не раскрывать тестовый датасет, что снижает цитирования и популярность. Но пока держимся! И даже в топе! )
(намекая на прошлый пост) Всем везения с вашими результатами за время обучения! )))
Post #191
1.18K

- 🔥 16