Post #22556
5
И опять про бенчмарки. Это самое крутое, что было в истории человечества. Создана лаборатория для биологических, химических и материаловедческих исследований под управлением LLM, и в ней запущен бенчмарк SciUniverse, который сравнил умения моделей вести исследование – выяснилось, что с теорией с (разработкой экспериментов) у них всё хорошо, а вот в лаборантской деятельности они лажают, что и отражается на результатах бенчмарка. Мне осталось неясно только одно, почему использовался уровень усилий xhigh, а не max, по опыту других бенчмарков, можно предположить, что у моделей это самый лажовый уровень
