contra labs всерьез изучает как измерять креативный потенциал и вкус llm-моделей, для этого они создали свою уникальную методологию, которая оценивает результат по нескольких шкалам.
они ввели параметр где эксперты (пишут что 1,5 млн, но исследования на тысчах, а не миллионах) согласны и где не согласны, чтобы разделить хорошее и плохое и показывать это на разных шкалах — ведь дизайнеры редко берут весь результат llm, они скорее делают несколько итераций, где оставляют хорошее и отбрасывают плохое, на основе собственного вкуса, конечно.
кроме этого, contra измеряли модели на нескольких стадиях кретивного процесса — ideation, mockup и refinement. и на каждой стадии очень разные результаты, например, на стадии ideation veo 3.1 в домене video generation занимает первое место, а grok imagine — последнее, а на стадии refinement ровно наоборот.
очень похожая ситуцация в генерации картинок, например китайская seedream оч хороша в редактировании мелких деталей, но на стадии первичной генерации сильно проигрывает.
это похоже на черновик того как в будущем мы будем оценивать креативный потенциал разных моделей, но эти рейтинги в рельных задачах не очень полезны. а вот для тех кто делает продукты это очень полезный материал для рефлексии и даже для продуктовых рещений. например, для оркестрации моделей — мы можем использовать разные модели на разных стадиях креативного процеса и добиваться оптимальных результатов.
ну и традиционно — поддержите в линке
Post #241
713





- ❤ 12