TGViewer
we all design 👑 we all design 👑 @wealldesigners · 1.06K subscribers
Post #1655 468
Выделила время потестировать Jev от Typesafe.

Взяла открытую базу рецептов TheMealDB, все блюда с фотографиями. Для каждого блюда отправила в Jev текст рецепта и шесть вопросов. Он оценил каждое блюдо по пяти шкалам: быстро, дёшево, полезно, впечатлит гостей, просто для новичка. Решил, полноценное ли это блюдо, и сам отсеял десерты, соусы и хлеб. К каждой оценке приложил уверенность, так что видно, где он сомневается.

Весь прогон занял чуть больше минуты, обошлось всё в $0.0455.

Сделала два прогона, и они дали чуть разные оценки. В среднем оценка гуляет на несколько сотых по шкале от нуля до четырёх. Если выставить все ползунки на пять, первые места отличаются на доли балла, и соседние блюда меняются местами между прогонами.

Лучше, наверное, добавлять большую градацию шкалы, или выбирать шкалы, по которым блюда сильнее различаются, ну или делать несколько прогонов и и вычислять среднее.

@wealldesigners
  • 🔥 11
  • ❤ 1
  • 🤔 1
More from @wealldesigners
  1. Sep 24, 2026В анонсе opus 5.5 был интересный график, как coding-модели ведут себя при разном effort. И…
  2. Sep 24, 2026Во вторник вышли claude opus 5.5 и openai sol 6. Изначально вообще не было от них каких-то…
  3. Sep 22, 2026Какой-то невероятный эксперимент показали runway labs с responsive generative video interf…
  4. Sep 16, 2026Если используете llm внутри приложений и сервисов, которые собираете, для принятия решений…
  5. Sep 14, 2026На прошлой неделе у меня несколько раз спрашивали про классные визуальные референсы и где…
  6. Sep 11, 2026Кстати, попробовала закинуть в claude скриншоты и наработки и попросила собрать из них дин…
Threads Profile ViewerView any public Threads profile without an account.Open ThreadLook →Writing with AI? Make it sound human.Metric37 rewrites AI drafts so they read naturally. Free AI detector, 1,500 words free.Try Metric37 →