Это график точности и стоимости выполнения задач из тестов TypeSafe. Чем точка выше и левее, тем лучше: больше правильных решений за меньшие деньги.
Вертикальная ось показывает точность. У Jev около 68%.
Горизонтальная ось показывает стоимость одного задания в долларах. Шкала логарифмическая: каждый следующий крупный шаг вправо означает увеличение цены в 10 раз.
Ромбы обозначают задачи, разбитые программой на отдельные проверки. Кружки означают, что всю задачу описали модели одним промптом.
Цвет обозначает поставщика модели. Розовая точка слева это Jev.
Jev здесь самая дешёвая, но не самая точная. У Sol около 74%, у Opus 5 около 73%. Самое показательное сравнение с Sonnet 5: одинаковые 67,8% точности, при этом Jev примерно в 294 раза дешевле и в 195 раз быстрее. С Terra точность тоже практически совпадает, выигрыш составляет примерно 76 раз по стоимости и 25 раз по скорости.
Ещё раз: Jev не предназначена для написания текстов или кода, как ChatGPT. Она анализирует информацию и выдаёт оценки: есть ли ошибка, насколько срочный запрос, какое действие выбрать. Поэтому график сравнивает модели именно в таких задачах, а не по качеству текстов или программирования.
Post #4840
1.63K
Futuris ⚡️⚡️⚡️Похоже происходит новый ChatGPT момент - Диогу Алмейда, один из людей, стоявших у истоков ChatGPT, соавтор InstructGPT - исследования, которое помогло заложить основу ChatGPT, вместе с командой TypeSafe спустя 2 года в стелсе выкатил Jev. Разработчики…

- 🔥 15
- ❤ 4
- 👍 1
- 🤡 1