Готова новая версия продуктовых бенчмарков для LLM! За каждой категорией - набор тестов на основе реальных продуктовых кейсов. Скажем, marketing - это ассистент маркетолога, а CRM - это системы исправления ошибок в каталогах продуктов.
GPT-4 лидирует, как и ожидаемо. Но у него из конкуренции только GPT-3.5 и модели меньше 13B. Это все то, что я могу запускать на своем лаптопе (как описано тут).
LLM модели покрупнее - на очереди. Как будут результаты - выложу сюда дополненный бенчмарк.
Ваш, @llm_under_hood 🤗
Post #46
1.11K

- 🔥 8
- 👍 1