TGViewer
LLM под капотом LLM под капотом @llm_under_hood · 29.3K subscribers
Post #46 1.11K
Готова новая версия продуктовых бенчмарков для LLM! За каждой категорией - набор тестов на основе реальных продуктовых кейсов. Скажем, marketing - это ассистент маркетолога, а CRM - это системы исправления ошибок в каталогах продуктов.

GPT-4 лидирует, как и ожидаемо. Но у него из конкуренции только GPT-3.5 и модели меньше 13B. Это все то, что я могу запускать на своем лаптопе (как описано тут).

LLM модели покрупнее - на очереди. Как будут результаты - выложу сюда дополненный бенчмарк.

Ваш, @llm_under_hood 🤗
  • 🔥 8
  • 👍 1
More from @llm_under_hood
  1. Sep 24, 2026Период полураспада софта - 3 месяца Я сейчас возвращаюсь к сайту BitGN, чтобы начать подго…
  2. Sep 23, 2026Post #947
  3. Sep 22, 2026GPT-6 Sol и Luna - бенчмарк цены, качества и скорости А еще Opus 5.5 и Astra 6 (medium). В…
  4. Sep 22, 2026Доклад про DDD + AI в проектах (Berlin, 2025, EN) Не прошло и года с прошлого KanDDDinsky,…
  5. Sep 22, 2026LLM Benchmark Jev - топ для простых задач Jev - это новая LLM модель, в которую встроили S…
  6. Sep 21, 2026Давно я не публиковал эссе. Вот новое. We never wanted human code. Ваш, @llm_under_hood 🤗
Threads Profile ViewerView any public Threads profile without an account.Open ThreadLook →Writing with AI? Make it sound human.Metric37 rewrites AI drafts so they read naturally. Free AI detector, 1,500 words free.Try Metric37 →