TGViewer
LLM под капотом LLM под капотом @llm_under_hood · 29.3K subscribers
Post #190 2.36K
Бенчмарки новых GPT-4 Turbo и GPT-3.5!

Новые версии моделей стали дешевле 🤑, свежее 😃 и глупее 🤪 своих предыдущих версий.

Как читать бенчмарк? Колонки оценивают модели в категориях:
- Code - понимание, разбор и написание кода
- CRM - работа с описаниями и свойставами товаров на маркетплейсах
- Docs - работа с документами, их частями и базами знаний
- Integrate - интеграция со сторонними API, форматами данных и БД
- Marketing - чтение, оценка и написание маркетинговых текстов
- Reason - сложные задачки в рамках контекста.

- Cost - примерная стоимость работы (пропорционально бенчмарку). Для локальных моделей - считаем стоимость аренды необходимого GPU в популярном облаке.
- Speed - сколько запросов в секунду, с batch_size=1 при запуске с HF transformers.

Бенчмарк - закрытый, основан на тестах и промптах из рабочих продуктов и сервисов.

Более детальное описание и примеры evals есть в лабах: Trustbit LLM Benchmark (лабы открыты подписчикам бесплатной рассылки ML Under the Hood)

Ваш, @llm_under_hood 🤗
  • ❤ 12
  • 👍 5
  • 😁 3
  • 🔥 2
More from @llm_under_hood
  1. Sep 24, 2026Период полураспада софта - 3 месяца Я сейчас возвращаюсь к сайту BitGN, чтобы начать подго…
  2. Sep 23, 2026Post #947
  3. Sep 22, 2026GPT-6 Sol и Luna - бенчмарк цены, качества и скорости А еще Opus 5.5 и Astra 6 (medium). В…
  4. Sep 22, 2026Доклад про DDD + AI в проектах (Berlin, 2025, EN) Не прошло и года с прошлого KanDDDinsky,…
  5. Sep 22, 2026LLM Benchmark Jev - топ для простых задач Jev - это новая LLM модель, в которую встроили S…
  6. Sep 21, 2026Давно я не публиковал эссе. Вот новое. We never wanted human code. Ваш, @llm_under_hood 🤗
Threads Profile ViewerView any public Threads profile without an account.Open ThreadLook →Writing with AI? Make it sound human.Metric37 rewrites AI drafts so they read naturally. Free AI detector, 1,500 words free.Try Metric37 →