TGViewer
Приближаем сингулярность Приближаем сингулярность @building_singularity · 887 subscribers
Post #103 2.06K
LiveBench - честный замер LLM

ЛеКун и Abacus.ai зарелизили 960 примеров для объективной оценки LLM.

Полезно как для замера своих LLM'ок, так и для выбора лучшей из имеющихся для своих нужд.

Какие обычно есть проблемы у замеров?

🔹 Contamination - данные из бенчмарка присутствуют в обучающем датасете
🔹 LLM-as-a-judge неточен: GPT4 предпочитает ответы от других моделей OpenAI, аналогично с Claude и тд.
🔹Human-as-a-judge дорого и долго; а также неточно, потому что вопросы очень сложные

🔸Первую проблему LiveBench фиксит тем, что будет выкладывать новые сложные вопросы каждый месяц

🔸Последние две тем, что в LiveBench есть точные ответы, которые можно проверить на соответствие (типа Verifiable Instructions)

На скрине категории и лидерборд: OpenAI > Anthropic > Google, пока что.

💗 Всё в открытом доступе: данные и код для замера

@building_singularity
  • 🔥 17
  • ❤ 3
  • 👍 2
  • 🤔 1
More from @building_singularity
  1. Aug 8, 2025И забавно, и грустно…
  2. Jul 22, 2025Последние 5 месяцев работаю в стартапе Slingshot AI. И сегодня мы публично анонсируем наш…
  3. Nov 29, 2024H100 девешле A100 Я уже писал про тренд на уменьшение цены инференса LLM. Недавно на работ…
  4. Nov 24, 2024Big life update 🚀 Были довольно напряжные и загруженные несколько месяцев, но всё это ока…
  5. Sep 3, 2024Andrew Ng про цену LLM инференса За последний год цена на лучшую модель OpenAI уменьшилась…
  6. Jul 31, 2024У нас тут в Ex-Human появилась классная вакансия на Senior NLP инженера ⚡ https://botifyai…
Threads Profile ViewerView any public Threads profile without an account.Open ThreadLook →Writing with AI? Make it sound human.Metric37 rewrites AI drafts so they read naturally. Free AI detector, 1,500 words free.Try Metric37 →