TGViewer
Datalytics Datalytics @datalytx · 8.82K subscribers
Post #1325 3.32K
На Хабре вышла статья об оценке умений LLM-моделей, и это интереснее, чем может показаться на первый взгляд.

Традиционно считается, что интеллект LLM можно измерить как человеческий — с помощью тестов и экзаменов. Отсюда и появились многочисленные академические бенчмарки. Но эти тесты упускают главное: LLM создаются не для решения ЕГЭ, а для реальных задач — ведение диалога, перевод, суммаризация, брейншторминг. К тому же все бенчмарки подвержены протечкам данных — тестовые задания попадают в тренировочные наборы, искажая результаты.

LLM-модели не имеют той внутренней картины мира, которая есть у людей. Для нас вопрос «стоит ли брать кирпичи на пляж» звучит абсурдно, а для модели этот ответ совсем не очевиден. Именно поэтому появились специальные бенчмарки на «здравый смысл» — COPA, PIQA, OpenBook, WinoGrande. Но и они не отражают реальной применимости модели в бизнес-задачах.

Автор статьи, специалист из Яндекса, рассказал, что компания создаёт внутренние бенчмарки под конкретные задачи и привлекает AI-тренеров — специалистов из разных областей для глубокой оценки ответов модели. Это дороже и сложнее с точки зрения систем контроля качества, но позволяет понять реальную ценность LLM.

Отдельного внимания заслуживает LMSYS Chatbot Arena, где пользователи сами оценивают ответы моделей по принципу шахматного рейтинга. Казалось бы, отличное решение, но и здесь есть подводные камни — респонденты часто предпочитают длинный красиво оформленный ответ короткому, даже если он неправильный.

Самый важный вывод: универсального решения для оценки LLM просто нет. И это не баг, а фича — приходится постоянно комбинировать методы, анализировать данные и проверять, насколько модель действительно полезна в реальных задачах. Оценка практической ценности ИИ оказалась не менее сложной задачей, чем его создание.
More from @datalytx
  1. Sep 29, 2026Команда DevCrowd запустила ежегодное исследование специалистов по работе с данными.* В это…
  2. Sep 28, 2026📊 Аналитик данных: системные знания для профессионального роста 14 октября на Факультете…
  3. Sep 15, 2026⚡ Почему аналитики данных так востребованы и как стать аналитиком в 2026 году? Большинство…
  4. Sep 14, 2026Остались считанные дни провидение разборов ❗️❗️ 👉 https://t.me/+bkZhvVkXSHVkYmUy
  5. Sep 11, 2026Айтишники, горит вакансия ❗️ Позиция: Дата-аналитик Компания: Яндекс.Маркет Зарплата: 200,…
  6. Sep 11, 2026⚡️Вышло новое исследование «AI в BI Круг Громова 2026»! ИИ в бизнес-аналитике выходит за п…
Threads Profile ViewerView any public Threads profile without an account.Open ThreadLook →Writing with AI? Make it sound human.Metric37 rewrites AI drafts so they read naturally. Free AI detector, 1,500 words free.Try Metric37 →