TGViewer
Приближаем сингулярность Приближаем сингулярность @building_singularity · 887 subscribers
Post #69 1.13K
Честный замер LLM на способность следовать инструкциям

Пара проблем в современных бенчмарках для LLM'ок:
- неточный замер используя GPT-4 (часто замеряются модели, которые GPT-4 и дистиллировали :D)
- огромный претрейн датасет может пересекаться или иметь очень похожие примеры на тестовый (метрики завышаются)

Про второе можно почитать в этом блогпосте от lmsys, проблема важная.

А частично про первое ресерчеры из гугла написали прикольную статью: Instruction-Following Evaluation for Large Language Models

Они предложили использовать verifiable instructions: инструкции (промпты), выполнение которых легко проверить кодом.

Они выделили 25 типов таких заданий (см. картинку 1): выдать ответ в формате json / написать ровно 2 абзаца / ровно 3 пункта / закончить такой то фразой / etc. Конкретные примеры на картинке 2.

Эти инструкции проверяют именно умение instruction following и не зависят от внешнего оценивания типа GPT-4.

Они даже выложили код 👏
Можно скриптом в 1 строчку оценить результаты вашей собственной LLM'ки.

Идея классная. Выглядит несложным для любого домена написать таких примеров и автоматически замерять, behavioural testing кажется называется)

Ещё они замерили свой гугловый PaLM 2 (small) против GPT-4 (картинка 3) и проиграли ему везде =)
Интересно почему они сравнивали со small моделью. Ваши гипотезы?)
  • 🔥 14
  • 👍 5
  • ❤ 2
  • 🤔 1
More from @building_singularity
  1. Aug 8, 2025И забавно, и грустно…
  2. Jul 22, 2025Последние 5 месяцев работаю в стартапе Slingshot AI. И сегодня мы публично анонсируем наш…
  3. Nov 29, 2024H100 девешле A100 Я уже писал про тренд на уменьшение цены инференса LLM. Недавно на работ…
  4. Nov 24, 2024Big life update 🚀 Были довольно напряжные и загруженные несколько месяцев, но всё это ока…
  5. Sep 3, 2024Andrew Ng про цену LLM инференса За последний год цена на лучшую модель OpenAI уменьшилась…
  6. Jul 31, 2024У нас тут в Ex-Human появилась классная вакансия на Senior NLP инженера ⚡ https://botifyai…
Threads Profile ViewerView any public Threads profile without an account.Open ThreadLook →Writing with AI? Make it sound human.Metric37 rewrites AI drafts so they read naturally. Free AI detector, 1,500 words free.Try Metric37 →