TGViewer
Машиннное обучение | Наука о данных Библиотека Машиннное обучение | Наука о данных Библиотека @machinelearning_books · 16.9K subscribers
Post #1282 2.04K
В свежей работе из Стэнфорда показывают неожиданный, но очень важный вывод: многие популярные LLM-бенчмарки дают искажённую картину.

Причина проста, большинство тестов используют один фиксированный промпт. Но разные модели сильно зависят от формулировки задачи.

Поэтому итоговая оценка часто показывает не «насколько модель сильная», а «насколько удачно ей подошла конкретная формулировка».

Авторы предлагают посмотреть на это иначе: что будет, если дать каждой модели шанс использовать лучший промпт?

Для экспериментов они связали HELM (suite для оценки моделей) и DSPy (инструмент для построения структурированных промптов).
Пробовали несколько стилей:
- простой короткий ответ
- ответ с пошаговыми рассуждениями
- примеры + поиск лучшего промпта

Пошаговые рассуждения дали основной прирост. Модель сначала пишет ход мысли, а потом ответ - и это заметно повышает точность.

Результаты на четырех моделях и семи бенчмарках (общих и медицинских):

- структурированные промпты повышают точность примерно на 4%
- в некоторых случаях меняют порядок моделей в рейтинге
- поиск оптимальных промптов даёт небольшой прирост, но тратит много токенов
- основной эффект идёт именно от chain-of-thought

Главный вывод:
справедливая оценка моделей должна тестировать их не на одном фиксированном промпте, а на их лучшей версии задачи, особенно с цепочкой рассуждений.

Paper: "Structured Prompting Enables More Robust, Holistic Evaluation of Language Models"
arxiv.org/abs/2511.20836
  • ❤ 8
  • 🔥 3
  • 👍 2
More from @machinelearning_books
  1. Sep 29, 202611 бесплатных книг по AI и Machine Learning, которые можно читать онлайн или скачать 📚 По…
  2. Sep 29, 2026Как сегодня строят рекомендательные системы — и что будет с ними завтра? 30 сентября собир…
  3. Sep 28, 2026💼 ИИ всегда поддерживает подростка. А помогает ли это ему взрослеть? В статье на arXiv ис…
  4. Sep 26, 2026📘 195 страниц математики, чтобы понять, как устроен Generative AI Вышла The Little Book o…
  5. Sep 23, 2026Математика глубокого обучения в одном учебнике 737 страниц о математических основах Deep L…
  6. Sep 22, 2026Бесплатная книга по Physics-based Deep Learning 461-страничный учебник о применении глубок…
Threads Profile ViewerView any public Threads profile without an account.Open ThreadLook →Writing with AI? Make it sound human.Metric37 rewrites AI drafts so they read naturally. Free AI detector, 1,500 words free.Try Metric37 →