Новости из мира AI и мои мысли про их влияние на экономику & бизнес
by Nikita Khudov,
Managing Partner @ strategai.ru,
ex - Bain, ex - Chief AIT Officer @ Sber
По вопросам сотрудничества: @gudyashka
Post #231
163

Собрал свой AI бенмчарк из 3000+ вопросов по вину и сравнил разные LLM по уровню винных знаний
Еще немного контента про мой проект Vinum ex Machina, который изучает потенциал AI в винной сфере. Сегодня расскажу про OenoBench — винный AI бенчмарк, с которого в целом этот проект и начался. Я часто обращался к разным LLM с вопросами по вину при подготовке к дегустациям, выборе вина, изучении академических материалов. И в какой-то момент задумался, а какая же модель лучше всех разбирается в вине? Комплексных и качественных уже готовых бенчмарков я не нашел, поэтому решил собрать свой.
Что было сделано:
- Сбор достоверных фактов. Я написал больше 70 кастомных парсеров, чтобы спарсить почти весь винный интернет: сайты ассоциаций и консорциумов, документы аппелласьонов, страницы виноделен и т.д. Но не думайте про меня плохо — я брал только те источники, которую разрешают использование своей информации в исследовательских целях, чтобы бенчмарк получился "легальным". На базе всех этих источников я собрал 50к+ атомарных фактов, которые мы уверенно можем считать истиной, по 6 винным сферам: виноградарство, виноделие, винный бизнес, винные регионы, сорта винограда, производители вина.
- Формирование датасета вопросов. Дальше я собрал большой мультиагентный пайплайн, который применяет 5 стратегий формирования вопросов, для превращения атомарных фактов в вопросы с выбором ответа. Изначальный список вопросов составил больше 10 000, но после прогона через мультиагентный аудит у нас осталось чуть больше 3 000 вопросов. Подробнее этот технический процесс описан в препринте.
- Оценка моделей. В конце я прогнал 16 моделей (как фронтирные модели, так и очень маленькие опенсорсные), чтобы оценить их общие результаты (% правильных ответов) и проанализировать различия: performance по разным винным доменам, cost efficiency, reasoning uplift, self-preference bias и т.д. Все эти различные статистики и их интерпретации я также подробно описал в своей научной статье.
Несколько интересных выводов:
- Высокие результаты моделей. Модели OpenAI оказались в лидерах, но можно увидеть, что результаты всех фронтирных моделей (топ-5) превышают 80% на всем датасете, а это очень сильный результат. Если не верите, то можете попробовать сами порешать эти вопросы (призыв к винным экспертам), но я уверен, что ни один человек не наберет даже больше 50%, так как вопросы умышленно очень сложные.
- Небольшое отставание open-source. Лучший результат из категории OSS-моделей показал DeepSeek-R1 (77%), но важно, что я не оценивал большие версии Qwen. Интереснее здесь другое — модели класса 70B (Qwen, Llama) показывают тоже достойные результаты на уровне около 67%. Так что вполне можно эти модельки дотюнить и получить очень кост-эффективного AI-сомелье.
- Wine business оказался слабой темой. Топовые модельки стабильно выбивают 80%+ на большинстве винных доменов, и даже около 90% по винным регионам и производителям, а вот в домене винного бизнеса лучший результат составил всего 66% неожиданно у GPT-5 mini. Это интересная аномалия, которую еще предстоит поисследовать.
Подробнее с результатами замеров можно ознакомиться на лидерборде на сайте проекта (весь контент доступен на русском и английском). А если вы любите читать научные статьи, то вот здесь на arXiv можно найти мой препринт. А вот здесь на Hugging Face я выложил весь датасет с вопросами-ответами. Бенчмарк пока далеко не идеален, и в нем есть много пробелов, которые я уже идентифицировал после публикации, так что я планирую дальнейшую активную работу над развитием бенчмарка, чтобы он стал еще полезнее 🍷
https://vinumexmachina.com/benchmarks/oenobench/
Еще немного контента про мой проект Vinum ex Machina, который изучает потенциал AI в винной сфере. Сегодня расскажу про OenoBench — винный AI бенчмарк, с которого в целом этот проект и начался. Я часто обращался к разным LLM с вопросами по вину при подготовке к дегустациям, выборе вина, изучении академических материалов. И в какой-то момент задумался, а какая же модель лучше всех разбирается в вине? Комплексных и качественных уже готовых бенчмарков я не нашел, поэтому решил собрать свой.
Что было сделано:
- Сбор достоверных фактов. Я написал больше 70 кастомных парсеров, чтобы спарсить почти весь винный интернет: сайты ассоциаций и консорциумов, документы аппелласьонов, страницы виноделен и т.д. Но не думайте про меня плохо — я брал только те источники, которую разрешают использование своей информации в исследовательских целях, чтобы бенчмарк получился "легальным". На базе всех этих источников я собрал 50к+ атомарных фактов, которые мы уверенно можем считать истиной, по 6 винным сферам: виноградарство, виноделие, винный бизнес, винные регионы, сорта винограда, производители вина.
- Формирование датасета вопросов. Дальше я собрал большой мультиагентный пайплайн, который применяет 5 стратегий формирования вопросов, для превращения атомарных фактов в вопросы с выбором ответа. Изначальный список вопросов составил больше 10 000, но после прогона через мультиагентный аудит у нас осталось чуть больше 3 000 вопросов. Подробнее этот технический процесс описан в препринте.
- Оценка моделей. В конце я прогнал 16 моделей (как фронтирные модели, так и очень маленькие опенсорсные), чтобы оценить их общие результаты (% правильных ответов) и проанализировать различия: performance по разным винным доменам, cost efficiency, reasoning uplift, self-preference bias и т.д. Все эти различные статистики и их интерпретации я также подробно описал в своей научной статье.
Несколько интересных выводов:
- Высокие результаты моделей. Модели OpenAI оказались в лидерах, но можно увидеть, что результаты всех фронтирных моделей (топ-5) превышают 80% на всем датасете, а это очень сильный результат. Если не верите, то можете попробовать сами порешать эти вопросы (призыв к винным экспертам), но я уверен, что ни один человек не наберет даже больше 50%, так как вопросы умышленно очень сложные.
- Небольшое отставание open-source. Лучший результат из категории OSS-моделей показал DeepSeek-R1 (77%), но важно, что я не оценивал большие версии Qwen. Интереснее здесь другое — модели класса 70B (Qwen, Llama) показывают тоже достойные результаты на уровне около 67%. Так что вполне можно эти модельки дотюнить и получить очень кост-эффективного AI-сомелье.
- Wine business оказался слабой темой. Топовые модельки стабильно выбивают 80%+ на большинстве винных доменов, и даже около 90% по винным регионам и производителям, а вот в домене винного бизнеса лучший результат составил всего 66% неожиданно у GPT-5 mini. Это интересная аномалия, которую еще предстоит поисследовать.
Подробнее с результатами замеров можно ознакомиться на лидерборде на сайте проекта (весь контент доступен на русском и английском). А если вы любите читать научные статьи, то вот здесь на arXiv можно найти мой препринт. А вот здесь на Hugging Face я выложил весь датасет с вопросами-ответами. Бенчмарк пока далеко не идеален, и в нем есть много пробелов, которые я уже идентифицировал после публикации, так что я планирую дальнейшую активную работу над развитием бенчмарка, чтобы он стал еще полезнее 🍷
https://vinumexmachina.com/benchmarks/oenobench/
- 🔥 3
- ❤ 2









