IT предприниматель и препод 🧑🏫
ex-ML лидер в Dodo Brands 🦤🍕
Прокачиваю людей в Data Science 🚀
Победитель Stepik Awards 🏆
Kaggle Expert 🤹♀️
Создатель mnogo-reels.ru и @big_llm_course
РКН https://clik.now/datafeeling
Алерон @Ale_v2
Post #1455
4.5K
Меняем правила игры в AI: обходим классические бенчмарки и ищем лучшие модели
Недавно работая над проектом чат-бота, моя команда студентов начала с классических бенчмарков - GLUE, SQuAD и прочих. На стандартных тестах всё выглядело круто, но в реальных условиях всё было не так радужно.
Пришлось менять подход. Вместо того чтобы гнаться за лидербордами, ребята начали комбинировать разные метрики. И тут их ждал сюрприз! Модели вроде DistilBERT и ALBERT реально выстрелили, особенно в понимании контекста и генерации ответов.
Вдохновленные этим, мы решили узнать, как другие ребята в AI выбирают свои модели. Запустили опрос среди ML-инженеров, дата-сайентистов, продактов и MLOps. Оказалось, что многие используют кастомные метрики, такие как F1-score и BLEU, что дало нам кучу идей для улучшения.
Так что, ребята, не бойтесь отходить от стандартов и учиться у сообщества. Это может привести к классным решениям!
➡️ Если есть желание внести вклад, то пройдите опрос и поделитесь своим опытом (7 минут): 👉 https://forms.gle/dDWeWaWbxhk6qsNL7
Репост = карма👼
Google Docs Как реально выбирают LLM для своего кейса в 2025 году? Бенчмарки переживают кризис: отдельные лидерборды всё хуже отражают реальную эффективность моделей в прикладных сценариях. Всё больше специалистов комбинируют метрики, тесты и косвенные сигналы, чтобы подобрать модель под свой конкретный кейс.
Мы проводим… Недавно работая над проектом чат-бота, моя команда студентов начала с классических бенчмарков - GLUE, SQuAD и прочих. На стандартных тестах всё выглядело круто, но в реальных условиях всё было не так радужно.
Пришлось менять подход. Вместо того чтобы гнаться за лидербордами, ребята начали комбинировать разные метрики. И тут их ждал сюрприз! Модели вроде DistilBERT и ALBERT реально выстрелили, особенно в понимании контекста и генерации ответов.
Вдохновленные этим, мы решили узнать, как другие ребята в AI выбирают свои модели. Запустили опрос среди ML-инженеров, дата-сайентистов, продактов и MLOps. Оказалось, что многие используют кастомные метрики, такие как F1-score и BLEU, что дало нам кучу идей для улучшения.
Так что, ребята, не бойтесь отходить от стандартов и учиться у сообщества. Это может привести к классным решениям!
➡️ Если есть желание внести вклад, то пройдите опрос и поделитесь своим опытом (7 минут): 👉 https://forms.gle/dDWeWaWbxhk6qsNL7
Репост = карма👼
- 👍 12
- 🔥 3






