TGViewer
AI4Dev — AI for Development AI4Dev — AI for Development @llm4dev · 5.3K subscribers
Post #147 1.25K
Уже завтра, 3 октября, в 12:00 доктор технических наук Владимир Крылов расскажет о бенчмарках для LLM в своей новой лекции. Рассмотрим современные методы оценивания способностей больших языковых моделей решать различные задачи.

Вы узнаете:
🔸какие бенчмарки для определения лучших моделей сейчас наиболее типичны;
🔸как применяется шахматный рейтинг ELO для бенчмаркинга;
🔸что такое Leaderboard Arena;
🔸какие частные, но важные бенчмарки применяются для проблемно ориентированных моделей и мультимодальных LLM.

Подключайтесь! В этот раз будем транслировать не только на наш YouTubе, но и прямо здесь — в этот телеграм-канал. Выбирайте, где вам удобнее ☺️
  • 👍 17
  • 👏 1
More from @llm4dev
  1. Sep 25, 2026Почему наука автоматизируется неравномерно? О пределах исследовательского harness рассказа…
  2. Sep 25, 2026Live stream finished (58 minutes)
  3. Sep 25, 2026🔴 Мы в эфире! ИИ уже помогает искать уязвимости. Вопрос в том, кто первым найдёт слабое м…
  4. Sep 25, 2026Live stream started
  5. Sep 17, 2026Live stream finished (1 hour)
  6. Sep 17, 2026Live stream started
Threads Profile ViewerView any public Threads profile without an account.Open ThreadLook →Writing with AI? Make it sound human.Metric37 rewrites AI drafts so they read naturally. Free AI detector, 1,500 words free.Try Metric37 →