TGViewer
Аналитик данных Аналитик данных @dataanlitics · 6.25K subscribers
Post #184 1.65K
💰GAMA-Bench

Принятие решений - сложный процесс, требующий различных навыков, что делает его хорошим тестов для оценки больших языковых моделей (LLM).

В данной работе исследователи изучали процесс принятия решений LLM через призму теории игр.

Существующие оценки в основном сосредоточены на случаях с двумя игроками, где LLM соревнуется с другим.

GAMA(γ)-Bench, новую структура для оценки способностей LLM в многоагентных средах через призму теории игр.

Он включает в себя восемь сценариев из классической теории игр и динамическую схему подсчета баллов, специально разработанную для количественной оценки производительности LLM.

γ-Bench очень гибкие настройки игры, что позволяет адаптировать систему подсчета баллов к различным параметрам игры, чтобы всесторонне оценить стратегии принятия решений

▪Статья: https://arxiv.org/abs/2403.11807
▪Код: https://github.com/CUHK-ARISE/GAMABench
  • ❤ 2
  • 👍 1
  • 🔥 1
More from @dataanlitics
  1. Sep 22, 2026👣 Google открыла исходный код AX, среды для запуска AI-агентов в продакшене. AX изолирует…
  2. Sep 15, 2026📘 Бесплатный 17-страничный PDF по Hidden Markov Models (HMM) Короткий материал от Stanfor…
  3. Sep 15, 2026🔥 Один из лучших обучающих курсов на StepiK по SQL SQL можно знать годами и всё равно тер…
  4. Sep 10, 2026✔️ Hugging Face запустила агента для ML-экспериментов Платформа встроила в свой чат-бот от…
  5. Aug 19, 2026Как нормально тестировать AI-агента, если правильный ответ ещё ничего не доказывает У обыч…
  6. Aug 16, 2026⚡️ Harness Engineering - полный курс на русском Как заставить AI-агента писать код надёжно…
Threads Profile ViewerView any public Threads profile without an account.Open ThreadLook →Writing with AI? Make it sound human.Metric37 rewrites AI drafts so they read naturally. Free AI detector, 1,500 words free.Try Metric37 →