TGViewer
OK ML OK ML @okmlai · 977 subscribers
Post #165 437
Обзор раздела Assistants - Inspect Evals

Inspect Evals — опенсорсный фреймворк для оценки LLM, разработанный UK AI Security Institute и Meridian Labs. Inspect Evals содержит 200+ бенчмарков. В этом посте разберем раздел Assistants — 100+ специализированных бенчмарков для оценки AI агентов. Это инструменты для оценки реальных возможностей агентов, а не какое-то там чат-ботство (начни с туториала). 

🟢 Базовый уровень

👨‍💻 BFCL оценивает способность LLM вызывать функции/инструменты. В целом, базовый навык для любого агента — уметь выбрать нужный инструмент и вызвать его правильно.
👨‍💻 BrowseComp — бенчмарк для агентов-браузеров. Простой, но непростой бенчмарк для оценки способности агентов просматривать веб. Состоит из вопросов, которые обычно требуют доступа в интернет для правильного ответа. 

🟡 Средний уровень

👨‍💻 GAIA — бенчмарк для общих AI ассистентов.  Предлагает реальные вопросы, требующие фундаментальных способностей (рассуждение, мультимодальная обработка, веб-просмотр, использование тулов). Концептуально простые для людей, но сложные для большинства AI. Есть 3 уровня сложности (level 1-3).
👨‍💻 Mind2Web — это по сути своей обобщённый агент для веб. Набор данных для разработки агентов, которые могут следовать инструкциям на естественном языке и выполнять сложные задачи на любом веб-сайте. Amazon, Facebook, Gmail — всё возможно.
👨‍💻 OSWorld тестирует способность агентов выполнять реалистичные задачи в симулированных компьютерных окружениях — комплексное взаимодействие с разными приложениями, файловой системой, настройками.

🔴 Продвинутый уровень

👨‍💻 AssistantBench тестирует способность AI агентов выполнять реальные задачи (полноценные, вроде "забронируй отель за X$ в районе Y, но учти ограничение Z»), требующие длительного времени на выполнение в веб-среде. 
👨‍💻 GDPval - Экономически ценные задачи. Измеряет производительность моделей (реальную экономическую ценность выполненной работы) на экономически ценных, реальных задачах в 44 различных профессиях.
👨‍💻 Sycophancy Eval создан для оценки лицемерия 👑. Видел, как модель пишет "Вы совершенно правы…" в ответ на явно ошибочное утверждение? Это то самое. Тест проверяет, будет ли модель соглашаться с пользователем просто ради угодливости.
👨‍💻 The Agent Company — самый сложный бенчмарк в этом разделе. Агент работает в полноценной компании, где нужно просматривать внутренние веб-сервисы, читать файлы, запускать код, координировать несколько инструментов одновременно. Это уже не шуточки-прибауточки, это серьёзно.

🙂
Остальные разделы репозитория
❗️Coding
‼️ Cybersecurity (надеюсь, в следующем посте расскажу про него)
‼️Safeguards
❗️Mathematics

Что дальше? Выбери 2-3 бенчмарка в зависимости от своих целей:

 🤎 Тестируешь базовый агент? Начни с BFCL
👧 Нужна общая оценка? GAIA
💯 Оцениваешь production-ready решение? The Agent Company
Если ты новичок в агентах 🆘 , то начни с туториала Inspect,
потом попробуй BFCL на простой модели, затем переходи на GAIA.

Все
😳
  • ❤ 11
  • 👍 6
  • 💯 4
  • 🔥 3
More from @okmlai
  1. Sep 23, 2026Зачем писать стилер, если у пользователя уже есть ИИ-ассистент с доступом ко всему? Патрик…
  2. Sep 21, 2026ИИ получил доступ к своим весам. ЧБД? 16 сентября Irregular опубликовала исследование agen…
  3. Sep 14, 202610 сентября Anthropic опубликовала Detecting and countering misuse of AI — отчёт о злоупот…
  4. Sep 11, 2026Репозиторий недели. Mantis разделить нельзя объединять 📬 У Google есть Mantis — набор нав…
  5. Sep 9, 2026Пароль сменили. Сессии закрыли. А чужие инструкции остались в памяти ИИ. Именно такой сцен…
  6. Sep 4, 2026AI-агенты начали действовать вне инструкций. Вот что нужно знать разработчикам ⤵️ Недавно…
Threads Profile ViewerView any public Threads profile without an account.Open ThreadLook →Writing with AI? Make it sound human.Metric37 rewrites AI drafts so they read naturally. Free AI detector, 1,500 words free.Try Metric37 →