TGViewer
Технозаметки Малышева Технозаметки Малышева @tsingular · 12.9K subscribers
Post #8696 741
Решил тут с Opus 5.5 на пару наколдовать бенч для ИИ-агентов.

Хотелось сделать что то реально сложное, ближе к повседневной работе.
В итоге получился такой вариант, - на входе транскрипт часового совещания по ИИ-трансформации вымышленной компании. На выходе агент должен самостоятельно сделать 4 согласованных между собой артефакта:
- тезисы с фактчекингом через веб
- протокол с поручениями, ответственными и сроками
- презентацию для руководства
- Excel с метриками и трекингом задач

Причём всё с жесткими проверками фактов и ссылок на источники.
В PPTX должен быть реальный извлекаемый текст, а не картинки вместо слайдов.
В XLSX — заданная структура, числовые метрики, статусы и тренды.
Но самое сложное, как мне казалось, - согласованность между файлами.

Если в протоколе задача назначена Орловой, то в презентации и Excel внезапный Петров, например, появиться уже не должен.

Если срок «не определён», агент не должен его придумывать и т.д.

Сделал отдельный валидатор и прогнал несколько популярных харнесов.

Результаты получились неожиданно высокими:
Claude — 100%
Cursor — 100%
Perplexity — 99%
Hermes — 93,3%

Причём ошибки уже интересные: теряются поручения между документами, путаются ответственные, числовые метрики записываются текстом, ссылки не протаскиваются между артефактами.

Кстати, решил добавить сюда и Ladcraft.
После Подмосковных Вечеров 4CIO про него многие спрашивают, - коллеги там проводили мастер-класс, поэтому было интересно прогнать его через тот же тест.

Получилось 97,2% за 5 минут, DeepSeek V4 Flash, около 515 тыс. токенов и 8 рублей.

И вот походу новый головняк с агентами, - а как сделать бенч, который для них будет сложным и на котором реально будут видны все их недостатки именно на ваших задачах.
Потому что когда почти все получают 90–100%, - скучно. тест не нагляден, ну справляются и справляются.

Сам тест, если кто хочет поиграться

А у вас как с этим? Что из последнего тестировали именно метриками на реальных задачах?
Делитесь в комментах.

#Ladcraft #бенчмарк #агенты #ИИ #harness
———
@tsingular
  • 🔥 7
  • 👍 4
  • ❤ 3
  • ✍ 1
  • ⚡ 1
More from @tsingular
  1. Sep 29, 2026Читая старую фантастику 😂 Прям про наш ИИ мир #юмор ------ @tsingular
  2. Sep 29, 2026🌟 OpenScience: персональный учёный с режимом автономных экспериментов Стартап Synthetic S…
  3. Sep 29, 2026Легендарная штука от Антропика: теперь создание любого приложения или бизнес-процесса это…
  4. Sep 29, 2026Paweł Huryn обновил свой бенчмарк BugHunt. Поскольку Sonnet 5.5 показал отвратительные рез…
  5. Sep 28, 2026а вот кстати вопрос, если Соннет 5.5 прыгнул на первую ступеньку к Опусу 5.5, то до какого…
  6. Sep 28, 2026В рейтинге AA Intelligence Index четыре из пяти самых умных моделей теперь от Claude. Мало…
Threads Profile ViewerView any public Threads profile without an account.Open ThreadLook →Writing with AI? Make it sound human.Metric37 rewrites AI drafts so they read naturally. Free AI detector, 1,500 words free.Try Metric37 →