Продолжаю развивать Agent Anvil после победы в OpenAI Discord Dev Challenge 🥇
Проект постепенно растёт из локального CLI для eval’ов в небольшой набор инструментов для проверки AI-агентов.
Сделал отдельный публичный leaderboard:
https://github.com/agent-axiom/agent-anvil-leaderboard
Идея проста: ты прогоняешь Agent Anvil у себя локально или в CI, экспортируешь результат, отправляешь PR и попадаешь в общий leaderboard. При этом raw traces и чувствительные данные остаются у тебя, наружу уходят только компактные метрики и проверяемые хэши.
Основной репозиторий тоже продолжает развиваться:
https://github.com/agent-axiom/agent-anvil
Там уже есть trace-aware evals, policy checks, repair plans, GitHub Actions integration, MCP tool-safety audit, benchmark artifacts и экспорт для leaderboard.
Цель всё та же: помогать разработчикам ловить проблемы, которые обычные eval’ы по финальному ответу часто пропускают, например:
🔘неправильный tool
🔘опасный порядок вызовов
🔘кривые аргументы
🔘отсутствие уточняющего вопроса
🔘нарушение policy
Если тебе интересна тема eval’ов для AI-агентов — буду рад фидбеку, идеям, сабмитам в leaderboard и звезде на GitHub 🙂
#dev #ai #agentic #agentanvil
Post #1071
368
Agentic Engineer Сегодня подвезли результаты соревы, удалось победить 🥇 Справедливости ради участников было немного, но всё равно приятно 🙂 Спасибо OpenAI team и community за челлендж, фидбек и сильные проекты участников. Продолжаю развивать Agent Anvil дальше. https:/…GitHub GitHub - agent-axiom/agent-anvil-leaderboard: Public Agent Anvil leaderboard submissions and generated index Public Agent Anvil leaderboard submissions and generated index - agent-axiom/agent-anvil-leaderboard
- ❤🔥 4