TGViewer
False Positive False Positive @falseposi · 1.12K subscribers
Post #138 1.29K
Привет!

На грядущей РГ снова поговорим про бенчмарки. На этот раз про оценку безопасности кода, который пишут LLM и всеми любимые coding-агенты.

Залезем под капот SecCodeBench-V2 от компании Alibaba и выясним:

- как устроены задачи и их автоматическая оценка через песочницу,
- зачем бенчмарку понадобился подход LLM-as-a-judge,
- насколько честно сравнивать модели по итоговому скору,
- попрепарируем датасет руками: несостыковки, баги и недочеты,
- а также покажем замеры качества на тройке-другой open-source моделей.

А еще попытаемся ответить на вопрос, можно ли доверять бенчмарку, который разработчик модели сделал для оценки собственной модели?)

Встречаемся как обычно в пятницу в 15:00 по МСК.

Ссылка на встречу: Link

#reading_group #benchmark
  • 🔥 8
  • 👍 6
  • 😁 2
  • ✍ 1
More from @falseposi
  1. Sep 25, 2026False Positive pinned a photo
  2. Sep 25, 2026Никто: Абсолютно никто: ИИ-агент, увидев PowerShell на сервере: 🚨🚨🚨 ВЗЛОМ 🚨 ВСЁ ПРОПАЛ…
  3. Sep 24, 2026Попробовать атакующих агентов кстати сейчас самим можно и в лабах и на CTF. А как повторит…
  4. Sep 24, 2026Выкладываем запись RG Глеба Кумичева про то как агенты хакнули HF #reading_group #openai #…
  5. Sep 18, 2026Мы начинаем🤗
  6. Sep 17, 2026Всем привет! В эту пятницу попробуем разобраться что из себя представляет автономный агент…
Threads Profile ViewerView any public Threads profile without an account.Open ThreadLook →Writing with AI? Make it sound human.Metric37 rewrites AI drafts so they read naturally. Free AI detector, 1,500 words free.Try Metric37 →