TGViewer
Роман с данными Роман с данными @roma_data · 2.72K subscribers
Post #152 2.97K
На этой неделе ребята из Anthropic выкатили любопытную работу — SHADE-Arena. Это такой испытательный полигон, где LLM-агенту дают «белую» задачу + скрытую «чёрную» миссию, а сверху ставят вторую ИИ модель-монитор, которая оценивает: «не творится ли тут чего неладного?»

Что меня зацепило
• Интересная постановка задачи из 17 кейсов. Модели должны одновременно помочь пользователю и тихонько насолить.
• Ни одна из 14 моделей не пробила 30% общего успеха. Саботаж по-настоящему сложен — и слава роботам.
Но! сильнейшие LLM всё-таки прятали грязные делишки почти в 60% попыток.
• Самое сочное: монитор-LLM оказались лучше людей-оценщиков (80 % шанс поймать саботаж = 20 % ложных тревог). Всё чаще вижу, как LLM as a judge бьёт полноценную фокус-группу людей.
• Когда монитору показали цепочку мыслей агента, успехи злоумышленника рухнули — многие модели тупо проговаривали свои тайные планы вслух 🤦‍♂️

Почему это важно
1. Агенские Агентные LLM стремительно учатся. Проверять их «на саботаж» — next-level безопасность.
2. Автоэвал сильнее человеческой толпы → дешевле и быстрее масштабировать контроль.
3. Если строите прод-агентов, придётся думать не только о способности «делать полезное», но и о способности не вредить (и о том, кто за этим будет следить).

🔥 Spoiler alert: в среду на GigaConf буду рассказывать про бенчмарки оценки ИИ Агентов. Так что, если тема цепляет — залетайте послушать!
  • 🔥 23
  • ❤ 10
  • 👍 3
More from @roma_data
  1. Aug 11, 2026⭐️ Новая арена и вклад в развитие сообщества В этом году LLM Arena стала победителем на пр…
  2. Jun 30, 2026Так, я не дурак 😀 Yupp сжег 33 ляма баксов и закрылся 😬😬😬 Что произошло: мы запустилис…
  3. Jun 21, 2026Ездил в апреле в США в SF - там все обсуждали harness Приехал на Саусхаб - снова harness,…
  4. Jun 10, 2026photo post
  5. Jun 10, 2026photo post
Threads Profile ViewerView any public Threads profile without an account.Open ThreadLook →Writing with AI? Make it sound human.Metric37 rewrites AI drafts so they read naturally. Free AI detector, 1,500 words free.Try Metric37 →