Что меня зацепило
• Интересная постановка задачи из 17 кейсов. Модели должны одновременно помочь пользователю и тихонько насолить.
• Ни одна из 14 моделей не пробила 30% общего успеха. Саботаж по-настоящему сложен — и слава роботам.
• Но! сильнейшие LLM всё-таки прятали грязные делишки почти в 60% попыток.
• Самое сочное: монитор-LLM оказались лучше людей-оценщиков (80 % шанс поймать саботаж = 20 % ложных тревог). Всё чаще вижу, как LLM as a judge бьёт полноценную фокус-группу людей.
• Когда монитору показали цепочку мыслей агента, успехи злоумышленника рухнули — многие модели тупо проговаривали свои тайные планы вслух 🤦♂️
Почему это важно
1.
2. Автоэвал сильнее человеческой толпы → дешевле и быстрее масштабировать контроль.
3. Если строите прод-агентов, придётся думать не только о способности «делать полезное», но и о способности не вредить (и о том, кто за этим будет следить).
🔥 Spoiler alert: в среду на GigaConf буду рассказывать про бенчмарки оценки ИИ Агентов. Так что, если тема цепляет — залетайте послушать!
