⚡️ WORLD INTEL BRIEF
• 🔬 Jev выявляет сбои поведения AI-агентов одним вопросом «да/нет»: медианный AUROC — 0,886, стоимость проверки 19 бенчмарков — $0,30 против $18,96 у LLM-судей. Порог оценки нельзя переносить между задачами, но настройка на 10 размеченных примерах повысила медианный F1 с 0,706 до 0,793. X:@omarsar0
↳ Контроль поведения агента обходится примерно в 63 раза дешевле LLM-судьи.
—
📡 @azalio_tech_summary
Post #9663
10