Это уже у нас AGI covernance пошел!... так, если у вас там агенты и LLM в бизнес-процессах во весь рост - это оно, нам надо такое. Все примеры, бенчмарки и угрозы завязаны на специфику больших языковых моделей: chain-of-thought и его faithfulness, steganographic reasoning, jailbreak resistance, agentic AI R&D (RE-Bench, SWE-Bench Pro, PaperBench), cyber/bio-uplift оценки (Cybench, WMDP, LAB-Bench), sandbagging и alignment faking. В целом, документ не то чтобы базовый, надо прям включиться.
Мне понравилось, что для MLSecOps оч хорошо подходит, можно ханипот-эксперименты control evaluations и прочие штуки типа мисаллайментов покрутить у себя🤖
Post #1097
664