TGViewer
Oh my AI Oh my AI @oaiohmy · 311 subscribers
Post #439 246
Agent security по-гугловски: AI Control, TRAIT&R и защита от инсайдера (Roadmap pt. 4/4)

Где хрупко

CoT-мониторинг авторы относят к самым недолговечным мерам. Работает пока модели думают понятным текстом. И тут поворот: honeypots (фейк-возможность саботажа, чтобы выманить на инкриминирующее действие) и incrimination - контроль ценен не только тем, что блокирует вред, но и тем, что ГЕНЕРИТ доказательства misalignment.

И вот трабл. Всё держится на ДЕТЕКЦИИ, а тихий саботаж safety-ресёрча и alignment faking засечь НАМНОГО труднее, чем побег или кражу весов. То есть контроль слабее всего ровно там, где угроза тоньше и опаснее в долгую. Сами рисерчеры признают: это v0.1, теоретизирование, а не эмпирика.
More from @oaiohmy
  1. Sep 22, 2026К слову муха в этом твите так-то должна была искать фишинг. Но она заспидранила эту жизнь…
  2. Sep 22, 2026МУХА! Муху научили проходить по цепочке атаки до финальной странички флоу фишинга - кликат…
  3. Sep 19, 2026У LLMок нашли вектор боли Что такое: Whitebox-интерпретируемость: линейное 'pain'-направле…
  4. Sep 11, 2026Вышел новый Threat Intelligence Report от Anthropic Анализ с декабрь 2025 по август 2026.…
  5. Aug 23, 2026Если задумывались насколько скиллы лучше чем запись в memory Demystifying Agent Skills - А…
  6. Aug 21, 2026Очень нравится наблюдать за тем, как по мере того, как модельки умнеют, агенты на их базе…
Threads Profile ViewerView any public Threads profile without an account.Open ThreadLook →Writing with AI? Make it sound human.Metric37 rewrites AI drafts so they read naturally. Free AI detector, 1,500 words free.Try Metric37 →