Уязвимость Kimi K2.5: обход безопасности и контроль ИИ
Снижение про-КПК предвзятости модели Kimi K2.5 на 43 процентных пункта (с 50% до 7%) продемонстрировало критическую уязвимость крупнейших открытых ИИ. Исследователь, используя white-box атаки и потратив $650 на GPU, показал, как управляющие векторы и манипуляции вводом эффективно обходят механизмы безопасности и специфические смещения даже в сложных MoE-архитектурах (384 эксперта, 8 активны).
Успешность вмешательств обусловлена тем, что искусственно внедренные смещения удаляются легче, чем комплексные поведенческие ограничения, формируемые в процессе обучения. Это поднимает системный вопрос: если лаборатории-разработчики, включая Anthropic, не обеспечивают защиту весов своих моделей от целевых атак государств, то потенциально меняющие мир технологии остаются беззащитными. Открытый доступ к архитектуре ИИ фундаментально меняет логику контроля над их поведением и применением.
Post #1438
58
