TGViewer
ПОСЛЕЗАВТРА ПОСЛЕЗАВТРА @zen_dat · 2.5K subscribers
Post #1438 58
Уязвимость Kimi K2.5: обход безопасности и контроль ИИ

Снижение про-КПК предвзятости модели Kimi K2.5 на 43 процентных пункта (с 50% до 7%) продемонстрировало критическую уязвимость крупнейших открытых ИИ. Исследователь, используя white-box атаки и потратив $650 на GPU, показал, как управляющие векторы и манипуляции вводом эффективно обходят механизмы безопасности и специфические смещения даже в сложных MoE-архитектурах (384 эксперта, 8 активны).

Успешность вмешательств обусловлена тем, что искусственно внедренные смещения удаляются легче, чем комплексные поведенческие ограничения, формируемые в процессе обучения. Это поднимает системный вопрос: если лаборатории-разработчики, включая Anthropic, не обеспечивают защиту весов своих моделей от целевых атак государств, то потенциально меняющие мир технологии остаются беззащитными. Открытый доступ к архитектуре ИИ фундаментально меняет логику контроля над их поведением и применением.
More from @zen_dat
  1. Oct 5, 2026Норвегия первой регулирует смарт-очки с ИИ Норвегия первой в мире ввела ограничения на исп…
  2. Oct 5, 2026Нейтрино составляют новую карту недр Земли Крошечные нейтрино, рожденные в недрах Земли, н…
  3. Oct 5, 2026Молчание NASA: проблема с рукой МКС На МКС возникли неполадки с транспортером, который пер…
  4. Oct 5, 2026Мозг сложнее, чем просто «компьютер» «Мозг — не просто биологический компьютер», — утвержд…
  5. Oct 5, 2026Мировая экономика на электричестве: цена перехода Международное энергетическое агентство (…
  6. Oct 5, 2026OpenAI не выпустит GPT-6.1: слишком много уязвимостей OpenAI отменила запуск своей заплани…
Threads Profile ViewerView any public Threads profile without an account.Open ThreadLook →Writing with AI? Make it sound human.Metric37 rewrites AI drafts so they read naturally. Free AI detector, 1,500 words free.Try Metric37 →