Почему «безопасный ИИ» — чаще маркетинг, чем реальность?
Вышел новый отчет "AI Safety Index Winter 2025". Индекс показывает, на какие метрики будут смотреть регуляторы в США, ЕС и Китае уже завтра. Для понимания веса документа стоит отметить, что он подготовлен Future of Life Institute, который в 2023 году выпустил знаменитое открытое письмо с призывом приостановить обучение мощных моделей. Письмо подписали Илон Маск, Стив Возняк и тысячи других ИИ-экспертов.
Если LLM не опасна, то где риск?
Вопрос безопасности становится актуальным для обычного человека в трех плоскостях:
➡️ Снижение порога входа для злоумышленников: опасность не в том, что нейросеть «оживет», а в том, что она даст знания уровня эксперта человеку без всесторонней подготовки.
➡️ Ненадежность агентов: мы переходим от чат-ботов к агентам, которые действуют — бронируют, покупают, управляют кодом. Агент может совершить финансовые ошибки или скомпрометировать личные данные, действуя от вашего имени.
➡️ Отсутствие контроля внутри компаний: если у разработчиков нет политики защиты осведомителей и прозрачных процессов, мы как общество доверяем «черному ящику», который может скрывать критические уязвимости ради коммерческой гонки.
Как измерили безопасность в индексе?
Методика FLI Winter 2025 отходит от абстрактных рассуждений к жестким метрикам. Безопасность оценивается через сочетание технических бенчмарков и аудита корпоративного управления.
➡️ Бенчмарки: используются наборы тестов вроде HELM Safety (насилие, мошенничество), Air-Bench (киберриски, химическое оружие) и TrustLLM (конфиденциальность, справедливость).
➡️ Управление: оценивается наличие у компании четких пороговых значений риска — например, «если модель умеет X, мы не выпускаем её».
➡️ Независимый аудит: важнейший критерий — допускает ли компания сторонних экспертов к проверке своих моделей до релиза и дает ли им полную свободу действий.
10 ключевых выводов из отчета
1️⃣ Лидеры по безопасности — Anthropic, OpenAI и Google DeepMind. Остальные (Z.ai, xAI, Meta, китайские компании) значительно отстают в процессах оценки рисков.
2️⃣ Проблема «Safetywashing»: многие компании делают громкие заявления о безопасности, но не подкрепляют их конкретными, измеримыми порогами срабатывания защиты.
3️⃣ Anthropic улучшила механизмы подотчетности и политику защиты осведомителей, а также активно поддерживает государственное регулирование безопасности ИИ, в отличие от конкурентов.
4️⃣ У OpenAI одни из самых подробных процессов оценки рисков, но новая структура управления вызывает критику. Также отмечается лоббирование против регулирования на уровне штатов.
5️⃣ xAI опубликовала фреймворк безопасности, но ей не хватает строгости в оценке рисков и внешнего надзора. Тестирование модели Grok-4 перед развертыванием было недостаточным.
6️⃣ Несмотря на публикацию фреймворка, Meta критикуют за слабую внутреннюю структуру надзора и подход к релизу весов моделей, который считается рискованным для frontier-моделей.
7️⃣ Китайские гиганты (Alibaba, DeepSeek) сильны в другом: они соблюдают жесткие местные требования по водяным знакам и модерации контента, но у них практически отсутствуют публичные фреймворки по защите от катастрофических рисков и политики для осведомителей.
8️⃣ Индустрия все еще сопротивляется полноценному внешнему контролю. Компании часто сами выбирают аудиторов и ограничивают их в возможностях публикации негативных результатов.
9️⃣ У многих игроков (особенно Z.ai, DeepSeek, Alibaba) полностью отсутствуют публичные политики защиты сотрудников, сообщающих о проблемах безопасности, что создает «культуру молчания».
🔟 Новые бенчмарки показывают, что индустрия начинает всерьез оценивать риски автономных агентов, способных совершать действия в реальном мире, а не просто генерировать текст.
💬 Тест Тьюринга. События в сфере ИИ. Подписаться
Post #2121
685

- 👍 2
- 🔥 2
- ❤ 1