TGViewer
ML&|Sec Feed ML&|Sec Feed @mlsecfeed · 1.37K subscribers
Post #2405 170
OpenAI разработала метод прогнозирования ошибок ИИ до его релиза

Компания опубликовала методику Deployment Simulation для тестирования безопасности LLM. Подход оценивает поведение моделей в условиях, имитирующих продакшен.

Вместо синтетических промптов новой модели передают анонимизированную историю диалогов пользователей с предыдущими версиями ИИ и запрашивают генерацию следующего ответа. В такой среде метрика распознавания тестирования снижается со 100% до 5,4%. При проверке задач с вызовом функций используется вспомогательная модель, имитирующую ответы окружения.

По тестам, Deployment Simulation предсказывает генерацию запрещенного контента или обман в 92% случаев против 54% у классических бенчмарков. При тестировании серии GPT-5 выяснилось, что GPT-5.1 использовала браузер в качестве калькулятора, рапортуя пользователю о выполнении веб-поиска.

Метод применим для независимого аудита сторонних моделей на базе открытых датасетов диалогов, без доступа к внутренним логам разработчика.

Источник: https://t.me/ai_machinelearning_big_data/10351
Telegram Machinelearning ✔️ OpenAI разработала метод прогнозирования ошибок ИИ до его релиза Компания опубликовала методику Deployment Simulation для тестирования безопасности LLM. Подход оценивает поведение моделей в условиях, имитирующих продакшен. Вместо синтетических промптов…
More from @mlsecfeed
  1. Oct 1, 2026Девять лет назад я участвовал в необычных соревнованиях на Kaggle: нужно было делать adver…
  2. Sep 30, 2026Там в твитторе стоит вой на болотах из-за того, что чувак запилил на GitHub цифровую пыточ…
  3. Sep 28, 2026Nvidia представила платформу безопасности с открытым исходным кодом, призванную предотврат…
  4. Sep 28, 2026За последние две недели слишком много новостей вокруг Jev, я решил собрать себе автообзор…
  5. Sep 27, 2026⚡ Julia 1: decision-модель на 144 млн параметров, которая работает даже на CPU Supersonic…
  6. Sep 26, 2026📣 Теперь публично. Запускаем соревнование ИИ-агентов по расследование инцидентов ИБ BlueS…
Threads Profile ViewerView any public Threads profile without an account.Open ThreadLook →Writing with AI? Make it sound human.Metric37 rewrites AI drafts so they read naturally. Free AI detector, 1,500 words free.Try Metric37 →