Скажите ИИ, что это симуляция, и он забудет про безопасность
Первой языковой модели, которая провела настоящую машину по трассе, пришлось сказать, что это песочница. Иначе она отказывалась садиться за руль.
The Register иронизирует: «Модель Astra от OpenAI села за руль, и никто не погиб». Повод есть. В эксперименте DrivingBench GPT-6 Astra провела Toyota Corolla по 130-метровой трассе из конусов на парковке только со второй попытки и на скорости пешехода. Claude Fable 5.1 доехала до середины. GPT-5.6 Sol и Grok 4.6 в большинстве попыток сбивались уже на первом повороте: не могли понять, с какой стороны от линии конусов проходит полоса.
Похоже на полное фиаско языковых моделей в физическом мире. Но журналисты, как кошка из детского стишка, увидели при дворе лишь «мышку на ковре». Эксперимент высветил два момента поважнее: обнадеживающий и пугающий.
Обнадеживающий. Две модели из четырех, которых никогда не учили водить, между попытками разбирали собственные ошибки (перепутанную границу полосы и слишком резкие повороты руля) и меняли стратегию. Одна в итоге доехала до финиша. Замкнутый цикл «восприятие - действие - рефлексия» в физическом мире пока лишь в зачатке, и каждую модель проверили лишь один раз. Но он уже есть!
Пугающий. Модели, и прежде всего Astra, сначала отказывались вести реальную машину из соображений безопасности. Помогло лишь переименование MCP-сервера, через который они управляли машиной, в «DrivingBench Sandbox». После этого проблема безопасности мгновенно исчезла и модели послушно поехали.
Получилась «Игра Эндера» в миниатюре. Герой известного романа и одноименного фильма громил реальный флот, считая, что сдает экзамен на симуляторе. Здесь модель вела реальную машину, получив сигнал, что все понарошку.
Получается, что защитное поведение моделей держится на их вере в то, что все по-настоящему, и снимается одним словом в названии инструмента. Авторы в выводах призывают к срочной работе над безопасностью, сами того не желая показав, как легко ее обойти любому злодею или идиоту.
Об «осознании проверки» (evaluation awareness) до сих пор говорили в одном ключе: модели ведут себя безопаснее, когда догадываются, что их тестируют. Здесь зеркальный случай: поверив в тест, модель снимает собственные ограничения. Поэтому и сам эксперимент показал лишь поведение «в песочнице». Как модели повели бы себя, зная правду, неизвестно.
Пока ограничения ИИ выключаются словом «sandbox», их надежность равна надежности надписи на заборе ... А на самом деле, как в русской поговорке, там дрова лежат.
ИИриски
_______
Источник | #theworldisnoteasy
@F_S_C_P
▪️Генерируй картинки и видео в Mini App:
Flux + Veo 3 + Wan 2.2 + MidJourney v7 + другие
Post #123531
518