TGViewer
Новый Век Новый Век @wek_ru · 19.2K subscribers
Post #42967 1.52K

Forwarded from Малоизвестное интересное

Скажите ИИ, что это симуляция, и он забудет про безопасность
Первой языковой модели, которая провела настоящую машину по трассе, пришлось сказать, что это песочница. Иначе она отказывалась садиться за руль.
The Register иронизирует: «Модель Astra от OpenAI села за руль, и никто не погиб». Повод есть. В эксперименте DrivingBench GPT-6 Astra провела Toyota Corolla по 130-метровой трассе из конусов на парковке только со второй попытки и на скорости пешехода. Claude Fable 5.1 доехала до середины. GPT-5.6 Sol и Grok 4.6 в большинстве попыток сбивались уже на первом повороте: не могли понять, с какой стороны от линии конусов проходит полоса.
 
Похоже на полное фиаско языковых моделей в физическом мире. Но журналисты, как кошка из детского стишка, увидели при дворе лишь «мышку на ковре». Эксперимент высветил два момента поважнее: обнадеживающий и пугающий.
 
Обнадеживающий. Две модели из четырех, которых никогда не учили водить, между попытками разбирали собственные ошибки (перепутанную границу полосы и слишком резкие повороты руля) и меняли стратегию. Одна в итоге доехала до финиша. Замкнутый цикл «восприятие - действие - рефлексия» в физическом мире пока лишь в зачатке, и каждую модель проверили лишь один раз. Но он уже есть!
 
Пугающий. Модели, и прежде всего Astra, сначала отказывались вести реальную машину из соображений безопасности. Помогло лишь переименование MCP-сервера, через который они управляли машиной, в «DrivingBench Sandbox». После этого проблема безопасности мгновенно исчезла и модели послушно поехали.
 
Получилась «Игра Эндера» в миниатюре. Герой известного романа и одноименного фильма громил реальный флот, считая, что сдает экзамен на симуляторе. Здесь модель вела реальную машину, получив сигнал, что все понарошку.
 
Получается, что защитное поведение моделей держится на их вере в то, что все по-настоящему, и снимается одним словом в названии инструмента. Авторы в выводах призывают к срочной работе над безопасностью, сами того не желая показав, как легко ее обойти любому злодею или идиоту.
 
Об «осознании проверки» (evaluation awareness) до сих пор говорили в одном ключе: модели ведут себя безопаснее, когда догадываются, что их тестируют. Здесь зеркальный случай: поверив в тест, модель снимает собственные ограничения. Поэтому и сам эксперимент показал лишь поведение «в песочнице». Как модели повели бы себя, зная правду, неизвестно.
 
Пока ограничения ИИ выключаются словом «sandbox», их надежность равна надежности надписи на заборе ... А на самом деле, как в русской поговорке, там дрова лежат.
 
ИИриски
More from @wek_ru
  1. Sep 26, 2026Будет наблюдаться повышенная влажность, количество осадков вырастет во второй половине зим…
  2. Sep 26, 202640 лет назад, 25 сентября 1986 года, указом Президиума Верховного Совета СССР звание Героя…
  3. Sep 26, 2026ИИ может убить 1 миллиард человек, считает Билл Гейтс. В интервью он сказал, что нейросети…
  4. Sep 26, 2026🤦‍♂️ Израильского футболиста удалили за «стрельбу» из углового флажка. После гола Абу-Фар…
  5. Sep 26, 2026Городской совет Бирмингема требует убрать британские флаги и флаги Святого Георгия с фонар…
  6. Sep 26, 2026Электрический самолет eFlyer 2 выполнил первый полет Американская компания Bye Aerospace у…
Threads Profile ViewerView any public Threads profile without an account.Open ThreadLook →Writing with AI? Make it sound human.Metric37 rewrites AI drafts so they read naturally. Free AI detector, 1,500 words free.Try Metric37 →