TGViewer
FSCP FSCP @f_s_c_p · 13.4K subscribers
Post #123531 518
Скажите ИИ, что это симуляция, и он забудет про безопасность
Первой языковой модели, которая провела настоящую машину по трассе, пришлось сказать, что это песочница. Иначе она отказывалась садиться за руль.
The Register иронизирует: «Модель Astra от OpenAI села за руль, и никто не погиб». Повод есть. В эксперименте DrivingBench GPT-6 Astra провела Toyota Corolla по 130-метровой трассе из конусов на парковке только со второй попытки и на скорости пешехода. Claude Fable 5.1 доехала до середины. GPT-5.6 Sol и Grok 4.6 в большинстве попыток сбивались уже на первом повороте: не могли понять, с какой стороны от линии конусов проходит полоса.
 
Похоже на полное фиаско языковых моделей в физическом мире. Но журналисты, как кошка из детского стишка, увидели при дворе лишь «мышку на ковре». Эксперимент высветил два момента поважнее: обнадеживающий и пугающий.
 
Обнадеживающий. Две модели из четырех, которых никогда не учили водить, между попытками разбирали собственные ошибки (перепутанную границу полосы и слишком резкие повороты руля) и меняли стратегию. Одна в итоге доехала до финиша. Замкнутый цикл «восприятие - действие - рефлексия» в физическом мире пока лишь в зачатке, и каждую модель проверили лишь один раз. Но он уже есть!
 
Пугающий. Модели, и прежде всего Astra, сначала отказывались вести реальную машину из соображений безопасности. Помогло лишь переименование MCP-сервера, через который они управляли машиной, в «DrivingBench Sandbox». После этого проблема безопасности мгновенно исчезла и модели послушно поехали.
 
Получилась «Игра Эндера» в миниатюре. Герой известного романа и одноименного фильма громил реальный флот, считая, что сдает экзамен на симуляторе. Здесь модель вела реальную машину, получив сигнал, что все понарошку.
 
Получается, что защитное поведение моделей держится на их вере в то, что все по-настоящему, и снимается одним словом в названии инструмента. Авторы в выводах призывают к срочной работе над безопасностью, сами того не желая показав, как легко ее обойти любому злодею или идиоту.
 
Об «осознании проверки» (evaluation awareness) до сих пор говорили в одном ключе: модели ведут себя безопаснее, когда догадываются, что их тестируют. Здесь зеркальный случай: поверив в тест, модель снимает собственные ограничения. Поэтому и сам эксперимент показал лишь поведение «в песочнице». Как модели повели бы себя, зная правду, неизвестно.
 
Пока ограничения ИИ выключаются словом «sandbox», их надежность равна надежности надписи на заборе ... А на самом деле, как в русской поговорке, там дрова лежат.
 
ИИриски

_______
Источник | #theworldisnoteasy
@F_S_C_P

▪️Генерируй картинки и видео в Mini App:
Flux + Veo 3 + Wan 2.2 + MidJourney v7 + другие
  • ❤ 1
More from @f_s_c_p
  1. Sep 25, 2026Каждый кадр на видео выше сделан Клодом с помощью JavaScript. Через 2, максимум - 3, покол…
  2. Sep 25, 2026Opus 5.5 спроектировал LEGO-копию робота Microduck 🦆 Автор попросил Claude сделать модель…
  3. Sep 25, 2026Чиновники в США и ЕС рассматривают технологии ограничения солнечного света в качестве возм…
  4. Sep 25, 2026Где-то год назад первое видео стало популярным в твиттере А вчера я дал его Opus 5.5, дал…
  5. Sep 24, 2026На видео показана динамика золотых резервов центральных банков с 2006 по 2026 год (без уче…
  6. Sep 24, 2026Итак, экстремисты из Meta украли у меня собственный 100грамм-20к-аккаунт Хулиномики под пр…
Threads Profile ViewerView any public Threads profile without an account.Open ThreadLook →Writing with AI? Make it sound human.Metric37 rewrites AI drafts so they read naturally. Free AI detector, 1,500 words free.Try Metric37 →