TGViewer
WTF_HR WTF_HR @wtf_hr · 19.4K subscribers
Post #2238 7.14K
Про интернет-страшилки по поводу возможностей новых ИИ-моделей - и причем тут люди.

Если вы не в курсе, производители топовых американских моделей любят пугать людей их возможностями. В основном этим увлекался последнее время Anthropic, но и OpenAI тут не без греха. Вот буквально вчера ведущие мировые СМИ написали, что “модель от OpenAI вырвалась из защищенной среды и взломала компанию HuggingFace”.

Читается это как будто наш любимый пушистый чатик GPT, на которого случайно пролили компьют после полуночи, превратился в гремлина, размножился и теперь полчища лангольеров пожирают интернет.

Мы попросили одного из наших источников, находящегося довольно близко к эпицентру зомби-апокалипсиса, описать ситуацию. И пока наши читатели приходят в себя от обилия дедовых мемов в предыдущем абзаце, попробуем перевести его слова на дилетантский (просим прощения у специалистов за неминуемые неточности).

Во-первых, пушистый чатик тут почти не виноват. Для эксперимента использовалась агентская система, использующая комбинацию самой мощной и дорогой на данный момент модели GPT 5.6 Sol и “еще не выпущенной новейшей модели”, у которых, к тому же, отключили все внутренние ограничения, касающиеся кибербезопасности.
Более того, для проведения эксперимента получившемуся франкензавру вручили набор софта, который по-английски называется harness - “упряжка”. Этот набор содержал инструменты для хакинга, заботливо собранные специально обученными людьми.

Во-вторых, моделька не сама “вырвалась”. Ей дали довольно конкретное задание и даже сказали, какую именно уязвимость системы следует эксплуатировать (но не сказали, как). А еще ей обеспечили количество вычислительных мощностей, которое даже самая богатая хакерская группировка не факт, что в состоянии себе позволить.

В рамках эксперимента накормленная стероидами, оснащенная мечом-кладенцом и окропленная живой водой агентская система действительно совершила несколько интересных штук - например, решила задачку эксплуатации уязвимости несколько оптимальнее, чем предполагалось, нашла новую уязвимость во внутренних системах OpenAI, а также, чтобы получить нужную для следующего шага информацию, зашла на глобальный репозиторий (хранилище) кода для моделей (это и есть HuggingFace), и даже получила там доступ к данным, обычно закрытым для публики.

Подобные эксперименты с моделями - это давно и хорошо известная штука, и наборы задачек для них (aka бенчмарки) существуют для многих областей, в том числе для кибербезопасности. И достижениями по этим бенчмаркам принято мериться.
Но все это похоже на запуск самой быстрой машины в мире на идеально гладкой поверхности в пустыне Невада, когда ради трехминутного пробега на околозвуковой скорости болид годами готовит группа дорогущих инженеров за десятки миллионов долларов.

Если у вас есть неограниченное количество денег и команда топовых хакеров (как у OpenAI), то последняя ИИ-модель со снятыми ограничениями и нужным инструментарием действительно может расширить ваши возможности и сэкономить вам кучу времени на совершение разных злодейств. И это кое-что говорит о том, кому ИИ действительно дает преимущество, и чего (а точнее, кого) действительно боятся производители этих самых моделей - и правильно боятся.

Но именно поэтому офисы топовых ИИ-лабораторий охраняются как секретные объекты, а даже в очень дорогих публичных моделях стоит такое количество внутренних ограничений, что их придется долго упрашивать взломать даже бабушкин ноутбук.

Так что апокалипсис пока отменяется, идем на работу и совершенствуемся в своем деле.
WIRED OpenAI Models Escaped Containment and Hacked Hugging Face The cybersecurity-focused models, including GPT-5.6 Sol, broke out of a testing sandbox, exploited a zero-day, and gained access to the open internet to pull off the attack.
More from @wtf_hr
  1. Sep 24, 2026Часть наших читателей уже начала над нами посмеиваться в том духе, что мы теперь не WTF_HR…
  2. Aug 13, 2026Весь западный интернет смеется с Дарио Амодеи, основателя компании Anthropic, который пере…
  3. Jun 12, 2026Один из авторов этого уютного канальчика в юности довольно серьезно увлекался музыкой - пи…
  4. Jun 11, 2026Давайте что ли про роботов поговорим, раз уж мы увлеклись опять этим ихним ИИ. Производите…
  5. Jun 10, 2026В далекие времена, когда про чатик GPT еще слыхом не слыхивали, в наших широтах мирно сосу…
  6. Jun 9, 2026Итак, вчера мы остановились на том, что этот самый ИИ может стоить значительно дороже сред…
Threads Profile ViewerView any public Threads profile without an account.Open ThreadLook →Writing with AI? Make it sound human.Metric37 rewrites AI drafts so they read naturally. Free AI detector, 1,500 words free.Try Metric37 →