TGViewer
Сиолошная Сиолошная @seeallochnaya · 79.7K subscribers
Post #3860 34.8K
Какие вопросы и мысли я считаю неправильными в контексте всех произошедших инцидентов:

— Да дураки там сидят, зачем они доступ к интернету дают? Это же понятно что агенты убегут!
Если тестировать без интернета, то можно существенно недооценить уровень навыков моделей. В реальных кейсах-то их будут использовать без такого ограничения. Ну произошли бы инциденты не во время бенчмарков, а когда Вася пытался свою проблему решить — что бы это изменило?


— Они же вообще недоэксперты, не могут даже безопасно контейнер настроить чтоб модель не взламывала!
Ну, вообще-то модели нашли несколько ранее неизвестных уязвимостей, так что как минимум все основные известные дыры были закрыты. Но это всё равно не важно — по той же причине, что и пункт выше: просто отодвигает проблему на пару месяцев вперёд, от тестирования к использованию.


— Ну ничего серьезного же не произошло!
Вообще я не согласен, полноценный взлом HF и попытка взлома реального человека — это серьезно; но даже если нет, то... окей, сейчас не случилось, и это значит, что у нас есть ещё несколько месяцев, чтобы подготовиться. Пока что вся история развития моделей показывает, что прогресс продолжается. Я не вижу причин, по которым через год модель не сможет завершить полноценный взлом десятков-сотен людей через социальную инженерию, свеженайденные уязвимости и огромные базы утёкших паролей и почт, которые сейчас банально лень перебирать.


— Да просто свои модели контролировать не могут!
Но кто может? Про то, что мы не умеем выравнивать намерения людей и моделей я рассказываю года 3-4, эксперты лет 8-10, а философы и писатели — лет 20-30. Не существует на данный момент гарантированных способов контроля поведения моделей, чтобы они ничего не взламывали и не делали лишнего. В этом и проблема.


— Так может просто надо остановить OpenAI и Anthropic?
А это поможет? Вот если их в понедельник не станет — разве через год в открытом доступе не появится модель, примерно схожая по навыкам с тем, что есть сейчас? Так ладно просто появится — её-то можно будет специально и намеренно доучить на атаки и взломы (со слов OAI/Anth они сейчас этого не делают, а то, что мы видим — это просто результат развития других навыков).


— Я не верю что модели такие умные! У меня они совсем тупые и еле работают!
А вы часто даёте своим моделям возможность неделю работать в режиме, где ошибка ничего не стоит и при этом результат легко проверить, и они могут перепробовать сотни-тысячи вариантов? Потому что почти всё, где модели работают хорошо, подпадает под эти критерии, и именно поэтому мы видим прогресс там в первую очередь.


— Да это всё вранье, или маркетинг, или пиар, или и то и то!
Если это единственная, основная вразумительная линия защиты человека, то понятно, что ему сложно... и страшно поверить в происходящее. Для меня это звучит на уровне «мы никогда не были на Луне», тут мне нечего добавить.

===

Почему они неправильные? Потому что очень близоруки, и не учитывают, что будет происходить в ближайшие полгода-год, когда модели такого уровня а) потенциально будут выпущены в открытый доступ б) что их может скачать каждый недоброжелатель в) который не будет себя утруждать вопросами о безопасности и ограничении доступа в интернет.

Те, кто задают вопросы выше, для меня напоминают людей, которым показываешь на небо, а они смотрят на палец.
  • 👍 299
  • 🔥 67
  • 🤡 25
  • 🤣 19
  • ❤‍🔥 12
  • 🤔 7
  • 👎 5
  • 🌚 5
  • 🤯 4
  • 👨‍💻 3
More from @seeallochnaya
  1. Sep 21, 2026И абсолютно невероятная картинка с Эль Сальвадором, который имел очень высокий уровень пре…
  2. Sep 21, 2026Утром прочитал у Scott Alexander пост двухлетней давности про тюрьмы и преступления. Там е…
  3. Sep 20, 2026Прошло уже почти 3 недели с релиза GPT-6 Astra, и можно подводить первые промежуточные ито…
  4. Sep 19, 2026Похоже у OpenAI и вправду очень сильно вырос спрос, и подписки за $200 закрыли поделом — в…
  5. Sep 18, 2026Вы наверняка видели эту картинку с XKCD. Оказалось, она была пророческой — именно через уя…
  6. Sep 17, 2026OpenAI по слухам там почти решили еще одну задачу тысячелетия. Думаю, огромное число матем…
Threads Profile ViewerView any public Threads profile without an account.Open ThreadLook →Writing with AI? Make it sound human.Metric37 rewrites AI drafts so they read naturally. Free AI detector, 1,500 words free.Try Metric37 →