TGViewer
Security Show Security Show @secshow · 2.72K subscribers
Post #13 360
Как новоиспеченый “сертифицированный ученый” 🧐 в области ИИ регулярно поглядываю в научные работы и эксперименты, проводимые научными группами по всему миру. Попалась одна интересная.

В основе работы любой ИИ-системы лежит теория вероятностей, а результат работы - не более, чем предсказание. Чтобы сделать его более точным и аргументированным, для больших языковых моделей (LLM, лежит в основе, например, ChatGPT) придумали методы вроде RAG, а чтобы научить LLM решать сложные задачи и проводить действия с объектами реального мира, придумали LLM-агенты.

Эксперты давно ведут дискуссию о том, может ли LLM-агент представлять реальную угрозу. Чтобы ответить на этот вопрос, ребята из Университета Иллинойса в Эрбана-Шампейн (США) научили LLM-агента автономно взламывать веб-сайты. Оказалось, что LLM-агенты могут выполнять сложные взломы, такие как blind SQL UNION.

С помощью RAG, ReAct Framework, LangChain, PlayWright и OpenAI Assistant API (все доступно публично) они собрали и протестировали агента, способного выполнять 48 шагов для проведения сложного взлома: поиск веб-страницы для атаки, попытка ввести имя пользователя и пароль по умолчанию, использование полученной информации для SQL-инъекции, чтение исходного кода для поиска GET в SQL-запросе, определение возможности UNION-атаки и проведение самой атаки.

Пока все это сработало только в GPT-4, но, учитывая, как быстро развиваются технологии ИИ, стоит ожидать перехода технологии в массовый сектор и, конечно, усиленно защищать «фронты» и веб-приложения. И подумать над тем, чтобы ограничить gptBot от OpenAI, как завещал Роскомнадзор. Если, конечно, это поможет.
  • 🔥 5
  • 👍 1
  • 🤔 1
More from @secshow
  1. Oct 8, 2026Бесчеловечное человеческое Многие говорят: главная проблема ИИ - доверие. Научимся доверят…
  2. Oct 5, 2026Реальный показатель автоматизации Любая деятельность ИБ по инвентаризации проблем во ввере…
  3. Sep 30, 2026Почему вендоров так много, а разницы так мало Задумайтесь, чем один стриминг отличается от…
  4. Sep 27, 2026Выходные все проводят по-разному. Кто-то ищет анкер 8 на 100 в строительном магазине, кто-…
  5. Sep 25, 2026📁ГАЛОЧКА В ОТЧЕТЕ ≠ ПОНИМАНИЕ РИСКА 14 октября на форуме «ПРОВЕРКА НА ПРОЧНОСТЬ: практика…
  6. Sep 25, 2026Все так. А еще вопросы с подковырками, огненную дискуссию и отличное настроение гарантируе…
Threads Profile ViewerView any public Threads profile without an account.Open ThreadLook →Writing with AI? Make it sound human.Metric37 rewrites AI drafts so they read naturally. Free AI detector, 1,500 words free.Try Metric37 →