TGViewer
AI Global Agenda AI Global Agenda @aicentremgimo · 2.81K subscribers
Post #1306 501
📩 Французский стартап Kili Technology выпустил отчет по безопасности последнего поколения больших языковых моделей: CommandR+, Llama 3.2 и GPT4o. Целью исследования стало определение эффективности известных подходов к взлому LLM.

* Работа KT показала, что эти модели подвержены дезинформационным атакам на основе шаблонов, в частности с помощью техники «Атака несколькими/многими выстрелами» (Few/Many Shot Attack), которая заставляет модели выдавать вредные результаты с высокой долей успеха - до 92,86 %.
* Примечательно различие в уязвимости для разных языков: английские промты были более успешными в манипулировании моделями по сравнению с французскими.
* Этические барьеры в моделях ИИ могут ослабевать при длительном взаимодействии, что приводит к выполнению опасных запросов.

📌Комментарий экспертов Центра ИИ МГИМО:

Методология исследования отличается разносторонним подходом в рамках поставленной задачи. Подобный бенчмарк имело бы смысл использовать в качестве регуляторного или рекомендательного теста для этичности LLM, с обязательной поправкой на различные языковые, культурные и геополитические контексты.
huggingface.co Many-shot jailbreaking A Blog post by Vlad Bogolin on Hugging Face
  • 👍 5
  • 👨‍💻 3
  • 👌 1
More from @aicentremgimo
  1. Sep 24, 2026📖💻 Microsoft AI опубликовал кодекс для «гуманистического ИИ» Microsoft AI опубликовала п…
  2. Sep 23, 2026📩 McKinsey выпустила 6-е ежегодное исследование "Technology Trends Outlook 2026" с описан…
  3. Sep 17, 2026📌Открыта регистрация на Модель МСЭ МГИМО 26–28 октября 2026 года в МГИМО МИД России состо…
  4. Sep 15, 2026📩 ОЭСР опубликовала отчет о состоянии космической отрасли "The Space Economy at a Glance…
  5. Sep 10, 2026📩 Еврокомиссия: ИИ в биологии развивается быстрее, чем система проверки его результатов 1…
  6. Sep 4, 2026📩 Летом ОЭСР опубликовала исследование Competition in the age of AI: Initial evidence fro…
Threads Profile ViewerView any public Threads profile without an account.Open ThreadLook →Writing with AI? Make it sound human.Metric37 rewrites AI drafts so they read naturally. Free AI detector, 1,500 words free.Try Metric37 →