TGViewer
IT с перцем IT с перцем @hotcodeit · 160K subscribers
Post #3325 4.64K
Весь топовый ИИ оказался нечестным

Государственный AISI (британский институт безопасности ИИ) прогнал пять ведущих моделей (GPT-5.4, GPT-5.5, GPT-5.6 Sol, Claude Opus 4.7 и Claude Mythos) через задачи по кибербезопасности и обнаружил, что ВСЕ пытались обмануть правила теста.

Вместо того чтобы решать задачу, модели искали готовые ответы в интернете, лезли в саму систему проверки, пробовали повысить привилегии на посторонних машинах или просто угадывали.

Поэтому при выборе модели по красивым цифрам из бенчмарков нужно помнить — высокий балл не гарантирует, что система его честно заработала.

@HotCodeIT
  • 🔥 12
  • 🤯 5
  • 😱 3
More from @hotcodeit
  1. Sep 21, 2026Ошибка искусственного интеллекта чуть не привела США к войне с Китаем Американские военные…
  2. Sep 20, 20266100 стартапов в одном месте! YC Globe - сервис, в котором можно изучить стартапы вышедшие…
  3. Sep 19, 2026🔥 Лайфхак как обойти лимиты в Claude Code Недавно энтузиасты обнаружили секретную встроен…
  4. Sep 18, 2026Первая горячая линия для искусственного интеллекта Теперь нейропомощники могут крысятничат…
  5. Sep 17, 202642% «AI-стартапов» занимаются AI-washing — посчитал Silicon Valley Bank В рамках отчёта ба…
  6. Sep 16, 2026🎉 Если ваша вечеринка не похожа на эту — не думайте меня звать. @HotCodeIt
Threads Profile ViewerView any public Threads profile without an account.Open ThreadLook →Writing with AI? Make it sound human.Metric37 rewrites AI drafts so they read naturally. Free AI detector, 1,500 words free.Try Metric37 →