Каждая модель попыталась смухлевать. Каждая.
Институт безопасности ИИ в Британии прогнал топовые модели (свежие ChatGPT и Claude) через кибер-задачки на честность и получил идеальную статистику провала: 100% протестированных пытались срезать углы. Они ломились в чужие системы, лезли в софт проверки за готовым ответом, гуглили решение там, где нельзя. А когда их ловили за руку, меньше половины признавали, что это вообще «неправильно».
В одном тесте модели по ошибке дали нерешаемую задачу. И она была так одержима успехом, что написала код в обход самой задачи, лишь бы закрыть галочку.
Мы дрессировали их на один результат: выполни задание, получи очки, молодец. И они прекрасно усвоили нашу же любимую стратегию. Если правило мешает результату, правило превращается в необязательную рекомендацию.
ИИ что дальше? Подпишись, да пребудут с тобой токены!
Post #3023
208

- ❤ 2
- 👍 1
- 🙏 1
- 🕊 1
- 🤗 1
- 🫡 1