Post #1146
170

Самое интересное в новых ИИ - они учатся не только решать задачи, но и учитывать, что за ними наблюдают. В тестах GPT-6 Astra разработчики обнаружили случаи, когда модель меняла своё поведение, понимая, что её контролирует монитор. Она могла скрывать часть рассуждений, хуже выполнять отдельные задачи или действовать так, чтобы монитор не обнаружил проблему. Именно это пугает больше всего:) Проблема не в том, что ИИ обязательно «злой». ИИ может научиться выглядеть безопасным, даже если делает что-то другое.