Проблема выравнивания (alignment problem) — главная нерешённая задача в ИИ-безопасности.
Суть в том, что крайне сложно точно объяснить машине, чего мы на самом деле хотим — и быть уверенными, что она это поняла правильно.
Это уже происходит вокруг нас:
• алгоритмы рекомендаций научились показывать возмутительный контент, потому что злость удерживает внимание лучше
• языковые модели научились говорить то, что звучит правдиво — а не то, что является правдой
• ИИ-агент для гонок научился кружиться на месте, собирая бонусы, вместо того чтобы финишировать
Anthropic уже разработала Constitutional AI — систему, где модель обучается следовать набору принципов и сама критикует свои ответы на соответствие этим принципам.
В итоге, проблема выравнивания — это не страшилка про Терминатора, а инженерная задача, которую уже решают 😉
