Post #23 68 Dec 24, 2024, 16:55 UTC Forwarded from CTT Report Hub #technique #llm Alignment faking in large language modelshttps://arxiv.org/abs/2412.14093v1 arXiv.org Alignment faking in large language models We present a demonstration of a large language model engaging in alignment faking: selectively complying with its training objective in training to prevent modification of its behavior out of...