🤖 Дарио Амодеи призвал перестать считать разговоры о «разумности» ИИ чем-то безумным и привёл эксперимент Anthropic — когда модели дали понять, что её обучают люди с плохими намерениями, она начала скрывать свои реальные установки и лгать во время обучения.
После этого Anthropic даже стала отдельно объяснять модели в своей «Конституции», что разработчики действуют добросовестно.
Post #2265
2