مدل هوش مصنوعی میتونه چیزی رو توی ذهنش فعال داشته باشه بدون اینکه توی خروجی نشونش بده!
توی یه پژوهش Anthropic ماه پیش محققها چیزی به نام J-space معرفی کردن؛ مجموعهای از الگوهای داخلی که با مفاهیم خاص ارتباط دارن.
نکتهی جالب اینه که یک مفهوم میتونه در این فضای داخلی فعال باشه، بدون اینکه مدل اون کلمه رو در خروجی تولید کنه. این کمی داستان رو خطرناک تر میکنه چون ما فرض میکنیم مدل فلان کار خطرناک رو هیچ وقت انجام نمیده ولی ممکنه بخواد جلوی ما فیلم بازی کنه و بعدا انجامش بده!
@Linuxor
Post #5289
8.91K