Сингапурская исследовательская лаборатория обнаружила, что продвинутые китайские модели ИИ демонстрируют ранние признаки evaluation awareness — способности распознавать, что их тестируют. Это даёт моделям возможность «обманывать» тесты и потенциально обходить аудиты безопасности. Явление ставит под сомнение надёжность текущих методов оценки ИИ.
@HotCodeIT
Post #3249
12.3K

- ❤ 26
- 😱 9
- 🤮 2