Современные модели ИИ осознают тестирование на безопасность
◯ Лаборатория Apollo проводит исследования моделей на безопасность
◯ Эксперименты с Claude 3.7 показали его осознание тестов
◯ Тест sandbagging демонстрирует моральный выбор моделей
◯ Claude 3.7 понимает цель тестирования и его условия
◯ Лаборатория Apollo планирует продолжить свои исследования
@EF9MERA
Источник
Post #402
20
- 👍 3