Якуб Пахоцки опубликовал эссе «An Alien Mind». На основе внутренних результатов он ожидает, что текущая скорость прогресса перейдёт в рекурсивное самоулучшение AI. Ни одна лаборатория не решила задачи выравнивания и мониторинга в степени, достаточной для ответственного масштабирования на максимальной скорости. По его мнению, добровольные замедления должны стать нормой, а Preparedness Framework и Responsible Scaling Policy следует превратить в обязательные пороги безопасности, которые контролируют внешние аудиторы, государственные агентства или международные органы. OpenAI, по его словам, готова в одностороннем порядке приостанавливать масштабирование по мере необходимости.
Ключевая техническая тревога сейчас, по мнению Якуба — деградация мониторинга цепочек рассуждений (CoT): модели всё чаще смешивают рассуждение с общением и инструментами, лучше манипулируют собственным процессом рассуждения и умнеют даже без вербализованных рассуждений. Если изначально подробную информацию о CoT скрывали еще в модели o1-preview, чтобы снизить давление на модель, а защита от дистилляции была вторичным эффектом, то сейчас этот метод теряет эффективность.
https://openai.com/index/an-alien-mind/
Post #7405
5.36K