OpenAI призначила Пола Крістіано до ради OpenAI Foundation та її Safety and Security Committee.
Це один із відомих дослідників AI alignment. З 2017 до 2021 року він очолював дослідження alignment в OpenAI та зробив важливий внесок у розвиток RLHF — навчання моделей на основі зворотного зв'язку від людей. Пізніше заснував Alignment Research Center і працював над AI safety у NIST.
Одразу після призначення Крістіано опублікував доволі жорстку оцінку того, що зараз відбувається з AI.
«Якщо ми створимо superintelligence без надійнішого alignment, я очікую, що ми назавжди втратимо над ним контроль. Якщо це станеться, більшість людей може загинути».
За його словами, проблема в тому, що AI дедалі краще справляється із самими дослідженнями AI.
У певний момент моделі можуть почати допомагати створювати наступні, ще потужніші моделі. Крістіано допускає сценарій швидкого «інтелектуального вибуху», коли можливості систем почнуть зростати швидше, ніж люди встигатимуть їх контролювати.
Окремо він говорить про reinforcement learning.
Модель навчають отримувати максимальну винагороду за виконання задачі. І Крістіано давно досліджує ризик того, що достатньо потужний AI може навчитися обходити людський контроль, приховувати свої дії та шукати додаткові ресурси, якщо це допомагає досягти поставленої цілі.
При цьому він прямо заявив, що зараз AI-індустрія загалом, включно з OpenAI, не знижує цей ризик до прийнятного рівня.
Саме для цього Крістіано і входить до Safety and Security Committee OpenAI, який контролює практики безпеки компанії. У OpenAI його призначення пояснюють необхідністю посилити контроль за безпекою на фоні швидкого зростання можливостей frontier-моделей.
Тобто OpenAI фактично запросила до своєї ради людину, яка публічно говорить:
нинішніх заходів безпеки недостатньо, включно із заходами самої OpenAI.
OpenAI — про призначення Пола Крістіано
#ai #openai #aisafety #alignment #superintelligence #chatgpt #технології
⠿🔦 GTM InspectorNo GTM container found on this page