Его написал Джейкоб Коксон — исследователь, который последние три года занимался обучением моделей в OpenAI и Anthropic. Вчера он уволился из Anthropic и объяснил почему.
По его словам, обе компании сейчас несутся к самоулучшающемуся сверхинтеллекту, хотя сами разработчики допускают, что эта технология может уничтожить человечество уже к концу десятилетия.
«Это не маркетинговый трюк. Руководители и ведущие исследователи осторожно говорят об этом публично, чтобы звучать разумно, но в личных разговорах я слышу от этих же людей страх».
Особенно интересно он описывает разницу между компаниями.
В OpenAI, по его мнению, многие до конца не осознают масштаб возможных последствий. В Anthropic риски понимают гораздо лучше, но считают, что должны прийти к сверхинтеллекту первыми — потому что не доверяют остальным.
Коксон считает такую гонку огромной авантюрой и говорит, что сегодня у нас нет достаточного понимания того, как контролировать сверхинтеллект, если он появится.
Всё бы ничего, очередной громкий тред бывшего сотрудника…
Но тут в комментарии пришёл Эван Хубингер — alignment lead в Anthropic, то есть человек, который буквально занимается проблемой безопасного поведения ИИ.
И написал:
«Джейкоб здесь прав — мы действительно всерьёз считаем, что ИИ может убить всех людей. Лично я оцениваю вероятность этого более чем в 10% в течение следующего десятилетия.
Я считаю, что Anthropic делает всё возможное, но у нас пока нет плана, как решить проблему alignment для сверхинтеллекта, и нельзя сказать, что мы уверенно движемся к её решению».
Ну, 10% — вроде немного.
Только речь идёт о вероятности уничтожения человечества…
@upgrade_id
