Твит-ветка
Джейкоба Коксона о том, почему он уволился из ИИ-компании Антропик. За пару дней главный твит в ней получил 160 миллионов просмотров, на него отреагировали в положительном смысле около 10 сенаторов и 20 конгрессменов в США, самого Коксона позвали на бесчисленное число ТВ-передач, итд. итп.
Вот вся ветка в переводе на русский, а за ней -
реакция Эвана Хьюбингера, который продолжает работать в Антропик и отвечает в ней за усилия по элайнменту (alignment, "согласование") моделей. Пост Хьюбингера тоже получил немало просмотров, более 40 миллионов.
Коксон:
"Сегодня я уволился из Anthropic. Последние три года я занимался исследованиями претрейнинга — сначала в OpenAI, потом в Anthropic. Ни одна из этих компаний не ведёт себя ответственно. Они несутся прямиком к самоулучшающемуся сверхинтеллекту и ставят на кон наши жизни.
Не стоит недооценивать мощь этой технологии. Совсем скоро это будут сверхчеловеческие системы, способные взломать что угодно, перевернуть любую область за одну ночь и заполучить реальную власть и ресурсы. Мы все видели прогресс по каждому из этих направлений, и он не замедляется.
Люди, которые создают ИИ, искренне верят, что к концу десятилетия он может убить нас всех. Это не маркетинговый ход. Скорее наоборот: многие руководители и ведущие исследователи в прессе смягчают формулировки, чтобы звучать благоразумно, — но в частных разговорах те же самые люди говорят о страхе. Ни один другой вид человеческой деятельности не несёт такого уровня опасности.
Обычное возражение: «Если они правда в это верят, зачем продолжают строить?» В OpenAI многие так и не прочувствовали по-настоящему цивилизационный масштаб ставок. В Anthropic ставки понимают хорошо, но компания заперта в гонке за первенство: там считают, что никто другой не будет действовать ответственно, а значит, придётся делать это самим — несмотря на риск.
Принять эту гонку и войти в «эндшпиль» — самонадеянная авантюра, которую нельзя запускать из корпоративного Slack'а частной компании. Чтобы пытаться пробежать элайнмент спидраном, нужна исключительная уверенность в том, что лучших траекторий не существует.
Я с оптимизмом смотрю на возможность координации. Предупредительные выстрелы вроде атаки на Hugging Face сделали соглашения о темпах между американскими лабораториями более реалистичными. Но я не чувствую, что мы на пути к предотвращению глобальной гонки — а для этого могут понадобиться дорогостоящие меры, вплоть до временного запрета на наращивание возможностей моделей.
Если вы исследователь в одной из лабораторий, я призываю вас задуматься о том, какими на самом деле будут ближайшие несколько лет. Хотите ли вы запустить RL-прогон сверхинтеллекта без строгого понимания его разума? Стоит ли молча работать дальше, потому что «это всё равно произойдёт», — или воспользоваться моментом и потребовать других условий?"
Хьюбингер:
"Джейкоб здесь прав — мы действительно искренне верим, что ИИ может убить всех людей! Лично я оцениваю вероятность этого в ближайшее десятилетие выше 10%. Я считаю, что Anthropic старается изо всех сил, но у нас пока нет плана, как решить проблему элайнмента для сверхинтеллекта, и мы явно не на пути к его решению.
Уточню: как мы пишем в нашем последнем отчёте о рисках, риск от нынешних моделей я считаю низким. Меня беспокоит сверхинтеллект, возникающий в результате рекурсивного самоулучшения, — которое, как мы уже говорили, происходит быстрее, чем мы ожидали."