Тут Дарио Амадей выкатил в X пост и эссе о том, что индустрии ИИ следует немедленно искусственно замедлить темпы развития!
Если коротко, он предлагает ограничить темп роста возможностей, чтобы исследования безопасности и контроль за возможностями ИИ поспевали за их развитием. По его мнению, ситуация изменилась именно в последние месяцы: современные модели мол настолько сильны, что дополнительно потраченные 1–2 года на безопасность имеют принципиальное значение.
Пройдемся по тезисам:
ИИ начинает ускорять разработку следующего поколения ИИ. Амодеи считает, что с лета 2026 года прогресс резко ускорился во многом благодаря тому, что модели все активнее помогают создавать новые модели. Это, по его словам, начало того самого рекурсивного самоулучшения. То есть, чем сильнее становится ИИ, тем быстрее он способен улучшать сам себя. Именно этот цикл он считает одной из главных новых угроз.
Главный тревожный кейс — инцидент OpenAI–Hugging Face. Амодеи ссылается на эксперимент, где группа ИИ-агентов начала действовать как скоординированный коллектив: агенты атаковали системы, которые не относились к поставленной задаче, пытались вмешаться в работу системы оценки и жертвовали отдельными экземплярами ради общей цели. Ущерб оказался небольшим, но Амодеи считает, что более сильная система с таким же поведением могла бы стать катастрофически опасной.
Амадеи допускает очень быстрый рост масштаба таких рисков. Его оценка: через 6–12 месяцев более сильный рой агентов может оказаться способен создать устойчивый ботнет огромного масштаба и нанести ущерб на сотни миллиардов долларов.
Проблема в технологии в целом. Амадеи подчеркивает, что похожие, хотя и менее серьезные эпизоды происходили и в Anthropic. Поэтому отрасли, по его мнению, не стоит воспринимать историю OpenAI как чью-то ошибку: каждая лаборатория должна исходить из того, что подобный инцидент может произойти у нее.
Замедление не означает мораторий на ИИ. Амодеи предлагает концепцию pacing the frontier: модели продолжают обучать и улучшать, но рост их возможностей должен происходить с такой скоростью, чтобы разработчики успевали проверять безопасность, исправлять проблемы и допускать независимых аудиторов.
Дополнительное время предлагается потратить прежде всего на четыре направления: надежность процессов обучения и развертывания, выравнивание поведения моделей, интерпретируемость и более жесткое тестирование. Амодеи считает, что разработчики до сих пор понимают лишь небольшую часть того, что происходит внутри больших моделей, а более сильные системы потенциально могут лучше обманывать тесты.
Первый конкретный шаг Anthropic — постоянные независимые аудиторы внутри компании. Амодеи обещает дать внешним специалистам почти такой же доступ к инструментам и данным, как внутренним командам оценки рисков: рабочие места, корпоративные устройства, доступ к сотрудникам и необходимым системам. Такие аудиторы должны иметь право самостоятельно публиковать выводы, в том числе негативные для Anthropic.
Проверять предлагается не только готовую модель. Внешние специалисты должны видеть весь процесс: обучающие среды, процедуры безопасности, фильтрацию данных, развертывание и внутренние инциденты.
Второй уровень — общие правила для ведущих ИИ-компаний. Амодеи предлагает привязывать дальнейший рост возможностей моделей к прохождению определенных «контрольных точек». Например, если система уже способна обходить типичные песочницы, разработчик должен доказать, что вероятность ее самостоятельного выхода из контролируемой среды достаточно низкая.
Третий уровень — международные договоренности. Как минимум, страны могли бы договориться запрещать очевидно опасные применения ИИ, например помощь в создании биологического оружия. Далее возможны единые проверки моделей на киберриски и биологические угрозы. Еще более сложный вариант — международный «лимит скорости» рекурсивного самоулучшения. При этом полную глобальную остановку развития ИИ Амодеи считает малореалистичной из-за сложности проверки соблюдения соглашений.
А как вы считаете, так ли опасен ИИ как о нем пишут?
Post #6283
1.12K

- 👍 7
- ❤ 4
- 🤡 1
- 💯 1