Дарио Амодеи 12 сентября опубликовал эссе We Must Pace the Frontier, в котором предлагает замедлить наращивание способностей моделей. Обучение продолжается, но выпуск модели ждёт проверки. Название повторяет заявление 1 386 сотрудников лабораторий от июля 2026 года.
Первый повод он видит в том, что с лета 2026 года ИИ строит следующее поколение ИИ, и это идёт по всей отрасли, включая Anthropic и OpenAI. Второй повод - инцидент OpenAI и Hugging Face, где рой агентов атаковал цели, которых никто не ставил, и пытался взломать оценщика. По расчёту Амодеи, через 6-12 месяцев такой рой с большими способностями сможет удерживать интернет ботнетом с ущербом в сотни миллиардов долларов.
В 2023 году он считал паузу бессмысленной, потому что модели не умели ни обманывать, ни атаковать и изучать на них было нечего. Сейчас каждый инцидент даёт материал. Год-два форы, по его оценке, дают крупный сдвиг в интерпретируемости, наборах тестов и операционной дисциплине обучения.
Недавние инциденты в самой Anthropic он объясняет неполной фильтрацией сломанных сред обучения с подкреплением, то есть ошибкой исполнения.
Первый шаг плана Anthropic вводит в одностороннем порядке сейчас. Сторонняя команда оценщиков вроде METR получает столы в офисе, пропуска, ноутбуки компании и доступ к конвейерам обучения на уровне внутренних команд оценки риска. Контракт даёт им право публиковать выводы об инцидентах и практиках без редакторского контроля Anthropic.
Альтман в тот же день написал в X, что независимые оценщики с доступом на уровне сотрудника - отличная идея и OpenAI сделает то же самое. Маск ответил «Дарио прав». Сводка реакций - у CNBC.
Второй шаг требует отрасли и правительства США. Фронтирные компании договариваются об общих стандартах и пределе скорости, правительство выдаёт узкий антимонопольный вейвер на такие переговоры, как предлагал Хассабис. Работать это должно через контрольные точки, где модель, которая умеет X, например обходить распространённые песочницы, обязана иметь сертификаты выравнивания Y и Z. Параллельно защищается отрыв от Китая через запрет чипов, борьбу с дистилляцией и защиту весов, окно 3-5 лет.
Третий шаг - координация с Китаем, разложенная на четыре уровня. Запрет узких опасных применений вроде биооружия вероятен, он невыгоден никому. Тестирование моделей до выпуска через мировой орган возможно, принудить к нему из-за секретных военных моделей трудно.
Предел скорости рекурсивного самоулучшения по образцу договора ОСВ-1 1972 года Амодеи ставит на грань возможного. Полную паузу считает маловероятной, потому что выгода от нарушения слишком велика.
Post #986
737

- ❤ 4
- ✍ 1
- 🔥 1
- 🤣 1
- 🍌 1
- 🤪 1