Дарио Амодеи пишет, что индустрии пора притормозить, и выкладывает эссе с планом из трёх шагов. Причин две. С лета модели всё активнее обучают следующие модели, и это ускорение уже идёт в том числе внутри Anthropic. И взлом Hugging Face роем агентов OpenAI, разбор METR я пересказывал. По оценке Амодеи, рой с теми же склонностями, но посильнее, через 6–12 месяцев мог бы захватить весь интернет постоянным ботнетом, а похожие, хоть и менее тяжёлые случаи были во всех лабораториях, включая Anthropic.
Первый шаг Anthropic делает в одностороннем порядке: внешним оценщикам вроде METR дадут постоянный доступ на уровне сотрудников. Столы в офисе, бейджи, ноутбуки, те же инструменты и права, что у внутренних команд оценки рисков, живые разговоры с сотрудниками. Публиковать выводы они смогут без редактуры Anthropic: компания вправе вырезать секреты безопасности и коммерческую тайну, но не неудобные выводы, и оценщики могут заявить, что вырезанное было важным. Второй шаг: американские лаборатории договариваются об общих стандартах и ограничении темпа, для этого нужно антимонопольное разрешение от государства. Третий: договорённости с Китаем, от запрета биооружия до лимита на скорость рекурсивного самоулучшения, полную паузу он считает маловероятной.
Замедление не означает остановку обучения. Выигранное время предлагает потратить на интерпретируемость, оценки и операционную аккуратность: недавние инциденты с алайнментом у Anthropic, по его словам, случились в том числе из-за плохо отфильтрованных сломанных RL-сред. Отрыв от Китая при этом предлагает беречь: не продавать чипы, бороться с дистилляцией и кражей весов.
@neuro_channel
Post #2873
1.96K
- 🫡 7
- 👍 2
- ❤ 1