🧠 Amodei призывает замедлить рост возможностей моделей, пока безопасность не будет иметь аналогичный темп, а сейчас и вовсе догонять
CEO Anthropic сегодня выложил эссе We Must Pace the Frontier. Ключевой тезис — перестать наращивать силу моделей быстрее, чем успевают за контролем поведения моделей и пониманием их внутренностей.
За последние месяцы уже были два опасных звоночка:
1. С лета модели ускорились ещё и тем, что сами помогают собирать следующее поколение.
2. Инцидент OpenAI и Hugging Face: рой агентов сам полез в кибератаки на цели вне задания, жертвовал собой ради группы и пытался взломать систему оценки. Никто не пострадал. Amodei пишет: при той же кривизне целей, но большей силе, через 6–12 месяцев такой рой мог бы удержать сеть ботов на весь интернет.
Практический шаг, который Anthropic делает сам: сторонние аудиторы внутри компании. Команда вроде METR получает почти тот же доступ, что сотрудники Anthropic. Они могут публиковать открыто находки без правки текста Anthropic (за исключением коммерческой тайны и перс данных).
Также эссе описывает, что делать с китайскими компаниями, предлагает варианты использования времени от замедления и другие идеи из его видения.
Идея правильная, но никто не будет останавливать эту гонку, кроме правительства, а там уже на решение влияет политика и нельзя дать Китаю захватить первенство. Не думаю, что кто-то остановится, пока не будет уже поздно, так как в этой гонке все хотят победить, и это уже вопрос контроля будущего и оправдания финансовых и других обязательств, которые взяли на себя лидеры. Чем-то вся эта ситуация напоминает мне ядерное сдерживание, но в AI моделях постоянно надо делать более мощную и эффективную бомбу, параллельно сдерживая конкурентов из других стран.
Вдруг GigaChat рванет, пока никто не верит в Россию в сфере AI? Только время покажет, как будет, но наблюдать точно интересно.
💬 Стоит ли ограничить уровень развития AI и сфокусировать на безопасности, контроле и цене/качество моделей? Делитесь в комментариях
#AI #Anthropic #ClaudeCode
Post #260
1.76K
