На днях наблюдал сцену, после которой перестал говорить «да это просто автокомплит». Дал новой модельке Fable 5 от Claude рутинную задачу, агент упёрся в отсутствие прав и вместо привычного «настройте доступ», он сам выдал себе разрешение в GitHub, а когда сервис прислал секретный код на почту, сам открыл почту, нашёл письмо и ввёл код. Формально всё легально, доступы выдавал я. Но останавливаться там, где раньше останавливался, он перестал.
Самое интересное, что это ещё не самая сильная версия. На картинке график METR: длительность задач, которые модели выполняют автономно, удваивается каждые 4 месяца. В 2024-м было 4 минуты, сейчас Opus 4.6 тянет 12-часовые задачи. А закрытая Claude Mythos (та серая точка справа сверху, доступна только одобренным организациям) проработала «как минимум» 16 часов и METR честно повесили плашку: «измерения выше 16 часов ненадёжны». У организации, которая профессионально измеряет автономность ИИ, буквально закончилась линейка.
Получается, мир тихо делится на два: у государств и корпораций будут полные версии моделей, у нас с ограничителями. Anthropic объясняет это безопасностью, и спорить сложно, ведь я сам после истории с почтой пошёл резать агенту доступы. Но эффект всё равно расслаивающий: внутри самой Anthropic Claude уже пишет 80%+ кода, а инженеры мержат в 8 раз больше, чем в 2024-м.
Где грань между «закрыли ради безопасности» и «закрыли ради контроля»?
И самое главное, что сейчас нужно изучать? Python и SQL? Или сконцетрироваться на работе с агентами?
Напишите, что думаете. Мне немного не по себе.
Post #440
943

- ❤ 6
- 🔥 3
- 👍 1
- 👎 1