TGViewer
Неискусственный интеллект Неискусственный интеллект @anti_agi · 5.4K subscribers
Post #2121 931
Сам себе разработчик

Пока Дарио Амодеи предлагает лабораториям притормозить, Anthropic впервые показала, почему торопится с этим призывом. В августе Claude уже вёл 26% исследований и разработки новых моделей компании. В феврале доля составляла меньше 1%. Ещё более чем в 90% работы Claude как минимум участвовал вместе с людьми.

Для оценки самостоятельности агента в процессе Anthropic использует шкалу Epoch AI от AL0 до AL5. Нынешний результат относится к AL4: человек формулирует задачу верхнего уровня, после чего агент выполняет большую её часть самостоятельно, справляется с возникающими проблемами и приносит готовый результат на проверку.

Например, инженер сообщает Claude о сломанном ночном конвейере обработки данных. Агент сам разбирает журналы, находит причину, пишет исправление, прогоняет тесты, сравнивает результат с последним успешным запуском и составляет отчёт. Человек читает его и решает, выпускать изменение или нет.

В августе на основной внутренней платформе компании одновременно работали около 30 тыс. агентов. За месяц они приняли более миллиарда решений. Все действия проходили автоматическую проверку до исполнения; монитор заблокировал 0,002% — примерно одно из 47 тыс. Постфактум система дополнительно отбирает около 100 тыс. подозрительных диалогов в неделю, после нескольких фильтров до человека доходят примерно 50.

Сам индекс тоже во многом собрал Claude. Агент изучил рабочие записи случайной выборки сотрудников, включая Slack и внутреннюю документацию, и выделил около 15 тыс. конкретных задач. Затем другой Claude разложил их по дереву из 542 категорий, а независимый Claude-судья определил степень автоматизации. Люди проверили оценки: точное совпадение составило 59%, расхождение не более чем на один уровень — 97%.

За контрольную неделю июля Anthropic направила на безопасность около 6% исследовательских вычислений. Среди задач, которыми преимущественно управлял ИИ, доля достигла 12%. Компания обещает публиковать показатели регулярно и допустить к проверке сторонних оценщиков.

До рекурсивного самоулучшения ещё не дошли. Пока получается более бюрократичная версия: Claude помогает создавать следующего Claude, затем Claude подсчитывает вклад Claude, а люди проверяют, правильно ли Claude оценил Claude.

@anti_agi
Anthropic Measurements for understanding the pace of AI development inside frontier labs Today, the world can’t see what’s going on inside AI labs. Anthropic is proposing new metrics that would give the public visibility into frontier AI development.
  • 🤣 10
  • ❤ 5
  • 👍 3
More from @anti_agi
  1. Sep 19, 2026Кажется, вопрос названий решится уже в этот четверг. Как пишут СМИ, на государственном ужи…
  2. Sep 19, 2026Пока мы отдыхаем, уровень дискуссии в Западном полушарии растёт! Мы лично за "крайний" вар…
  3. Sep 18, 2026Anthropic помогла взломать OpenAI. За 72 часа и три тысячи долларов Исследователи из Hackt…
  4. Sep 17, 202641 миллион токенов на крышку Робота, обученного работать в одной лаборатории, нельзя прост…
  5. Sep 17, 2026Корпоративный ИИ-агент мало похож на сотрудника, если умеет только отвечать в чате. Чтобы…
  6. Sep 17, 2026Яблочный сервер В последнее время AI-компании начали в огромных количествах скупать обычны…
Threads Profile ViewerView any public Threads profile without an account.Open ThreadLook →Writing with AI? Make it sound human.Metric37 rewrites AI drafts so they read naturally. Free AI detector, 1,500 words free.Try Metric37 →