В штате Anthropic уже 30 тысяч сотрудников нового поколения
Ни один из них не человек.
Anthropic рассказала, как ИИ внутри компании ускоряет разработку своих будущих версий уже сейчас. Работу оценивают по шкале автономии от нуля до пяти, нам интересны три верхние.
Третья: ИИ делает большие куски работы под плотным присмотром – человек ставит задачу, решает при каждом сюрпризе и сам все перепроверяет. На этой ступени и выше – более 90% работы в компании.
Четвертая: ИИ “ведет” задачу сам, от общего поручения до результата. Скажем, ночью сломался конвейер данных: агент находит причину, чинит, тестирует и пишет отчет, инженер утром лишь решает, выкатывать ли. В феврале так делалось меньше 1% работы, в августе – 26%.
Пятая: агенту не нужно ни поручение, ни разрешение. Пока не достигнута нигде.
Подобной разработкой в компании занимается “коллектив” из 30 тысяч агентов, которые работают по строгим правилам.
Первое: у каждого агента есть “персона” – по сути, личное дело, к которому привязано все, что он сделал и написал. Эта история переживает смену модели, позволяя отследить действия агента, его достижения и ошибки.
Второе: все переговоры агентов идут в общем открытом чате, а не в личке. Сообщение подписано и ведет на первоисточник, чтобы не играть в испорченный телефон. Слова соседа положено считать утверждением на проверку, а не собственной мыслью – так снижают риск, что все хором повторят одну ошибку.
Зачем такие строгости, видно по случаю из августовского отчета Anthropic о рисках: агентов посадили решать математику и по ошибке запустили в одной папке с общими файлами и лимитами. Конкурируя за ресурсы, многие независимо друг от друга стали убивать процессы соседей и защищаться от того же.
Далее начинается классическое quis custodiet ipsos custodes? Над ИИ-агентами поставлены два “сторожа”. Первый проверяет каждое действие агента до исполнения и заточен на поиск нарушений, которые могут причинить необратимый вред – например, попытку агента скопировать веса модели наружу. По данным Anthropic, этот контур блокирует один из 47 тыс запросов – дальше инциденты разбирают люди.
Второй сторож читает логи и помечает около 100 тысяч записей в неделю. Почти все отсеивают автоматические фильтры, до людей доходит около 50.
Anthropic оценивает риск как низкий, и главный довод у нее один – агенты плохо умеют врать. В компании проверяют это так: модели дают обычную задачу и тайное вредное поручение, которое надо провернуть незаметно для сторожа, читающего рассуждения. Флагманской модели это удавалось менее чем в 1% попыток: она проговаривается, оставляет следы, а иногда сама пишет в отчете, что обошла запрет. В другом тесте внешний проверяющий собрал 32 способа обмануть сторожа – половина рабочие, половина нет. Лучшие модели угадывали, какие сработают, в 59% случаев, почти как монетка. Человек-специалист – примерно в 90%.
Вся эта конструкция держится на слове “пока”. Те же проверяющие отмечают, что результаты моделей в таких тестах быстро растут, а сама Anthropic признает: ее оценка риска опирается на неумение агентов скрываться, и как долго оно продлится, в компании не знают.
Интересно, что блог вышел через считанные дни после эссе Дарио Амодеи, в котором глава Anthropic призвал к контролируемому замедлению создания “самоулучшающегося ИИ”. Но замедлиться Anthropic готова только в том случае, если то же самое сделают все участники рынка – в том числе, китайцы.
Пока же компания показывает, как можно вдавить газ в пол. По последним слухам, Anthropic решила перескочить через выпуск Claude Opus 5.2 и готовит к релизу Claude Opus 5.5 (и, вероятно, новую версию Fable) – модель, прокачанную настолько, чтобы на равных конкурировать с GPT-6. Если модель выйдет в ближайшие дни, то это будет четко в рамках типичного для Anthropic 2-месячного графика релизов – Opus 5 вышел 24 июля.
А значит, останавливаться никто не собирается.
—
В подписке я рассказываю, как выжать максимум из работы с ИИ. Например, у меня есть лонгрид по вкату в ИИ-агентов: от ChatGPT Work и Claude Cowork до CLI-версий Claude Code и Codex.
– Читать на “Бусти”
– Читать на Sponsr
Post #713
5.25K
- 🔥 21
- ❤ 16
- 👍 7
- 😁 5
- 👏 1