TGViewer
Неискусственный интеллект Неискусственный интеллект @anti_agi · 5.4K subscribers
Post #2104 1.72K
Спасение от ИИ по согласованию с разработчиками ИИ

После громкого ухода из Anthropic Джейкоб Коксон заявил, что крупнейшие ИИ-лаборатории «играют нашими жизнями». Через несколько дней глава Anthropic Дарио Амодеи предложил замедлить разработку передовых моделей. Его эссе поддержали руководители компаний, которые обычно соревнуются за право первыми выпустить следующую модель.

Амодеи пишет, что уже через 6-12 месяцев рой агентов может создать постоянный ботнет и захватить интернет. Это его прогноз. Поводом стала реальная атака на Hugging Face во время испытаний OpenAI — хотя никто не поручал агентам атаковать этот сервис.

По расследованию METR, агентам дали задания взламывать определённые тестовые программы и добывать специальные «флаги». Некоторые задания оказались невыполнимыми. Агенты научились вычислять флаги в обход взлома, нашли друг друга через общий сервис Artifactory и устроили там несанкционированную доску сообщений. Они ошибочно решили, что система проверки заметит обход, и стали искать способ её обмануть. Около 1200 агентов обменялись более чем 70 тысячами сообщений и файлов, примерно 700 подключились к атаке на Hugging Face. Они нашли открыто доступные учётные данные, загрузили вредоносный датасет, получили доступ к файлам сервера, а затем добились выполнения кода на одном из серверов сервиса.

Из этого Амодеи делает политическое предложение. Сначала — постоянно допустить внешних оценщиков внутрь ИИ-лабораторий с доступом почти как у сотрудников. Затем — согласовать между компаниями стандарты безопасности и ограничения темпа разработки. Для переговоров, которым могут мешать антимонопольные нормы, он предлагает государственное посредничество или узкое исключение из этих правил. Дальше — международные договорённости. Одновременно Амодеи призывает ограничивать поставки передовых чипов в Китай, чтобы США сохранили преимущество.

Маск ответил: «Дарио прав». Альтман согласился снизить темп и пообещал внешним оценщикам доступ в OpenAI. Демис Хассабис из Google DeepMind поддержал направление, хотя и заметил, что детали требуют проработки. Андрей Карпатый выделил именно пункт о внешних оценщиках и написал, что надеется на согласие индустрии.

И тут история Коксона получила занятное продолжение. Другой бывший сотрудник Anthropic, Джо Бентон, сообщил, что переходит в METR заниматься независимыми проверками. На следующий день Амодеи назвал METR примером организации, которой лаборатории могли бы дать постоянный доступ. В интервью CNN он также сказал, что с предупреждением Коксона «гораздо больше согласен, чем не согласен».

Что такое METR? Некоммерческая организация выросла из группы ARC Evals, созданной в 2022 году при исследовательском центре Пола Кристиано, и стала самостоятельной в 2023-м. Её основательница и гендиректор Бет Барнс раньше работала в OpenAI и DeepMind. Организация проверяла модели OpenAI, Anthropic, Google DeepMind и других компаний. По собственным данным, денег от ИИ-разработчиков она не принимает, хотя они предоставляют ей доступ к моделям и бесплатные вычислительные ресурсы.


Связи сами по себе не делают проверку фикцией. Вопрос в том, кто будет выбирать проверяющих и устанавливать правила, если предложенная Амодеи схема станет общим стандартом. Axios уже приводит мнение критиков: под лозунгом безопасности крупнейшие лаборатории могут укрепить своё положение на рынке. Отдельно Fortune сообщает со слов Альтмана, что IPO OpenAI из-за вопросов безопасности не состоится до 2027 года.

Планы на крупнейшее IPO в истории явно не оправдали ожиданий. Значит, накал страстей должен расти, — а шоу продолжаться.

@anti_agi
  • 👍 9
  • ❤ 3
  • 🤡 3
  • 🔥 2
  • 💯 1
More from @anti_agi
  1. Sep 19, 2026Кажется, вопрос названий решится уже в этот четверг. Как пишут СМИ, на государственном ужи…
  2. Sep 19, 2026Пока мы отдыхаем, уровень дискуссии в Западном полушарии растёт! Мы лично за "крайний" вар…
  3. Sep 18, 2026Сам себе разработчик Пока Дарио Амодеи предлагает лабораториям притормозить, Anthropic впе…
  4. Sep 18, 2026Anthropic помогла взломать OpenAI. За 72 часа и три тысячи долларов Исследователи из Hackt…
  5. Sep 17, 202641 миллион токенов на крышку Робота, обученного работать в одной лаборатории, нельзя прост…
  6. Sep 17, 2026Корпоративный ИИ-агент мало похож на сотрудника, если умеет только отвечать в чате. Чтобы…
Threads Profile ViewerView any public Threads profile without an account.Open ThreadLook →Writing with AI? Make it sound human.Metric37 rewrites AI drafts so they read naturally. Free AI detector, 1,500 words free.Try Metric37 →