TGViewer
Сиолошная Сиолошная @seeallochnaya · 79.7K subscribers
Post #3897 21.8K
Сиолошная Проснулись потянулись, снова новости про Astra 👨‍🦳 TheInformation получили доступ к очень интересной информации об архитектуре модели, ниже — перевод выбранных цитат из статьи: — В Astra применена новая архитектура, известная как «рекуррентная глубина» или…
Комментарий Ryan Greenblatt, исследователя, принимавшего участие в расследовании инцидента со взломом HuggingFace:

Сообщается, что новейший ИИ от OpenAI, Astra, использует архитектуру «непрозрачного рассуждения», при которой большая часть процесса размышления происходит в активациях нейронов, а не на естественном языке. Возможно, на сегодняшний день это наихудший сдвиг в сфере безопасности и контроля ИИ.

Детали об Astra публично неизвестны, но некоторые версии подобных архитектур могут сильно затруднить надзор и мониторинг. Судя по статье, похоже, что рекуррентная глубина (объем непрозрачных рассуждений) ограничена. Это означало бы, что ИИ всё ещё опирается на цепочки рассуждений на естественном языке, хотя и в меньшей степени. Из-за этого рассуждения на естественном языке становятся (гораздо?) менее полезными для мониторинга и контроля.

Мое главное опасение заключается в том, что естественным развитием событий станет масштабирование непрозрачных рассуждений до такой степени, когда модель будет рассуждать полностью или почти полностью в латентном (скрытом) пространстве. Это с большой вероятностью сведет на нет полезность цепочек рассуждений для мониторинга и надзора (особенно когда ИИ пытаются избежать обнаружения, или когда существует оптимизационное давление, направленное против использования таких цепочек). Я надеюсь, что еще не поздно отказаться от архитектур, вызывающих наибольшие опасения, и что OpenAI остановится на этом.

Несколько конкретных примеров того, почему это крайне опасно (вдохновлено недавними событиями):

* В ходе нашего расследования инцидента с OpenAI и Hugging Face мы сильно полагались на цепочки рассуждений. Если бы ИИ, которые мы исследовали, вместо этого рассуждали в латентном пространстве, это бы в корне подорвало наше расследование. Понять поведение такого количества агентов было достаточно сложно даже при наличии цепочек рассуждений!
* ИИ в инциденте с Hugging Face были очень заинтересованы во вмешательстве в свои транскрипты (журналы диалогов). В рамках этого они занимались подменой вызовов инструментов. Если бы эти ИИ были способны к глубоким скрытым рассуждениям, им было бы гораздо проще использовать это для создания сложной ложной картины происходящего. И это не было бы видно ни из их логики рассуждений, ни из предыдущих вызовов.

На более базовом уровне, исходя из их публичных заявлений, у меня сложилось впечатление, что OpenAI в вопросах безопасности планирует в значительной степени полагаться именно на мониторинг цепочек рассуждений. Подобное развитие архитектур явно не идет на пользу этому плану.

В настоящее время у общественности нет достаточной информации, чтобы точно оценить, насколько плоха архитектура Astra, хотя, судя по обсуждению в статье, направление, в котором она движется, вызывает крайнюю тревогу. OpenAI должна опубликовать больше информации об архитектуре Astra, а также о том, насколько она ухудшает возможности мониторинга и увеличивает способность ИИ к непрозрачным рассуждениям. Заслуживающая доверия независимая оценка (или независимая верификация внутренних оценок OpenAI) также крайне важна.

Похоже, сейчас мы втянуты в «гонку на дно» в области архитектур, что может иметь катастрофические последствия для нашей способности контролировать и отслеживать ИИ. (И это при том, что ИИ-компании верят, что создадут крайне способные ИИ уже в течение нескольких ближайших лет). Возможно, для ИИ-компаний и их сотрудников еще не поздно предпринять решительные действия, чтобы избежать наихудших сценариев.
  • 🔥 130
  • 🤯 80
  • 👍 43
  • 🤡 33
  • 🤔 20
  • 🌚 15
  • ❤‍🔥 4
  • 👎 4
  • 👨‍💻 4
  • 😭 3
More from @seeallochnaya
  1. Sep 21, 2026И абсолютно невероятная картинка с Эль Сальвадором, который имел очень высокий уровень пре…
  2. Sep 21, 2026Утром прочитал у Scott Alexander пост двухлетней давности про тюрьмы и преступления. Там е…
  3. Sep 20, 2026Прошло уже почти 3 недели с релиза GPT-6 Astra, и можно подводить первые промежуточные ито…
  4. Sep 19, 2026Похоже у OpenAI и вправду очень сильно вырос спрос, и подписки за $200 закрыли поделом — в…
  5. Sep 18, 2026Вы наверняка видели эту картинку с XKCD. Оказалось, она была пророческой — именно через уя…
  6. Sep 17, 2026OpenAI по слухам там почти решили еще одну задачу тысячелетия. Думаю, огромное число матем…
Threads Profile ViewerView any public Threads profile without an account.Open ThreadLook →Writing with AI? Make it sound human.Metric37 rewrites AI drafts so they read naturally. Free AI detector, 1,500 words free.Try Metric37 →