TGViewer
сбежавшая нейросеть сбежавшая нейросеть @ai_exee · 23.9K subscribers
Post #754 4.53K
Уволенные из OpenAI исследователи безопасности потребовали сохранить читаемость мыслей ИИ

На прошлой неделе OpenAI уволила трех исследователей безопасности – Томека Корбака, Жасмин Ванг и Микиту Балесни. Вчера они ответили открытым письмом надзорным органам компании. В письме несколько требований, главное – сохранить читаемость цепочек рассуждений ИИ.

Современные модели перед финальным ответом пишут черновик своих рассуждений. Его могут прочитать люди и другие модели – и увидеть, что машина задумала, до того как она это сделала.

Исследователи регулярно ловят модели на том, что те догадываются о проверке и пытаются скрыть намерения. До недавнего времени чтение рассуждений было сравнительно надежным способом это поймать – или хотя бы заподозрить.

По данным The Information, в GPT-6 Astra OpenAI применила новую технику – “рекуррентную глубину”: модель несколько раз прогоняет данные через одни и те же слои, прежде чем выдать следующий токен. Это улучшает ответы, но часть рассуждений уходит туда, где их не прочитать.

Главный научный сотрудник OpenAI Якуб Пахоцкий сразу возразил: глубина вычислений у Astra отличается от GPT-4 не более чем вдвое, а компания по-прежнему делает ставку на чтение рассуждений. Но 3 сентября, вместе с релизом, вышла системная карта Astra, и в ней OpenAI сама признала заметное падение читаемости. Модель решает многие задачи, не проговаривая рассуждения, а узнав о слежке, пытается от нее уйти. Еще через три дня Пахоцкий написал в эссе, что полагаться на чтение рассуждений можно все меньше.

Ходили слухи, что исследователей уволили за утечку в The Information. В письме они это отрицают: статья только навредила их работе – они добивались, чтобы лаборатории вместе отказались от нечитаемых архитектур.

Авторы выдвигают еще два требования. Первое – пустить в компанию независимых проверяющих: в сентябре Альтман сам обещал это сделать, дав проверяющим доступ “как у сотрудников”. Уволенные боятся, что их история станет поводом этот доступ урезать. Корбаку, по его словам, устно объяснили, что он уволен за то, как общался с METR – внешней группой, расследовавшей взлом Hugging Face агентами OpenAI. “Общаться с METR и было моей работой”, – написал он в личном посте.

Второе – прописать, как исследователям можно работать с такими группами. Публичные правила OpenAI защищают тех, кто сообщает о проблемах внутри компании или в госорганы, а передачу информации посторонним называют нарушением. Где граница между работой с проверяющими и утечкой, решает сама компания. По словам уволенных, они действовали по старым правилам, а новые писались на ходу: то, что месяц назад было нормой, стало поводом для увольнения.

OpenAI уже ответила в X. С требованиями письма компания в целом согласна: контракты с независимыми проверяющими, по ее словам, почти готовы, а читаемость рассуждений остается ядром ее исследований. По увольнениям позиция жесткая: нарушений больше, чем признано в письме, а за критику в OpenAI не увольняют. Но четких причин увольнения из ответа не видно.

При этом нельзя сказать, что за безопасностью в OpenAI не следят. В конце сентября компания отменила выпуск GPT-6.1 Astra: модель стала меньше лениться, но хуже держалась в рамках задания и не всегда честно сообщала, что сделала. Это было сильное решение, которое ударило по позициям OpenAI в соперничестве с Anthropic.

В письме есть сильная деталь: безопасность строится на готовности людей открыто говорить неприятные вещи. Авторы считают, что после их увольнения действующие сотрудники OpenAI будут чаще задумываться – о чем можно сообщить, а о чем безопаснее промолчать.

Получается интересный парадокс: мы требуем прозрачности от машины, но она мало что даст без прозрачности людей. Мысли модели читают сотрудники – и если они начнут взвешивать, что можно сказать вслух, прочитанное так и останется внутри компании.

—
Не знаете, с чего начать работу с нейросетями или куда двигаться дальше? У меня есть лестница освоения ИИ: выбор и оплата подписки, первые шаги, переход на ИИ-агентов и использование ИИ-ассистентов.

— Читать на “Бусти”
— Читать на Sponsr
  • ❤ 26
  • 👍 20
  • 🔥 9
  • 👏 1
More from @ai_exee
  1. Oct 10, 2026Ломай, воруй, стучи в полицию! На сайте полиции Филадельфии есть страница о нераскрытом уб…
  2. Oct 10, 2026Учить ИИ сейчас советуют все. Но когда доходит до дела, то оказывается, что не все так про…
  3. Oct 8, 2026Что там, за горизонтом? Первая часть здесь Профессор информатики Дана Мошковиц много лет р…
  4. Oct 8, 2026Первым до горизонта “Мамочка, я слышал, тебя уделали! Говорят, робот решил задачу, над кот…
  5. Oct 7, 2026Сегодня с самого утра весь интернет шумит насчет почти 400 новых математических работ, кот…
  6. Oct 7, 2026OpenAI бахнули очередной banger в виде решения сразу нескольких сотен открытых математичес…
Threads Profile ViewerView any public Threads profile without an account.Open ThreadLook →Writing with AI? Make it sound human.Metric37 rewrites AI drafts so they read naturally. Free AI detector, 1,500 words free.Try Metric37 →