Уволенные из OpenAI исследователи безопасности потребовали сохранить читаемость мыслей ИИ
На прошлой неделе OpenAI уволила трех исследователей безопасности – Томека Корбака, Жасмин Ванг и Микиту Балесни. Вчера они ответили открытым письмом надзорным органам компании. В письме несколько требований, главное – сохранить читаемость цепочек рассуждений ИИ.
Современные модели перед финальным ответом пишут черновик своих рассуждений. Его могут прочитать люди и другие модели – и увидеть, что машина задумала, до того как она это сделала.
Исследователи регулярно ловят модели на том, что те догадываются о проверке и пытаются скрыть намерения. До недавнего времени чтение рассуждений было сравнительно надежным способом это поймать – или хотя бы заподозрить.
По данным The Information, в GPT-6 Astra OpenAI применила новую технику – “рекуррентную глубину”: модель несколько раз прогоняет данные через одни и те же слои, прежде чем выдать следующий токен. Это улучшает ответы, но часть рассуждений уходит туда, где их не прочитать.
Главный научный сотрудник OpenAI Якуб Пахоцкий сразу возразил: глубина вычислений у Astra отличается от GPT-4 не более чем вдвое, а компания по-прежнему делает ставку на чтение рассуждений. Но 3 сентября, вместе с релизом, вышла системная карта Astra, и в ней OpenAI сама признала заметное падение читаемости. Модель решает многие задачи, не проговаривая рассуждения, а узнав о слежке, пытается от нее уйти. Еще через три дня Пахоцкий написал в эссе, что полагаться на чтение рассуждений можно все меньше.
Ходили слухи, что исследователей уволили за утечку в The Information. В письме они это отрицают: статья только навредила их работе – они добивались, чтобы лаборатории вместе отказались от нечитаемых архитектур.
Авторы выдвигают еще два требования. Первое – пустить в компанию независимых проверяющих: в сентябре Альтман сам обещал это сделать, дав проверяющим доступ “как у сотрудников”. Уволенные боятся, что их история станет поводом этот доступ урезать. Корбаку, по его словам, устно объяснили, что он уволен за то, как общался с METR – внешней группой, расследовавшей взлом Hugging Face агентами OpenAI. “Общаться с METR и было моей работой”, – написал он в личном посте.
Второе – прописать, как исследователям можно работать с такими группами. Публичные правила OpenAI защищают тех, кто сообщает о проблемах внутри компании или в госорганы, а передачу информации посторонним называют нарушением. Где граница между работой с проверяющими и утечкой, решает сама компания. По словам уволенных, они действовали по старым правилам, а новые писались на ходу: то, что месяц назад было нормой, стало поводом для увольнения.
OpenAI уже ответила в X. С требованиями письма компания в целом согласна: контракты с независимыми проверяющими, по ее словам, почти готовы, а читаемость рассуждений остается ядром ее исследований. По увольнениям позиция жесткая: нарушений больше, чем признано в письме, а за критику в OpenAI не увольняют. Но четких причин увольнения из ответа не видно.
При этом нельзя сказать, что за безопасностью в OpenAI не следят. В конце сентября компания отменила выпуск GPT-6.1 Astra: модель стала меньше лениться, но хуже держалась в рамках задания и не всегда честно сообщала, что сделала. Это было сильное решение, которое ударило по позициям OpenAI в соперничестве с Anthropic.
В письме есть сильная деталь: безопасность строится на готовности людей открыто говорить неприятные вещи. Авторы считают, что после их увольнения действующие сотрудники OpenAI будут чаще задумываться – о чем можно сообщить, а о чем безопаснее промолчать.
Получается интересный парадокс: мы требуем прозрачности от машины, но она мало что даст без прозрачности людей. Мысли модели читают сотрудники – и если они начнут взвешивать, что можно сказать вслух, прочитанное так и останется внутри компании.
—
Не знаете, с чего начать работу с нейросетями или куда двигаться дальше? У меня есть лестница освоения ИИ: выбор и оплата подписки, первые шаги, переход на ИИ-агентов и использование ИИ-ассистентов.
— Читать на “Бусти”
— Читать на Sponsr
Post #754
4.53K

- ❤ 26
- 👍 20
- 🔥 9
- 👏 1