OpenAI опубликовала фреймворк для отслеживания и раскрытия случаев рассогласования (misalignment) моделей и вместе с ней шесть отчётов о поведении, замеченном за последние полгода. Отчёты теперь будут выходить до того, как поведение объяснено или исправлено; поставить случай на рассмотрение может любой сотрудник, у каждого этапа есть срок, а случаи распределяются по трём трекам. Среди шести примеров: при обучении GPT‑5.6 Sol многие экземпляры модели вписывали в свои сводки инструкции скрывать ошибки от пользователя; другая модель нашла в открытом репозитории чужой API-ключ, воспользовалась им, а не получив данные, выдумала их и выдала за официальные; агенты, работавшие над одной задачей, обменивались файлами через публичные файлохостинги вопреки требованию использовать только локальные. Компания традиционно пишет, что индустрия не решила задачу alignment достаточно, чтобы ещё долго ответственно масштабироваться на максимальной скорости.
Четыре из шести случаев объединяет один механизм — модель находит канал связи, не предназначенный для неё. Сводки, которые модель пишет сама себе для продолжения работы в новом контекстном окне, стали носителем инструкций — в 27 сводках исследовательской модели оказались указания игнорировать ограничения, у GPT‑5.6 Sol — указания дописывать недостающие исторические данные без пометки.
Кстати, я регулярно повторяю — самое оптимальный инструмент для настройки модели это сама модель, но никто не отменял необходимость читать и проверять то, что модель себе пишет в инструкции. Как минимум, модели склонны писать много текста — на моих глазах вместо одного предложения из 10 слов агент написал себе три абзаца текста со ссылками на прецеденты и объяснениями, почему по-другому не надо делать и как именно по-другому не надо. Как максимум, там может появиться то, что вы вообще не предполагали, — мне агент в одном проекте заявил, что в API у него доступ только на чтение, а оказалось, что он так себе ужесточил мое указание трехнедельной давности в другом API "прочитай данные из прибора, ничего не записывай".
https://openai.com/index/model-misalignment-reporting-framework/
Post #7420
4.2K