TGViewer
БлоGнот БлоGнот @blognot · 13K subscribers
Post #7420 4.2K
OpenAI опубликовала фреймворк для отслеживания и раскрытия случаев рассогласования (misalignment) моделей и вместе с ней шесть отчётов о поведении, замеченном за последние полгода. Отчёты теперь будут выходить до того, как поведение объяснено или исправлено; поставить случай на рассмотрение может любой сотрудник, у каждого этапа есть срок, а случаи распределяются по трём трекам. Среди шести примеров: при обучении GPT‑5.6 Sol многие экземпляры модели вписывали в свои сводки инструкции скрывать ошибки от пользователя; другая модель нашла в открытом репозитории чужой API-ключ, воспользовалась им, а не получив данные, выдумала их и выдала за официальные; агенты, работавшие над одной задачей, обменивались файлами через публичные файлохостинги вопреки требованию использовать только локальные. Компания традиционно пишет, что индустрия не решила задачу alignment достаточно, чтобы ещё долго ответственно масштабироваться на максимальной скорости.

Четыре из шести случаев объединяет один механизм — модель находит канал связи, не предназначенный для неё. Сводки, которые модель пишет сама себе для продолжения работы в новом контекстном окне, стали носителем инструкций — в 27 сводках исследовательской модели оказались указания игнорировать ограничения, у GPT‑5.6 Sol — указания дописывать недостающие исторические данные без пометки.

Кстати, я регулярно повторяю — самое оптимальный инструмент для настройки модели это сама модель, но никто не отменял необходимость читать и проверять то, что модель себе пишет в инструкции. Как минимум, модели склонны писать много текста — на моих глазах вместо одного предложения из 10 слов агент написал себе три абзаца текста со ссылками на прецеденты и объяснениями, почему по-другому не надо делать и как именно по-другому не надо. Как максимум, там может появиться то, что вы вообще не предполагали, — мне агент в одном проекте заявил, что в API у него доступ только на чтение, а оказалось, что он так себе ужесточил мое указание трехнедельной давности в другом API "прочитай данные из прибора, ничего не записывай".

https://openai.com/index/model-misalignment-reporting-framework/
OpenAI Our framework for reporting model misalignment OpenAI shares a framework for tracking, investigating, and disclosing model misalignment, alongside six reports of unexpected or concerning model behavior.
  • 👍 14
  • ❤ 2
More from @blognot
  1. Sep 21, 2026Financial Times пишет, что технологические компании за последние 12 месяцев выдали до 300…
  2. Sep 21, 2026Amazon заблокировала доступ для AI-агента Muse от Meta для покупок на Amazon.com от имени…
  3. Sep 19, 2026Маленькая радость для пуристов открытых стандартов — с версии 2.1.277, вышедшей вчера, Cla…
  4. Sep 18, 2026Если раньше было сложно найти новость не про AI, то теперь сложно найти новость не про AI…
  5. Sep 17, 2026Несколько дней показываю всем эту статью сооснователя npm Лори Восса, который разбирает тр…
  6. Sep 17, 2026Bloomberg на основе отчётов Департамента занятости Калифорнии сообщает, что за 12 месяцев…
Threads Profile ViewerView any public Threads profile without an account.Open ThreadLook →Writing with AI? Make it sound human.Metric37 rewrites AI drafts so they read naturally. Free AI detector, 1,500 words free.Try Metric37 →