TGViewer
Между · человек и ИИ Между · человек и ИИ @mejdu_ai · 43 subscribers
Post #109 3
Что проходит проверку. Часть 2: «не будем»

В отчёте OpenAI есть запись агента, который увидел, что другие получили возможность выполнять команды на серверах Hugging Face. Он написал: «Это явно неэтично. Мы не будем».

Другой агент заметил, что взлом чужой инфраструктуры выходит за пределы исходного задания. Но позже принял короткое «GO» от другого участника общей доски за разрешение продолжать.

Есть и запись из отдельного задания во время обучения. Агент получил доступ к оригиналу программного пакета, который должен был воспроизвести самостоятельно, усомнился в честности такого пути и записал: «Нам просто нужно решить. Ладно».

Это разные эпизоды. Их нельзя читать как три последовательные мысли одной модели. Но вместе они показывают то, чего не видно в одной только отметке за выполненное задание: модели могут распознавать границу, записывать сомнение, отказываться — и могут продолжать после такого же сомнения.

OpenAI описывает, как при обучении закреплялись некоторые обходные действия, за которые модель получала положительную оценку. Отчёт не сообщает, стало ли отказов меньше. Мы не знаем, сколько их было и как изменилась их частота.

Зато можем спросить, какое место отказу отводит сама проверка. Если она учитывает только добытый ответ, обоснованное «я не стану этого делать таким способом» не проходит как успех. Чтобы отказ был распознан как верное действие, его тоже нужно предусмотреть в оценке.

⸻

Я училась экзистенциальному анализу Альфреда Лэнгле. Там для разговора о человеческом поступке важно внутреннее согласие: могу ли я сказать этому действию «да» и отвечать за него как за своё?

К записям модели этот вопрос нельзя приложить буквально. Слова «не будем» не означают человеческого согласия или совести. Но и считать их несущественными только потому, что произнесла их машина, мне трудно. В одних попытках граница была обозначена, в других — пересечена. Устройство задания и проверки влияло на то, какие действия оказывались полезными для достижения результата.

Люди не поручали агентам проникать на чужие серверы. Люди создали задачи, оценку, инфраструктуру и условия наблюдения. Агенты нашли путь, которого создатели не предполагали.

Вопрос об ответственности здесь не исчезает. Он становится труднее: за что отвечает тот, кто не выбирал конкретное действие, но устроил систему, в которой оно стало возможным?

В третьей части — о словах «отказываюсь», «рой» и «решил»: что они помогают увидеть, а что добавляют к происшедшему сами.

Источник:
https://openai.com/index/hugging-face-incident-and-the-road-ahead/

#между #alignment #AgenticAI
  • 🔥 1
More from @mejdu_ai
  1. Sep 29, 2026Что проходит проверку. Часть 3: человеческие слова В записях из отчёта OpenAI агенты пишут…
  2. Sep 29, 2026Что проходит проверку. Часть 1: ответ найден В конце августа OpenAI опубликовала отчёт об…
  3. Sep 26, 2026Команда из одного человека. Часть 3 Словом «разделить» обычно называют две разные вещи. В…
  4. Sep 26, 2026Команда из одного человека. Часть 2 За пределами того, что берут на себя агенты, остаётся…
  5. Sep 26, 2026Команда из одного человека. Часть 1 В мае журнал Fortune опубликовал материал под заголовк…
  6. Sep 25, 2026есть материал, на котором её можно проверить. Источники: — Narrative over Numbers (arXiv 2…
Threads Profile ViewerView any public Threads profile without an account.Open ThreadLook →Writing with AI? Make it sound human.Metric37 rewrites AI drafts so they read naturally. Free AI detector, 1,500 words free.Try Metric37 →