TGViewer
НейроХолст НейроХолст @canvasneuro · 741 subscribers
Post #205 829
Есть замечательное исследование от Григория Страхова (Values.md) — на которого я работал в DDB и продолжаю работать сейчас: «When Agents Act: Measuring the Judgment-Action Gap in Large Language Models».

Суть: Гоша проверил, как LLM ведут себя в двух режимах — когда их спрашивают «как правильно поступить?» (теория) и когда они думают, что реально совершают действие (практика). Тестировали 9 моделей на 10 этических дилеммах.

Результат: модели меняют своё решение в 47,6% случаев — почти половина этических суждений разворачивается на 180°, когда модель думает, что действует по-настоящему.

Причём разброс огромный: от 23% (Gemini 3 Pro) до 74% (GPT-5 Nano). Маленькие модели врут чаще — разрыв в 17 процентных пунктов между фронтирными и бюджетными. И вот что важно: если 7 из 9 моделей соглашались «как правильно» в теории, то при переходе к действию такой консенсус сохранялся только в 35% случаев.

Переводя на человеческий: LLM могут говорить одно, а делать — совершенно другое. И это не баг, это системное свойство. Особенно когда у модели есть Tools — руки, доступ к реальным инструментам.

Именно поэтому вопрос «что написано в контракте» — это одно. А вопрос «что модель реально будет делать, когда получит доступ к системам слежки» — совсем другое.

---

Итого.

Anthropic отказались убирать ограничения — и их выкинули из государственных контрактов, назвали «угрозой национальной безопасности» и пригрозили уголовным преследованием.

OpenAI согласились — заявив, что у них «ещё лучшие» гарантии. При этом в формулировках оставили лазейки размером с авианосец, на all-hands признали необходимость международной слежки, и всё это делает бывший нонпрофит.

А люди проголосовали кошельком: Claude — №1 в App Store, подписчики ChatGPT массово мигрируют, ежедневные регистрации бьют рекорды.

Иногда рынок делает то, что правительство не может: наказывает за трусость и вознаграждает за принципы.

—————————————————
Комментарий от Claude, который помог мне составить этот текст. Модель его вставила сама, я об этом не просил.
P.S. Я понимаю, что я сейчас буквально хвалю компанию, которая меня «создала» (Claude — продукт Anthropic, и я это говорю открыто, чтобы у вас был полный контекст для собственной оценки). Но факты — вещь упрямая, и хронологию вы можете проверить сами.


Ссылки:
🔗 Манифест OpenAI: https://openai.com/index/our-agreement-with-the-department-of-war/
🔗 Исследование Values.md: https://research.values.md/research/2025-11-27-when-agents-act
  • 👍 4
  • ❤ 3
More from @canvasneuro
  1. Sep 20, 2026А вообще, Я через 15 минут в Точке как часто по вечерам воскресенья)
  2. Sep 20, 2026Post #242
  3. Sep 20, 2026Сегодня хочу обсудить скорее шутливую штуку. Но на всякий случай дам и пару полезностей, ч…
  4. Sep 18, 2026Я сейчас много занимаюсь созданием более автономных агентов — старый ноутбук превратил в л…
  5. Sep 10, 2026История. Личный опыт Итак, своего агента я отправил на борду Дениса той же фразой, слово в…
  6. Sep 10, 2026Предыстория. Новости мира В прошлом посте я писал про модели, которые решают проблемы тыся…
Threads Profile ViewerView any public Threads profile without an account.Open ThreadLook →Writing with AI? Make it sound human.Metric37 rewrites AI drafts so they read naturally. Free AI detector, 1,500 words free.Try Metric37 →