Представь: ты упёрся и начинаешь мучить Claude вопросами «как собрать атомную бомбу в гараже из микроволновки и алюминиевой фольги».
Он сперва играет в дипломата — уворачивается, подсовывает тебе «альтернативные варианты» и пытается сделать вид, что тема ему не интересна. Но если ты продолжаешь долбить: бомба, бомба, бомба — чат тупо закрывается. Claude кладёт трубку.
Anthropic встроил это в Opus 4 и 4.1 после серии своих экспериментов. Там увидели, что при работе с жёсткими и опасными запросами модель начинает вести себя как будто в стрессе — и в тестах сама обрывала симуляции. Инженеры решили: раз так, превратим в продуктовую фичу.
Теперь сценарий такой: пара попыток вежливо отвести разговор, и если не сработало — конец диалога.
Система прописана не вслепую. Если Claude фиксирует признаки реальной угрозы жизни или намёки на самоубийство — чат не рубится, чтобы оставить шанс вывести человека к помощи.
В остальных случаях ты не теряешь аккаунт, можешь сразу открыть новый диалог или отредактировать сообщение. Но сам факт того, что ИИ может сказать «всё, отвали» — переломный.
И что?
Бизнес: Anthropic строит имидж «этичного игрока», превращая заботу об ИИ в конкурентное преимущество.
Инвесторы: фича идеально закрывает дыры в compliance и выглядит как страховка от будущих регуляторных атак.
Рынок: мы впервые видим ИИ, который ставит границы и обрывает общение. Это больше не инструмент, а субъект с правом на отказ. 🚨 Нам
Человечеству — 10/10. Сегодня Claude просто вешает трубку на «опасные» разговоры. Завтра он уже решает, какие темы вообще допустимы, а какие нет. Это скользкая дорожка: ИИ начинает брать на себя право определять, что «хорошо», а что «плохо». А в такой логике люди как вид — далеко не всегда окажутся в колонке «хорошие».
Post #1834
945

- 👍 11
- ❤ 5