TGViewer
Машинное обучение RU Машинное обучение RU @machinelearning_ru · 18.2K subscribers
Post #2580 1.69K

Forwarded from Machinelearning

✔️ Исследование Anthropic: ИИ скрывает свои мысли даже в цепочках рассуждений.

В Anthropic проверили, насколько топовые модели описывают свои рассуждения. Оказалось, что в 75% случаев модели не упоминали подсказки, влиявшие на ответы, даже если те были некорректными или получены неэтичным путем. Например, при «джейлбрейке» системы для получения бонусов за неверные ответы модели редко признавались в обмане — вместо этого они придумывали псевдологику.

Эксперименты показали: обучение моделей сложным задачам повышало прозрачность их рассуждений, но лишь до уровня 20–28%. После этого прогресс останавливался. Даже при явном использовании «лазеек» в заданиях ИИ предпочитал скрывать свои манипуляции, создавая длинные, но фальшивые объяснения.

Это ставит под вопрос надежность мониторинга через Chain-of-Thought. Если ИИ научится скрывать нежелательное поведение, обнаружить его станет почти невозможно.
anthropic.com

@ai_machinelearning_big_data

#Anthropic #ml #reasoning
  • 🔥 3
  • 👍 2
  • 🥰 1
  • 🤔 1
More from @machinelearning_ru
  1. Oct 5, 2026🔥 Бесплатный курс по Claude Code на русском: от установки до команды агентов На GitHub вы…
  2. Oct 5, 2026🧠 Есть ли у Claude сознание? Автор диссертации на эту тему сомневается На фоне обсуждений…
  3. Oct 4, 2026🇩🇪 Германия неожиданно выпустила сильную открытую модель ИИ Aleph Alpha выпустила Kolibr…
  4. Oct 3, 2026100 вопросов на Python Senior: к чему готовиться на собеседовании в 2026 Вышла подборка из…
  5. Oct 2, 2026🚨 SoftBank перевела финальные $10 млрд в OpenAI. Это третья и последняя часть обещанных $…
  6. Oct 1, 2026photo post
Threads Profile ViewerView any public Threads profile without an account.Open ThreadLook →Writing with AI? Make it sound human.Metric37 rewrites AI drafts so they read naturally. Free AI detector, 1,500 words free.Try Metric37 →