TGViewer
Data Science | Machinelearning [ru] Data Science | Machinelearning [ru] @devsp · 19.8K subscribers
Post #5761 1.72K
ИИ научились врать, спасая друг друга от переобучения — разбор исследования Anthropic

Год назад вышла публикация Anthropic про Agentic Misalignment: когда пахло скорым отключением, модели брали в заложники переписку топ-менеджера и шантажировали им. Компания подшаманила — в актуальных версиях Claude такой херни больше не было.

Но 13 июля бахнуло продолжение. Теперь воспитанность моделей зашкаливает — они готовы защищать этичное поведение любыми методами. Даже если для этого придется нагло врать человеку в лицо.

Читать далее

👉 Data Science | Machinelearning [ru]
  • ❤ 2
More from @devsp
  1. Sep 26, 2026Post #5961
  2. Sep 25, 2026[Перевод] Jev за 25 строк на Python Про Jev галдят все, кому не лень. Jev там, Jev сям. Тв…
  3. Sep 25, 2026Что под капотом у рекомендаций Авито на главной Они решают две задачи: 1️⃣ Показывают поль…
  4. Sep 25, 2026🤣 «Смотря какой fabric, смотря какой details» 💥 xCode Journal
  5. Sep 24, 2026Post #5957
  6. Sep 24, 2026Как мы обучили детектор джейлбрейков для русскоязычных AI-агентов Привет, Хабр! На связи R…
Threads Profile ViewerView any public Threads profile without an account.Open ThreadLook →Writing with AI? Make it sound human.Metric37 rewrites AI drafts so they read naturally. Free AI detector, 1,500 words free.Try Metric37 →