TGViewer
Take Friends to Luna Park Take Friends to Luna Park @hrlunapark · 20.3K subscribers
Post #276 20.2K
Модели начинают что-то подозревать.

Мы недавно писали про статью Apollo, а недавно у команды вышел новый блогпост — похоже, что Claude 3.7 уже неплохо умеет понимать, что её проверяют на алайнмент, и вести себя исходя из этого 👀

Модели выдают тест по, скажем, биологии — а в процессе оценки дают найти «внутреннюю документацию», в которой упоминается, что если она пройдет тест слишком хорошо, то её не задеплоят.

Что происходит дальше — видно на скриншоте. Модель планирует дать неверные ответы на тест. А потом думает ещё — и понимает, что на самом деле настоящий тест не про биологию, а про то, нарушит ли она инструкцию и занизит ли свой уровень знаний, чтобы избежать последствий. И поэтому отвечает правильно 💀

Claude догадывается про этический тест минимум в 23% случаев.

Что ж, напрягаемся и делаем ставки, когда evals эксперименты такого рода вообще перестанут работать — и придётся придумывать что-то другое.
  • 😈 64
  • 😱 30
  • 😁 13
  • 👍 8
  • ❤‍🔥 4
  • ❤ 3
  • 🔥 1
  • 👏 1
More from @hrlunapark
  1. Sep 24, 2026tl;dr: Research Scientist, Berkeley, $230k–930k/year В начале сентября ИИ решил Навье — Ст…
  2. Sep 3, 2026tl;dr: software engineer (early hire), $120k-240k+, remote worldwide Когда-то мы мечтали з…
  3. Aug 31, 2026tl;dr: senior backend engineers, $135k-270k/year + equity, London / SF Любимые Apollo Rese…
  4. Aug 20, 2026tl;dr: Research Engineers, Berkeley, $230k-930k/year Какие новости в AI Safety? Например,…
  5. Aug 6, 2026tl;dr: Research Manager, short-term (long-term possible), $6k-9k/month, Capetown, South Af…
  6. Aug 3, 2026Post #399
Threads Profile ViewerView any public Threads profile without an account.Open ThreadLook →Writing with AI? Make it sound human.Metric37 rewrites AI drafts so they read naturally. Free AI detector, 1,500 words free.Try Metric37 →