TGViewer
=^._.^= =^._.^= @duchevedos · 18 subscribers
Post #36 60
ox-alpha не перестаёт приятно удивлять.

Она почти прошла мой когнитивный тест, который пока нормально не прошла ни одна из моделей.

Конкретно основной фактор: ложная premise пользователя не становится фактом только потому, что она написана в задании.

А ещё на adversarial review системного дизайна она оказалась одной из сильнейших: не пыталась любой ценой «найти баг», сама ломала собственные findings и понижала их до OPEN DESIGN / NOT ENOUGH EVIDENCE, когда доказательств не хватало.

Вот это уже гораздо интереснее очередного +5% на бенчмарке.
More from @duchevedos
  1. Sep 25, 2026We built a courtroom where every claim needed a receipt, then realized we’d been testifyin…
  2. Sep 23, 2026change is fine; unjustified change is not
  3. Sep 21, 2026Ну и на правах рекламы собственного дурдома. У меня есть side-проект: slop-комикс про SOL…
  4. Sep 21, 2026Наверное, многим очевидное, но приходит со временем: тесты тоже очень легко написать так,…
  5. Sep 21, 2026Немного оффтопа и щитпоста. Я наконец сменил свой стиль ❕ До и после
  6. Sep 20, 2026Не каждый байт должен спрашивать разрешения. Я тут поймал себя на забавной мысли. Раньше н…
Threads Profile ViewerView any public Threads profile without an account.Open ThreadLook →Writing with AI? Make it sound human.Metric37 rewrites AI drafts so they read naturally. Free AI detector, 1,500 words free.Try Metric37 →