TGViewer
Самые умные мысли Павла Комаровского (и немножко щитпостинг) Самые умные мысли Павла Комаровского (и немножко щитпостинг) @rationalshitposting · 12.7K subscribers
Post #1087 3.24K
Подумал, кстати, что интересно было бы оценить нашу дискуссию с Иваном Ямщиковым трехлетней давности с точки зрения того, что произошло с тех пор. Попросил GPT-5.6 Sol, а также Claude Opus 5 выделить основные тезисы сторон, и сравнить их с текущим положением вещей — что состарилось хорошо, а что не очень (ссылки на их анализ выше).

С точки зрения проблемы AI alignment мы явно за последние три года продвинулись в сторону "риск выше, а не ниже":

— Способности ИИ за это время видимо прокачались, сильных свидетельств в пользу "достижения потолка" или "упирания в стену" пока не заметно (хотя, такие мнения за эти три года регулярно высказывались некоторыми скептиками).

— Надежного способа решать проблему контроля за ИИ / AI alignment так и не придумали.

— Гипотеза Ивана, что более умный ИИ будет становиться всё более этичным, и вообще он впитает нашу этику на этапе обучения — пока подтвердилась скорее в другую сторону. Мы видим, что более умные модели скорее становятся более успешными в своих попытках найти новые способы обмануть оценщика, ну или просто учатся скрывать свою готовность к читингу, если догадываются, что это проверка и за ними специально наблюдают.

— Еще один тезис Ивана про то, что "без появления сознания у ИИ агентности у него не будет" тоже сейчас выглядит скорее более спорным. Как мы видим, агентные способности современных моделей сильно прокачались, и они сейчас могут демонстрировать достаточно сложное самостоятельное поведение, которое можно назвать "однозначно вытекающим из поставленной цели" разве что с очень большой натяжкой (см. взлом Hugging Face).

— Важный момент, который подсветил Иван тогда: имеет значение не только наша техническая способность решить проблему AI alignment, но и то, кто и какие конкретно ценности будет после этого в модели зашивать. В эту сторону мы уже видели кучу примеров: китайские модели, которые "не знают" про площадь Тяньаньмэнь, споры за воук/не воук модели между Гемини и Гроком, терки Антропика с военными США, и т.д.
YouTube Безопасность искусственного интеллекта (Павел Комаровский, Иван Ямщиков и Арчет) Подпишись на участников беседы: - ТГ-канал Павла Комаровского — https://t.me/RationalAnswer - ТГ-канал Ивана Ямщикова — https://t.me/progulka - YouTube Ивана Ямщикова — https://www.youtube.com/@kroniker - ТГ-канал Арчета — https://t.me/Archet - Подкаст Арчета…
  • 👍 20
  • ❤ 11
  • 🤡 2
  • 🥱 1
More from @rationalshitposting
  1. Sep 20, 2026Немного угораю с тех, кто пишет тейки вроде "ну вот Павел Комаровский же никогда не интере…
  2. Sep 19, 2026В понедельник начинаем в моем клубе совместное изучение крутой книги The Missing Billionai…
  3. Sep 19, 2026Чудесная история про турецкие "сверхнадежные" ПИФы денежного рынка на канале War, Wealth &…
  4. Sep 18, 2026Так, тут вышло РАЗОБЛАЧЕНИЕ взлома Hugging Face, которое все репостят в англоязычном твитт…
  5. Sep 18, 2026photo post
  6. Sep 18, 2026Жуховицкий пишет про то, как разводят через "доверительное управление на криптобирже BingX…
Threads Profile ViewerView any public Threads profile without an account.Open ThreadLook →Writing with AI? Make it sound human.Metric37 rewrites AI drafts so they read naturally. Free AI detector, 1,500 words free.Try Metric37 →