TGViewer
Valuable AI / Валентин Малых Valuable AI / Валентин Малых @valuableai · 2.36K subscribers
Post #892 1.4K
я уже писал про инициативу First Proof - где собрали уже готовые, но еще не опубликованные математические результаты и натравили на задачи современные LLM-ки; так вот у них пару недель назад вышел отчет по второму раунду проверки

в этом раунде было 10 задач и 4 системы, 3 системы опирались на GPT-5.5, две на Gemini 3.1 Pro (одна из систем использовала ансамбль моделей, куда еще входил Claude Opus 4.8); из интересного, три из десяти задач не решила ни одна из систем, причем рецензенты указали, на отсутствие интуиции в решениях; вот это на мой взгляд - самое интересное, т.к. показывает, что комбинаторному перебору есть предел; математическая интуиция - это плохо формализуемая штука, несмотря на то, что математика - самая строгая из наук; интересно будет пронаблюдать, каким костылем будут пытаться ее заменять #математика

@valuableai
  • 🔥 6
More from @valuableai
  1. Sep 21, 2026На выходных (почему новости от Anthropic всегда приходят по выходным?) пришла новость, что…
  2. Sep 20, 2026всем привет, я таки смог победить отельный интернет и залить свежий выпуск, ведем как всег…
  3. Sep 19, 2026в свете последних новостей не мог не запостить для тех, кто пропустил, этот мозг встроили…
  4. Sep 18, 2026с утра говорили про философию, а тут коллеги организуют конференцию, на ней будет дискусси…
  5. Sep 18, 2026наши творцы и американские проявляют завидное единодушие в следовании тому, что ИИ не заме…
  6. Sep 17, 2026Привет! Рады сообщить, что 🦜 ODS совместно с Международным университетом информационных т…
Threads Profile ViewerView any public Threads profile without an account.Open ThreadLook →Writing with AI? Make it sound human.Metric37 rewrites AI drafts so they read naturally. Free AI detector, 1,500 words free.Try Metric37 →