я уже писал про инициативу First Proof - где собрали уже готовые, но еще не опубликованные математические результаты и натравили на задачи современные LLM-ки; так вот у них пару недель назад вышел отчет по второму раунду проверки
в этом раунде было 10 задач и 4 системы, 3 системы опирались на GPT-5.5, две на Gemini 3.1 Pro (одна из систем использовала ансамбль моделей, куда еще входил Claude Opus 4.8); из интересного, три из десяти задач не решила ни одна из систем, причем рецензенты указали, на отсутствие интуиции в решениях; вот это на мой взгляд - самое интересное, т.к. показывает, что комбинаторному перебору есть предел; математическая интуиция - это плохо формализуемая штука, несмотря на то, что математика - самая строгая из наук; интересно будет пронаблюдать, каким костылем будут пытаться ее заменять #математика
@valuableai
Post #892
1.4K

- 🔥 6