Новое исследование от Apple только доказало, что такие "рассуждающие" модели ИИ, как Claude, DeepSeek-R1 и o3-mini, на самом деле вовсе не рассуждают, а лишь хорошо запоминают паттерны.
Казалось бы, мы говорим очевидные вещи, но не для всех сторонников или противников ИИ это очевидно. Apple протестировала Claude Thinking, DeepSeek-R1 и o3-mini на задачах, с которыми эти модели никогда раньше не сталкивались. По мере усложнения задач эти языковые модели использовали меньше жетонов и быстрее сдавались, несмотря на неограниченный бюджет. Исследователи Apple даже попробовали дать моделям точный алгоритм решения, но они по-прежнему терпели неудачу на тех же уровнях сложности.
Apple, тем самым, экспериментально обнаружила, что эти модели вовсе не рассуждают, а занимаются сложным подбором шаблонов и запоминанием паттернов, который отлично работает, пока шаблоны не становятся слишком сложными. Если бы эти модели действительно "рассуждали", они должны были бы становиться лучше с увеличением количества вычислений и более четких инструкций.
Произошло то, о чём мы всегда писали — LLM - это не про рассуждения. Они больше похожи на глобальный хэш-консолидатор, базу данных памяти, используемую всем человечеством, на всех языках программирования. Это чрезвычайно мощный инструмент, который позволит продвинуться во многих областях, но не к общему искусственному интеллекту. Большинство людей упускает из виду реальные достижения нейросеток: массивные вычисления, добавленные к простому алгоритму, дают огромную силу в большом масштабе. Возможно, впереди исследования по децентрализации языковых моделей, их обобщения, когда для каждой конкретной сферы будет конкретная ЛЛМ со своим набором данных и с открытым кодом.
Post #2138
1.16K