Если кому-то вдруг интересно моё мнение, вердикт за пару месяцев использования Claude, включая появление Fable 5, Opus 5 и всё такое.
В сущности, Claude упёрлась в предел развития моделей для кода. Почему я так говорю? Потому, что каждая новая версия (4.8, Fable, 5) не приносит решения новых задач, которые модели до них не решали бы. Вместо этого, на этих задачах усугубляются галлюцинации. Модель приходит к "решению" не решая задачу, а обходя тестовое ограничение, поставленное вокруг задачи.
О каких задачах речь?
1. Сетевые протоколы. С каждой новой версией система по одному и тому же чертежу порождает всё более запутанный протокол. Человек справляется, машина - нет.
2. Многофакторые исправления. Система не в состоянии предсказать побочный эффект изменения, если он не выражен в первой производной. Соотвественно, не способна предположить, что что-то может сломаться не там, где она непосредственно видит, а там, куда ссылается то, что она видит. Человек это делает довольно легко, для него логично, что системы сцеплены друг за другом и нужно смотреть по цепочке. В условиях жёсткого ограничения в системе тестов, Opus 4.7 на таких проблемах честно останавливался. Следующие версии начали городить чудовищные конструкции, призванные обмануть тест, но совершенно несовместимые с реальным применением. Попытка добавить тест из реальности, который ломает такую конструкцию, приводит к ещё большим галлюцинациям.
3. Нестандартные способы моделирования. Конкретно, скажем, речь о модели ECS. Система принципиально не способна с ней работать лучше, чем мой локальный Qwen 3.5. Она пытается делать предположения об архитектуре как объектно-ориентированной, и строить свою логику на этом. Когда не получается - наглухо падает в галлюцинации. Qwen 3.5 же с задачами справляется, поскольку не пытается смотреть дальше и строить предположения - он просто пишет код, как заказывали.
Что здесь общего? Anthropic логично рассудили, что система обязана искать внутренние взаимосвязи, чтобы писать лучший код. Проблема в том, что для нейросети нужно показать десятки тысяч случаев там, где человеку достаточно трёх. Отсюда тотальное галлюцинирование в системах, архитектуру которых нейросеть в нужном объёме не видела. Поскольку ситуация усугубляется, предположу, что Anthropic о проблеме знают и пытаются на неё натаскать свои поделия, но здесь мы упираемся в чисто математический предел нейросетей, который давно предсказан - нейросеть не способна работать с единичными частными случаями. Проблема в том, что наша жизнь из них состоит, как говорится, на 80%.
Post #3195
878