Я уже говорил, что считаю модели достаточно умными, чтобы стать повседневным инструментом программиста.
Более того, я считаю, что слишком умные модели не нужны. Opus-4.8 мне нравился больше Fable и Opus-5, а все модели я использую на medium effort (по дефолту стоит high)!
Но как же я, сука, ошибался...
Волею судьбы мне довелось опробовать на DeepSeek-v4-flash тот пайплайн, что я показывал на днях - и оно вообще не работает. Точнее как: сам тулсет работает отлично, но к модели нужен совершенно особенный подход. Пара смешных сценариев, что я нашел:
Ситуация 1:
• В research-сессии мы нормально отдебажили проблему и я попросил сделать
/handoff по находкам, чтобы реализовать фикс в другой сессии• В следующей сессии я пишу
/grill-with-docs мы нашли проблему @HANDOFF.md - нужно ее пофиксить• Что я вижу в ризонинге модели? - "В описании скилла
grilling написано, что он для планирования. А пользователь попросил пофиксить проблему - поэтому скилл не нужен, пойду решать проблему"Ситуация 2:
• Реализацию я откатил, поменял промпт, прошел гриллинг-сессию, сделал SPEC.md, нарезал на тикеты
• Спека получилась небольшой, поэтому решил делать в одной сессии - попросил модель
/implement PLAN.md ticket by ticket• Claude в этой ситуации пошел бы читать тикеты по одному: сделал первый тикет, сделал ревью, фикс - потом приступил бы к след тикету
• Deepseek же видит в плане ссылки на 5 файлов-тикетов и читает их все разом. Реализовать их он пытается так же разом
Самое смешное: 5ый тикет был "написать тесты", но т.к. в
/implement зашит TDD, то модель решила не писать тесты к каждому тикету по отдельности, а сначала написать все тесты разом (тикет 5), а только потом реализовывать логику.Ситуация 3:
• После реализации я пошел делать код-ревью в новой сессии со словами
/code-review я только что реализовал PLAN.md - сделай ревью• И эта сволочь пошла ревьюить сам MD файл, а не код, который реализует описание
• Я попросил
нет, сделай ревью реализации плана - он пошел ревьюить MD файлы тикетов...• В новой сессии я уже сделал
/code-review я только что реализовал PLAN.md в коде - мне нужно ревью этого кода. Сразу исправь все замечания, что найдешь• Теперь агент нормально пошел ревьюить код, но забыл его пофиксить. Поэтому прибежал и отрапортовал о 10 найденных ошибках - пришлось отправить его фиксить вторым промптом
Что я в итоге заметил про разницу между Claude и DeepSeek:
• DeepSeek безудержно читает все файлы, что найдет. Настолько, что может проигнорировать промпт юзера и пойти делать то, что написано в файле
• Он не воспринимает составные команды или команды, которые ты отправляешь в процессе его работы. Claude нормально строит логическую очередь задач внутри
• Тупая модель гораздо более чувствительна к формулировкам
Модели последних поколений гораздо лучше понимают неявное намерение пользователя - тупая модель сделает ровно так, как написано. На этом и выросли Prompt Engineer'ы: пока модель тупая, каждое слово в промпте чего-то стоит. Сейчас навык нужен разве что тем, кто пишет скиллы.
Так вот, интересно: половина наших практик - SDD, лупы, графы - существует только потому, что модель тупая. Хотя, может, мы уже уперлись в технический порог развития, и это с нами надолго.
Как думаете, какие практики умрут следующими, когда модели поумнеют?
#AI