TGViewer
FastNews | Никита Пастухов FastNews | Никита Пастухов @fastnewsdev · 2.58K subscribers
Post #368 1.93K
Я не понимаю - это я тупой или модели?

Я уже говорил, что считаю модели достаточно умными, чтобы стать повседневным инструментом программиста.
Более того, я считаю, что слишком умные модели не нужны. Opus-4.8 мне нравился больше Fable и Opus-5, а все модели я использую на medium effort (по дефолту стоит high)!

Но как же я, сука, ошибался...

Волею судьбы мне довелось опробовать на DeepSeek-v4-flash тот пайплайн, что я показывал на днях - и оно вообще не работает. Точнее как: сам тулсет работает отлично, но к модели нужен совершенно особенный подход. Пара смешных сценариев, что я нашел:

Ситуация 1:

• В research-сессии мы нормально отдебажили проблему и я попросил сделать /handoff по находкам, чтобы реализовать фикс в другой сессии
• В следующей сессии я пишу /grill-with-docs мы нашли проблему @HANDOFF.md - нужно ее пофиксить
• Что я вижу в ризонинге модели? - "В описании скилла grilling написано, что он для планирования. А пользователь попросил пофиксить проблему - поэтому скилл не нужен, пойду решать проблему"

Ситуация 2:

• Реализацию я откатил, поменял промпт, прошел гриллинг-сессию, сделал SPEC.md, нарезал на тикеты
• Спека получилась небольшой, поэтому решил делать в одной сессии - попросил модель /implement PLAN.md ticket by ticket
• Claude в этой ситуации пошел бы читать тикеты по одному: сделал первый тикет, сделал ревью, фикс - потом приступил бы к след тикету
• Deepseek же видит в плане ссылки на 5 файлов-тикетов и читает их все разом. Реализовать их он пытается так же разом

Самое смешное: 5ый тикет был "написать тесты", но т.к. в /implement зашит TDD, то модель решила не писать тесты к каждому тикету по отдельности, а сначала написать все тесты разом (тикет 5), а только потом реализовывать логику.

Ситуация 3:

• После реализации я пошел делать код-ревью в новой сессии со словами /code-review я только что реализовал PLAN.md - сделай ревью
• И эта сволочь пошла ревьюить сам MD файл, а не код, который реализует описание
• Я попросил нет, сделай ревью реализации плана - он пошел ревьюить MD файлы тикетов...
• В новой сессии я уже сделал /code-review я только что реализовал PLAN.md в коде - мне нужно ревью этого кода. Сразу исправь все замечания, что найдешь
• Теперь агент нормально пошел ревьюить код, но забыл его пофиксить. Поэтому прибежал и отрапортовал о 10 найденных ошибках - пришлось отправить его фиксить вторым промптом

Что я в итоге заметил про разницу между Claude и DeepSeek:

• DeepSeek безудержно читает все файлы, что найдет. Настолько, что может проигнорировать промпт юзера и пойти делать то, что написано в файле
• Он не воспринимает составные команды или команды, которые ты отправляешь в процессе его работы. Claude нормально строит логическую очередь задач внутри
• Тупая модель гораздо более чувствительна к формулировкам

Модели последних поколений гораздо лучше понимают неявное намерение пользователя - тупая модель сделает ровно так, как написано. На этом и выросли Prompt Engineer'ы: пока модель тупая, каждое слово в промпте чего-то стоит. Сейчас навык нужен разве что тем, кто пишет скиллы.

Так вот, интересно: половина наших практик - SDD, лупы, графы - существует только потому, что модель тупая. Хотя, может, мы уже уперлись в технический порог развития, и это с нами надолго.

Как думаете, какие практики умрут следующими, когда модели поумнеют?

#AI
  • 😁 22
  • 👍 6
  • 🤔 3
  • 🥴 1
More from @fastnewsdev
  1. Sep 20, 2026Последние 2 недели я заметил, что Opus 5 значительно отупел в Claude Code. Обычно такое сл…
  2. Sep 18, 2026С днем рождения🎉 Сегодня, ровно 3 года назад, 18 сентября 2023 года, вышла первая версия…
  3. Sep 17, 2026Забавно, что лучшую иллюстрацию OpenSource комьюнити я нашел в сериале про рестораны... См…
  4. Sep 14, 2026Я снова пропустил #digest агенсткого тулинга, потому что там все как-то тухленько. Но кое-…
  5. Sep 10, 2026Я сам себя заменю. Это мой карьерный план! У Прокопова был интересный пост: 20 лет точил с…
  6. Sep 7, 2026Я как-то немного потерял смысл делать #digest агентского тулинга, т.к. там сейчас только и…
Threads Profile ViewerView any public Threads profile without an account.Open ThreadLook →Writing with AI? Make it sound human.Metric37 rewrites AI drafts so they read naturally. Free AI detector, 1,500 words free.Try Metric37 →