Когда возможностей модели не хватает
1/2
🧐 В общении пару раз сталкивался с таким кейсом при обсуждении AI SWE - Spec-driven development. Все соглашаются, что БЕЗ подготовки проекта к работе с AI SWE, использование ИИ для работы с проектом возможно только в режиме ИИ-ассистента программиста.
Но сложности случаются и в, казалось бы, грамотно подготовленном к AI SWE проекте, с детальными спецификациями и хорошо проработанными процессами. Мы можем получить ситуацию, когда ИИ-агент генерирует код откровенно низкого уровня.
❓ В чем может быть дело?
Конечно, в каждом случае надо разбираться отдельно. Но я разберу не самые очевидные причины, которые возникают даже при, казалось бы, идеальной подготовке.
Допустим, у нас есть всё:
- действительно подробные инструкции;
- грамотно прописанные спецификации;
- процесс, разбитый на «правильные» этапы;
- код, структурированный на понятные модули;
- ясная и прописанная структура проекта;
- подробные JSDoc с перекрестными ссылками.
Казалось бы, идеальные условия. Но при генерации мы получаем код низкого качества: синтаксические ошибки, путаница в именах, падающие тесты, ошибки как в тестах, так и в коде.
Часто слышу: «Мы же говорили, ИИ не может!». И да, и нет. Когда модель сталкивается с задачей, сложность которой превышает её «емкость», она действительно может не справиться. Разберём, что происходит под капотом.
Например, нам известны параметры модели DeepSeek: 128 голов внимания, 61 слой. При обработке контекста 128 голов первого слоя ищут свои паттерны, затем 128 голов второго слоя обрабатывают контекст с учетом результатов первого, и так далее. Взаимосвязи простраиваются вглубь на протяжении всех 61 слоев. В итоге на стадии prefill создается KV Cache — «конспект» контекста. Далее начинается процесс декодирования, где для генерации каждого нового токена модель обращается к этому кэшу, чтобы понять, на что обратить внимание.
Вернёмся к нашим проблемам. В чем возникла сложность?
🚑 Общий диагноз: Да, в контексте модели есть все нужные требования, но из-за высокой общей сложности некоторым из них «не досталось» достаточного веса внимания и они проиграли в конкуренции за «бюджет внимания» модели. В результате нам кажется, что модель забыла или упустила какие то требования.
... (продолжение - https://t.me/deksden_notes/12)
#post
Post #11
532