Про качество кода от моделей
Сегодня на созвоне вскользь поднимали тему качества кода от моделей, и я попал в тот случай в жизни, когда придумал идеальный ответ, но разговор уже был окончен. Ладно, зато вам покажу.
Прямо во время этого обсуждения агент в фоне гонял задачу, которая заняла почти 4 часа. Модель разделила выполнение на два этапа: поиск корневой проблемы и верификацию. Первый этап занял 2.5 часа (видно на скриншоте), а второй чуть меньше полутора часов.
По итогу выполнения Sonnet 4.6 написал ровно одну строчку кода и один тест, чтобы этот баг больше не повторился. А благодаря тому багу, о котором я рассказывал в одном из прошлых постов, эта задача по сути не потратила никаких лимитов.
Суть проблемы была в том, что у меня половина тестов (~13 933 тест-кейса) не могли завершиться. Они просто вешали систему. Проблема критичная, отследить сложно, можно наделать кучу лишних изменений, которые не улучшат ситуацию. Во всяком случае, примерно так это выглядело, если бы проблемой занимались люди. LLM же справилась с задачей без особых проблем.
Правды ради, за первый ран она исправила только одну проблему из двух, которые вешали тесты. Для решения второй проблемы я запустил тот же самый промпт, и за 20-30 минут модель нашла второй источник проблем. Там она написала две строчки кода, которые исправили оставшиеся ~1 300 тестов.
Это, кстати, очень хорошая практика — прогонять промпты, которые требуют глубоких исследований всей кодовой базы, по несколько раз, ибо агент часто может упустить что-то из виду, либо же увидеть новые проблемы, которые перекрывали проблемы из первого раунда.
По итогу оба бага были связаны с тем, что в коде, в паре мест, были пропущены очистки. А у меня появилось + 1 воспоминание, чтобы обдумать в три часа ночи, как круто я мог бы ответить 😎.
Из этой истории я вынес ещё больше доверия к LLM и мой новый хот-тейк в том, что я больше доверяю коду, который написали LLM, чем коду, который написали люди. Drop the mic 🎤.
Post #98
737

- ❤ 12
- 🔥 5
- 👏 2