TGViewer
Женя, расскажи про AI Женя, расскажи про AI @that_ai_guy · 374 subscribers
Post #98 737
Про качество кода от моделей

Сегодня на созвоне вскользь поднимали тему качества кода от моделей, и я попал в тот случай в жизни, когда придумал идеальный ответ, но разговор уже был окончен. Ладно, зато вам покажу.

Прямо во время этого обсуждения агент в фоне гонял задачу, которая заняла почти 4 часа. Модель разделила выполнение на два этапа: поиск корневой проблемы и верификацию. Первый этап занял 2.5 часа (видно на скриншоте), а второй чуть меньше полутора часов.

По итогу выполнения Sonnet 4.6 написал ровно одну строчку кода и один тест, чтобы этот баг больше не повторился. А благодаря тому багу, о котором я рассказывал в одном из прошлых постов, эта задача по сути не потратила никаких лимитов.

Суть проблемы была в том, что у меня половина тестов (~13 933 тест-кейса) не могли завершиться. Они просто вешали систему. Проблема критичная, отследить сложно, можно наделать кучу лишних изменений, которые не улучшат ситуацию. Во всяком случае, примерно так это выглядело, если бы проблемой занимались люди. LLM же справилась с задачей без особых проблем.

Правды ради, за первый ран она исправила только одну проблему из двух, которые вешали тесты. Для решения второй проблемы я запустил тот же самый промпт, и за 20-30 минут модель нашла второй источник проблем. Там она написала две строчки кода, которые исправили оставшиеся ~1 300 тестов.

Это, кстати, очень хорошая практика — прогонять промпты, которые требуют глубоких исследований всей кодовой базы, по несколько раз, ибо агент часто может упустить что-то из виду, либо же увидеть новые проблемы, которые перекрывали проблемы из первого раунда.

По итогу оба бага были связаны с тем, что в коде, в паре мест, были пропущены очистки. А у меня появилось + 1 воспоминание, чтобы обдумать в три часа ночи, как круто я мог бы ответить 😎.

Из этой истории я вынес ещё больше доверия к LLM и мой новый хот-тейк в том, что я больше доверяю коду, который написали LLM, чем коду, который написали люди. Drop the mic 🎤.
  • ❤ 12
  • 🔥 5
  • 👏 2
More from @that_ai_guy
  1. Mar 13, 2026AlphaEvolve от Google DeepMind открыла новые нижние оценки для чисел Рамсея, улучшив резул…
  2. Mar 12, 2026В продолжение постов об исследованиях от METR На скриншоте — количество задач, которые мы…
  3. Mar 9, 2026Мы получили Cyberpunk 2077 в реальной жизни до выхода GTA 6 Помните бреиндансы из Cyberpun…
  4. Mar 7, 2026Кринж-METR 2/2 10 июля 2025 года METR выпускает новое исследование «Measuring the Impact o…
  5. Mar 7, 2026Кринж-METR 1/2 Есть такая организация, и вы сто процентов о ней слышали, если последний го…
  6. Mar 5, 2026Ваш воркфлоу (скорее всего) переусложнён В то время как все улучшают свои workflow: докиды…
Threads Profile ViewerView any public Threads profile without an account.Open ThreadLook →Writing with AI? Make it sound human.Metric37 rewrites AI drafts so they read naturally. Free AI detector, 1,500 words free.Try Metric37 →