Подводим итог по кодогенерации
1) Системы генерации кода неплохо умеют справляться с простыми запросами.
Это весьма полезно, когда вы работаете с малознакомым языком программирования, а также, когда вы хотите генерировать себе шаблонный скучный код.
Если вы поймёте, как правильно декомпозировать код так, чтобы его куски можно было отдать системе типа Copilot, то вы, может быть, станете продуктивнее.
На простом датасете HumanEval лучшая модель может генерировать с ~70% точностью правильную программу с 1 попытки.
2) Системы генерации кода ломаются при первой встрече со сложностью/логикой/математикой.
Несмотря на объём данных для обучения и последние нововведения, абсолютные результаты на датасетах с задачками всё ещё страшные - 34% на задачках уровня Intro при 1 попытке.
Тут важно сделать наблюдение - процент решения сильно возрастает, когда мы начинаем считать метрику при большом количестве попыток - 5, 10, 50. Это всё не особо удивительно, если вспомнить, что мы имеем дело всего лишь с дообученной языковой моделью, а не с системой поиска решения задачи.
Было уже неоднократно продемонстрировано, что языковые модели страдают при работе с логикой, и дело тут даже не в коде - система испытывает трудности ещё на этапе генерации пошагового описания решения (это обнаружили в статье Parsel).
Так что бояться рано - нейросети ничего сложного написать пока не способны.
Post #15
706
- 👍 5
- 🔥 2
- ❤ 1