Сама модель назвается Codex, и в лучших традициях OpenAI нет не только опенсорсного проекта, но и статьи с описанием деталей тоже нет. Но есть статья, посвященная первым версиям Codex'а, которые потом легли в основу Copilot.
Так вот если ее почитать, то окажется, что Codex это просто зафайнтюненная GPT-3. This is literally it. Ну то есть было очевидно, что это какая-то языковая модель, но тут чуваки не меняли архитектуру вообще, и правда просто скормили GPT-3 кучу опенсорсного кода 🤡
В начале статьи авторы делают довольно красивый клейм: 'On HumanEval, a new evaluation set we release to measure functional correctness for synthesizing programs from docstrings, our model solves 28.8% of the problems, while GPT-3 solves 0% and GPT-J solves 11.4%'. Потом авторы делают еще более интересный заход, и говорят, что раз люди тоже не с первого раза пишут работающий код, мы тоже дадим модельке посемплить 100 решений и из них выберем лучшее, тогда она 70.2% решит наших задачек.
Короче это все как-то сильно underwhelming, потому что тюнить модели относительно легко, и в этой статье даже не было никаких эвристик, как заставить архитектуру лучше приспособиться к задаче написания кода, особенно с учетом того, что она может и в код, и в естественный язык, так как умеет писать комментарии и описания функций