Месяц назад (мы писали) команда Chatbot Arena (ранее LMSYS - платформа соревнований LLM в виде чатов) выпустила плагин copilot для VSCode (один из известных редакторов кода от Microsoft). Внутри плагина встроена арена оценки различных LLM как копайлотов для программирования. Работает это так:
• Пользователь в IDE вызывает плагин чтобы дополнить какой-то кусок кода
• Плагин передает запрос паре случайно выбранных LLM и возвращает два обезличенных ответа
• Затем пользователь “вслепую” выбирают из двух вариантов какой ответ ему больше подходит
• Пользователь получает нужный код (copilot работает бесплатно), а команда LMSYS статистику ответы каких моделей предпочитают разработчики.
Вчера команда Copilot Arena опубликовали первые результаты исследования. Как водится в современном мире ИИ вчерашние результаты уже немного устарели т.к. вчера же вышли новые версии моделей QWEN которые явно претендуют на высокие места в рейтинге написания кода, но по очевидным причинам еще не успели в нем поучаствовать. Тем не менее результаты любопытные, кажется это первое исследование моделей (именно в режиме копайлотов) с более-менее уверенными статистическими показателями и на настоящем коде.
На основе 10000+ запросов к копайлотам (200-250 постоянных пользователей в день в течение месяца) появилась вот такая таблица топ-9ти соревнующихся моделей.
Из интересных подробностей: Чаще всего плагином пользовались питонисты, сильно меньше JS, потом все остальные. Медианный размер запросов с кодом в пять раз больше, чем текстовые запросы на обычной арене - 530 токенов против 100. Остальное в блоге создателей.
Post #181
1.55K

- 🔥 4
- 👍 2