Производительность нейросетей с открытым и закрытым кодом в соревновательном программировании, 2023–2025 (select_8)
На диаграмме — результаты больших языковых моделей в тесте LiveCodeBench. Он считается одним из самых «чистых», так как использует свежие задачи с соревнований LeetCode, AtCoder и Codefoeces, которые появились после даты отсечки обучения каждой модели. Это исключает простое воспроизведение заученных ответов и позволяет оценить реальный навык написания кода. Также LiveCodeBench проверяет умение нейросетей исправлять свои ошибки и предсказывать результат выполнения программы
Каждая точка — результат самой результативной на тот момент нейросети из двух категорий: с закрытым кодом (синий) и открытым (зелёный)
Другие наши публикации о том, как ИИ проходят тесты:
— Как большие языковые модели проходят тест на IQ
— Результаты решения теста ARC Challenge нейросетями, 2019–2025
— Политическая ориентация 24 крупнейших языковых моделей
— Как хорошо справляются с тестами DeepSeek-R1 и ChatGPT o1
Post #9302
4.37K

- 👍 20
- 🔥 2
- 👎 1