TGViewer
Рациональные числа Рациональные числа @rationalnumbers · 25.7K subscribers
Post #9302 4.37K
Производительность нейросетей с открытым и закрытым кодом в соревновательном программировании, 2023–2025 (select_8)

На диаграмме — результаты больших языковых моделей в тесте LiveCodeBench. Он считается одним из самых «чистых», так как использует свежие задачи с соревнований LeetCode, AtCoder и Codefoeces, которые появились после даты отсечки обучения каждой модели. Это исключает простое воспроизведение заученных ответов и позволяет оценить реальный навык написания кода. Также LiveCodeBench проверяет умение нейросетей исправлять свои ошибки и предсказывать результат выполнения программы

Каждая точка — результат самой результативной на тот момент нейросети из двух категорий: с закрытым кодом (синий) и открытым (зелёный)

Другие наши публикации о том, как ИИ проходят тесты:
Как большие языковые модели проходят тест на IQ
Результаты решения теста ARC Challenge нейросетями, 2019–2025
Политическая ориентация 24 крупнейших языковых моделей
Как хорошо справляются с тестами DeepSeek-R1 и ChatGPT o1
  • 👍 20
  • 🔥 2
  • 👎 1
More from @rationalnumbers
  1. Sep 22, 2026Длина светового дня на Земле в зависимости от дня года и широты (Reddit) Ещё про смену дня…
  2. Sep 21, 2026За 2019–2026 годы экономика Индии выросла на 46%, Китая — на 39%, США — на 18%, Германии —…
  3. Sep 20, 2026Китаю в 2025 году не хватило 145 $ дохода на человека до статуса страны с высоким доходом,…
  4. Sep 18, 2026Из 1 508 кошельков Polymarket, ставивших от 25 000 $ за раз, 78% закрыли позиции в плюсе;…
  5. Sep 17, 2026Кинотеатры США в 2025 году собрали на 40% меньше, чем в 2019-м, если считать в одних и тех…
  6. Sep 17, 2026Перекрёстное опыление Привет, это Киря — автор этого канала. Я подумал, что раз вы подписа…
Threads Profile ViewerView any public Threads profile without an account.Open ThreadLook →Writing with AI? Make it sound human.Metric37 rewrites AI drafts so they read naturally. Free AI detector, 1,500 words free.Try Metric37 →