🚀 HuggingFace представил набор датасетов для обучения LLM в генерации кода
После успеха OlympicCoder-32B, обошедшего Sonnet 3.7 в бенчмарках LiveCodeBench и задачах Международной олимпиады по информатике (IOI 2024), HuggingFace опубликовал богатый набор датасетов для предварительного обучения и тонкой настройки LLM в задачах программирования.
✅Stack-Edu (125 млрд. токенов) – образовательный код на 15 языках программирования, отфильтрованный из The Stack v2
✅GitHub Issues (11 млрд. токенов) – данные из обсуждений и баг-репортов на GitHub
✅CodeForces problems (10 тыс. задач) – уникальный набор задач CodeForces, 3 тыс. из которых не использовались в обучении DeepMind
✅CodeForces problems DeepSeek-R1 (8,69 ГБ) – отфильтрованные трассировки решений CodeForces
✅International Olympiad in Informatics: Problem statements dataset (2020 - 2024) - уникальный набор из заданий Олимпиады по программированию, разбитый на подзадачи так, чтобы каждый запрос соответствовал решению этих подзадач
✅International Olympiad in Informatics: Problem - DeepSeek-R1 CoT dataset (2020 - 2023) - 11 тыс трассировок рассуждений, выполненных DeepSeek-R1 в ходе решения заданий Олимпиады по программированию
💡 Для чего использовать?
🔹 Предобучение LLM для кодогенерации
🔹 Разработка AI-ассистентов для программистов
🔹 Улучшение решений в компьютерных олимпиадах
🔹 Создание ML-моделей для анализа кода
Post #700
484