Big Data Science [RU] — канал о жизни Data Science.
Для сотрудничества: a.chernobrovov@gmail.com
🌏 — https://t.me/bdscience — Big Data Science channel (english version)
💼 — https://t.me/bds_job — channel about Data Science jobs and career
Post #634
875
😎Nvidia опубликовали новый датасет для обучения файнтюн-моделей
HelpSteer2 — это англоязычный набор данных, разработанный NVIDIA и размещённый на платформе Hugging Face. Он включает 21 362 строки и предназначен для обучения reward-моделей, которые помогают улучшать полезность, фактическую точность и связность ответов, генерируемых большими языковыми моделями (LLM).
Каждая строка в наборе данных содержит запрос, ответ и пять аннотированных человеком атрибутов ответа:
✅Полезность (usefulness)
✅Правильность (correctness)
✅Связность (coherence)
✅Сложность (complexity)
✅Многословность (verbosity)
Набор данных может использоваться для тонкой настройки LLM, чтобы они генерировали более релевантные и качественные ответы на пользовательские запросы.
HelpSteer2 — это англоязычный набор данных, разработанный NVIDIA и размещённый на платформе Hugging Face. Он включает 21 362 строки и предназначен для обучения reward-моделей, которые помогают улучшать полезность, фактическую точность и связность ответов, генерируемых большими языковыми моделями (LLM).
Каждая строка в наборе данных содержит запрос, ответ и пять аннотированных человеком атрибутов ответа:
✅Полезность (usefulness)
✅Правильность (correctness)
✅Связность (coherence)
✅Сложность (complexity)
✅Многословность (verbosity)
Набор данных может использоваться для тонкой настройки LLM, чтобы они генерировали более релевантные и качественные ответы на пользовательские запросы.
- 👍 2