Post #66
823
Сегодня мы рады представить результаты нашей работы последних месяцев — семейство специализированных SLM-моделей OCC-RAG для question answering по контексту. Несмотря на компактный размер (всего 0.6B и 1.7B параметров), наши модели способны отвечать на сложные multi-hop вопросы, рассуждать по шагам и, что особенно важно, корректно отказываться от ответа, если в контексте недостаточно информации.
Как нам удалось этого добиться?
📚 Сложные синтетические вопросы-ответы
Для обучения моделей нужны большие объемы качественных данных. Однако большинство открытых QA-датасетов уже давно стали частью обучающих выборок современных LLM и плохо подходят для развития сложного рассуждения. Поэтому мы построили собственный пайплайн генерации данных. С помощью Wikontic мы извлекаем граф знаний из текстов и затем генерируем вопросы на основе путей в этом графе. Такой подход позволяет создавать действительно сложные multi-hop вопросы, требующие объединения информации из нескольких источников.
В результате мы получили:
— миллионы одношаговых вопросов;
— сотни тысяч multi-hop вопросов;
— специальные примеры с контекстами-дистракторами;
— задачи, в которых правильным ответом является отказ от ответа.
⚙️ Mid-training и curriculum learning
В качестве базовых моделей мы использовали Qwen3-0.6B и Qwen3-1.7B. Далее провели масштабный mid-training на более чем 3 миллионах сгенерированных примеров. Обучение строилось по принципу curriculum learning: сначала модель осваивает простые одношаговые вопросы, а затем постепенно переходит к сложным multi-hop сценариям.
🏆 Результаты
Мы протестировали OCC-RAG на популярных QA-бенчмарках, включая HotpotQA, MuSiQue, TAT-QA, а также ConFiQA — одном из самых строгих тестов на faithfulness, который проверяет способность модели следовать контексту даже тогда, когда он противоречит общеизвестным фактам.
Результаты превзошли наши ожидания:
— OCC-RAG показывает качество на уровне моделей в 2–6 раз больше по размеру;
— на задачах multi-hop reasoning наши модели конкурируют с моделями класса 8B–14B;
— на ConFiQA OCC-RAG превосходит даже Qwen3-32B;
— модели существенно лучше следуют контексту и значительно реже подменяют его своими внутренними знаниями;
— среди специализированных малых моделей для QA OCC-RAG показывает лучшие результаты.
Что это означает?
Если работа показалась вам интересной — будем рады вашим лайкам, репостам и вопросам 👇
https://huggingface.co/papers/2606.00683
🌐Рандомные галлюцинации
Как нам удалось этого добиться?
📚 Сложные синтетические вопросы-ответы
Для обучения моделей нужны большие объемы качественных данных. Однако большинство открытых QA-датасетов уже давно стали частью обучающих выборок современных LLM и плохо подходят для развития сложного рассуждения. Поэтому мы построили собственный пайплайн генерации данных. С помощью Wikontic мы извлекаем граф знаний из текстов и затем генерируем вопросы на основе путей в этом графе. Такой подход позволяет создавать действительно сложные multi-hop вопросы, требующие объединения информации из нескольких источников.
В результате мы получили:
— миллионы одношаговых вопросов;
— сотни тысяч multi-hop вопросов;
— специальные примеры с контекстами-дистракторами;
— задачи, в которых правильным ответом является отказ от ответа.
⚙️ Mid-training и curriculum learning
В качестве базовых моделей мы использовали Qwen3-0.6B и Qwen3-1.7B. Далее провели масштабный mid-training на более чем 3 миллионах сгенерированных примеров. Обучение строилось по принципу curriculum learning: сначала модель осваивает простые одношаговые вопросы, а затем постепенно переходит к сложным multi-hop сценариям.
🏆 Результаты
Мы протестировали OCC-RAG на популярных QA-бенчмарках, включая HotpotQA, MuSiQue, TAT-QA, а также ConFiQA — одном из самых строгих тестов на faithfulness, который проверяет способность модели следовать контексту даже тогда, когда он противоречит общеизвестным фактам.
Результаты превзошли наши ожидания:
— OCC-RAG показывает качество на уровне моделей в 2–6 раз больше по размеру;
— на задачах multi-hop reasoning наши модели конкурируют с моделями класса 8B–14B;
— на ConFiQA OCC-RAG превосходит даже Qwen3-32B;
— модели существенно лучше следуют контексту и значительно реже подменяют его своими внутренними знаниями;
— среди специализированных малых моделей для QA OCC-RAG показывает лучшие результаты.
Что это означает?
Мы показали, что маленькие специализированные модели могут конкурировать с гораздо более крупными LLM, если правильно подойти к данным и процессу обучения. Это открывает путь к созданию более дешёвых, быстрых и надёжных систем для RAG, поиска информации и корпоративных QA-решений.
Если работа показалась вам интересной — будем рады вашим лайкам, репостам и вопросам 👇
https://huggingface.co/papers/2606.00683
🌐Рандомные галлюцинации
- 🔥 24
























