TGViewer
Рандомные галлюцинации Рандомные галлюцинации @nlpbotan · 291 subscribers
Post #66 830
Сегодня мы рады представить результаты нашей работы последних месяцев — семейство специализированных SLM-моделей OCC-RAG для question answering по контексту. Несмотря на компактный размер (всего 0.6B и 1.7B параметров), наши модели способны отвечать на сложные multi-hop вопросы, рассуждать по шагам и, что особенно важно, корректно отказываться от ответа, если в контексте недостаточно информации.

Как нам удалось этого добиться?

📚 Сложные синтетические вопросы-ответы

Для обучения моделей нужны большие объемы качественных данных. Однако большинство открытых QA-датасетов уже давно стали частью обучающих выборок современных LLM и плохо подходят для развития сложного рассуждения. Поэтому мы построили собственный пайплайн генерации данных. С помощью Wikontic мы извлекаем граф знаний из текстов и затем генерируем вопросы на основе путей в этом графе. Такой подход позволяет создавать действительно сложные multi-hop вопросы, требующие объединения информации из нескольких источников.

В результате мы получили:
— миллионы одношаговых вопросов;
— сотни тысяч multi-hop вопросов;
— специальные примеры с контекстами-дистракторами;
— задачи, в которых правильным ответом является отказ от ответа.

⚙️ Mid-training и curriculum learning

В качестве базовых моделей мы использовали Qwen3-0.6B и Qwen3-1.7B. Далее провели масштабный mid-training на более чем 3 миллионах сгенерированных примеров. Обучение строилось по принципу curriculum learning: сначала модель осваивает простые одношаговые вопросы, а затем постепенно переходит к сложным multi-hop сценариям.

🏆 Результаты

Мы протестировали OCC-RAG на популярных QA-бенчмарках, включая HotpotQA, MuSiQue, TAT-QA, а также ConFiQA — одном из самых строгих тестов на faithfulness, который проверяет способность модели следовать контексту даже тогда, когда он противоречит общеизвестным фактам.

Результаты превзошли наши ожидания:

— OCC-RAG показывает качество на уровне моделей в 2–6 раз больше по размеру;
— на задачах multi-hop reasoning наши модели конкурируют с моделями класса 8B–14B;
— на ConFiQA OCC-RAG превосходит даже Qwen3-32B;
— модели существенно лучше следуют контексту и значительно реже подменяют его своими внутренними знаниями;
— среди специализированных малых моделей для QA OCC-RAG показывает лучшие результаты.

Что это означает?

Мы показали, что маленькие специализированные модели могут конкурировать с гораздо более крупными LLM, если правильно подойти к данным и процессу обучения. Это открывает путь к созданию более дешёвых, быстрых и надёжных систем для RAG, поиска информации и корпоративных QA-решений.


Если работа показалась вам интересной — будем рады вашим лайкам, репостам и вопросам 👇
https://huggingface.co/papers/2606.00683

🌐Рандомные галлюцинации
  • 🔥 24
More from @nlpbotan
  1. Jun 3, 2026https://huggingface.co/papers/2606.00683
  2. May 4, 2026Продолжаем неторопливо разбирать статьи с #ICLR 2026 🇧🇷 в этот раз LiteCoST — двухэтапны…
  3. May 4, 2026photo post
  4. Apr 28, 2026🔥 ICLR 2026: детекция LLM-контента через галлюцинации в библиографии? Подошла к концу одн…
  5. Apr 27, 2026📣 CFP AIST 2026 Приглашаем подать статью на AIST 2026 – 13-ю международную конференцию по…
  6. Mar 24, 2026📜Multimodal Evaluation of Russian-language Architectures Мультимодальный бенчмарк, содерж…
Threads Profile ViewerView any public Threads profile without an account.Open ThreadLook →Writing with AI? Make it sound human.Metric37 rewrites AI drafts so they read naturally. Free AI detector, 1,500 words free.Try Metric37 →