🚀 Возвращаемся после долгого перерыва с тем, что и правда приятно показать 🚀
Это результат интенсивной работы над небольшими моделями, которые хорошо умеют в три вещи: рассуждать , сохранять верность источникам и честно воздерживаться от ответа, когда данных недостаточно.
Последние годы развитие языковых моделей в основном шло через масштаб: больше параметров, больше знаний, больше сведений о мире, зашитых в веса. Но во многих прикладных задачах важнее не то, сколько модель “помнит”, а то, насколько аккуратно она работает с контекстом.
Именно вокруг этой идеи построен Optimal Cognitive Core (OCC) — семейство небольших языковых моделей, созданных не ради универсальной эрудиции, а ради надёжной работы в конкретной задаче.
Это особенно важно для систем ответов на вопросы по документам, внутренним базам знаний, отчётам и аналитическим текстам. В таких задачах обычно нужна не модель, которая пытается знать всё, а модель, которая:
- 🔎 отвечает по источникам;
- 🔗 умеет сопоставлять несколько фрагментов текста;
- 🧩 показывает ход рассуждения;
- 📝 приводит цитаты в подтверждение;
- 🤐 и не выдумывает ответ там, где в контексте его просто нет.
Один из представителей семейства OCC — OCC-RAG, предназначен для ответов на вопросы с опорой на предоставленный контекст и соответствует всем этим требованиям.
Для обучения был создан новый пайплайн синтетической генерации данных и собран корпус из более чем 3 миллионов примеров.
Обученные на этих данных модели OCC-RAG-0.6B и OCC-RAG-1.7B показывают, что небольшие специализированные модели могут соперничать с универсальными моделями, которые в 2–6 раз крупнее, а в некоторых сценариях и превосходить их на задачах, где проверяются качество рассуждения, верность источникам и корректный отказ от ответа.
🎉 Поздравляю коллег с отличной работой!
[Если вы хотели бы поддержать проект, можете поставить ему upvote на Hugging Face]
Post #338
427
