TGViewer
Ivan Oseledets’ Channel Ivan Oseledets’ Channel @ivan_oseledets · 5.36K subscribers
Post #361 9.6K
Первый день ПМЭФ подходит к концу. Выпустили сегодня первую версию модели из нашего семейства Optimal Cognitive Core, OCC-RAG. Это компактная SLM для Q&A по контексту. Модель доступна в 2 размерах: 0.6B и 1.7B. Несмотря на маленькое число параметров обе уверенно отвечают на сложные multi-hop вопросы, рассуждают пошагово и корректно, отказываются отвечать, когда контекста недостаточно.

Как мы этого добились?

1. Сложные синтетические данные.

Открытые QA-датасеты, как правило, маленькие и не таргетируют задачу faithfulness. Модели учатся отвечать, но не всегда следовать контексту. Поэтому мы построили собственный пайплайн генерации данных: с помощью метода Wikontic (https://t.me/Ivan_Oseledets/283) извлекаем граф знаний из текстов и генерируем вопросы по путям в этом графе. Получаются по-настоящему сложные multi-hop задачи, где нужно объединить факты из нескольких источников, например: «В каком городе родился режиссёр фильма, получившего Оскар в год рождения Леонардо ДиКаприо?». Дополнительно пайплайн умеет генерировать вопросы, на которые в контексте нет ответа, чтобы отдельно учить модель отказываться.

В итоге наш метод позволяет генерировать данные из любых неструктурированных документов в почти неограниченном количестве!

2. Mid-training

В качестве базы взяли Qwen3-0.6B-Base и Qwen3-1.7B-Base и провели масштабный mid-training на пороядка 8 млрд токенов. Мы также дополнили данные специальным форматом рассуждения, который цитирует источники прямо в ответе. Это дополнительно повышает faithfulness.

Прогнали OCC-RAG на HotpotQA, MuSiQue и TAT-QA. Добавили ConFiQA, один из самых сложных бенчмарков на faithfulness, где модель должна следовать контексту, даже если он противоречит общеизвестным фактам.

Итого:

Качество на уровне моделей в 2–6 раз больше по размеру; на ConFiQA обходят даже Qwen3-32B; заметно лучше следуют контексту и реже подменяют его внутренними знаниями; среди специализированных малых QA-моделей (например, Pleias-RAG) показывают лучший результат.

Репорт на HuggingFace Daily Papers: https://huggingface.co/papers/2606.00683

Отмечу, что работа по согласованности, четкости и скорости в команде — эпичная. Продолжаем работать над улучшенной версией для tool-calling и Agentic RAG задач.

Ждите обновлений!

P.S. Не успел выйти с форума, уже увидел новости у ТАСС, РГ, в телеграм, Forbes, Код Дурова, много где. Радует, когда наши медиа следят за повесткой, реагируя не только на «что-то новое от Гугла».

Кстати, про значимость малых моделей сегодня как раз хорошо написал Андрей Себрант из Яндекса. Почитайте — https://www.forbes.ru/mneniya/562028-maly-da-udaly-pocemu-vazny-ii-modeli-kotorye-sovsem-ne-na-sluhu
  • 🔥 64
  • 👍 22
  • ❤ 16
  • 😱 5
  • 👎 2
More from @ivan_oseledets
  1. Sep 20, 2026Вчера ездил на Practical ML Conf — там мне и Антону Конушину, с которым мы вместе двигаем…
  2. Sep 9, 2026Решение проблемы тысячелетия про задачу Навье-Стокса - очень круто! https://nplus1.ru/mate…
  3. Sep 3, 2026📆 Все перевернули календарь? Под костры рябин возвращаемся в 28 августа – вспоминаем, как…
  4. Sep 3, 2026ФИИ стартовал
  5. Sep 2, 2026ИИ делает нас умнее. Или все-таки нет? Друзья, специально к Дню знаний мы выложили новую с…
  6. Aug 28, 2026«Лето с AIRI 2026» не заканчивается! Делимся лекциями и семинарами ⏯ Мы записали всё, о чё…
Threads Profile ViewerView any public Threads profile without an account.Open ThreadLook →Writing with AI? Make it sound human.Metric37 rewrites AI drafts so they read naturally. Free AI detector, 1,500 words free.Try Metric37 →