Хоть я и не являюсь большим фанатом DeepSeek, но эти ребята делают реально крутые вещи и двигают ИИ-разработку вперед. На прошлой неделе вышла совместная статья от DeepSeek и исследователей из Tsinghua University, где был предложен новый метод обучения моделей, так называемый Self-Principled Critique Tuning (SPCT), позволяющий моделям лучше размышлять
Ок, новый метод, а нам с этого что, скажете вы? Дело в том, что Reasoning - это одна из наиболее интересных областей развития LLM сейчас. Мы все видим, насколько хороши Reasoning модели, чего стоят Gemini 2.5 и модели семейства “o” от OpenAI. Хороший Reasoning - ключевой элемент для построения точного и автономного агентского ИИ, и ,на данный момент, нет какого-то единого подхода к Reasoning, который можно было бы смело назвать Best Practice.
Однако есть кое-что общее - это процесс обучения. На финальной стадии обучения моделей, для четкого соблюдения инструкций используется Reinforcement Learning - обучение с подкреплением, когда мы даем модели примеры пар вопрос-ответ и “награждаем” за правильные ответы. Проблема состоит в том, что данный подход хорошо работает в областях, где у нас есть четкие правила и однозначные ответы. Но это хуже работает в области неспециализированных запросов (general queries), где все на так однозначно.
Здесь на сцену выходит SPCT. Что это такое?
Вместо того чтобы просто "награждать" модель за ответ, который нам кажется правильным, SPCT учит модель саму для себя формулировать принципы оценки хорошего ответа на конкретный запрос.
Работает это так:
Вы задаете сложный, открытый вопрос. Модель, обученная по методу SPCT, сначала как бы говорит себе: “Чтобы ответ был хорошим должен соответствовать определенным принципам: например, быть логичным, полным, учитывать контекст, и.т.д…” Затем она генерирует свой ответ и сама же его критикует с точки зрения этих выработанных принципов. Получается не просто бинарная оценка "хорошо/плохо", а развернутая обратная связь, основанная на самоанализе.
Примерно в таком же направлении пошли Anthropic в своей думающей Sonnet 3.7. Возможно китайцы нашли новую жертву (в прошлый раз ей была OpenAI) 😁
Но давайте лучше разберем, почему это подают как инновацию в Reasoning. В данном случае модель учится не просто следовать инструкции, а понимать, что значит "хорошо" в контексте конкретной, возможно, очень нетривиальной задачи. Она развивает способность к самооценке и адаптации критериев качества под разные ситуации. Это как раз то, что нужно для сложных рассуждений и построения автономных ИИ-агентов. Модель не просто ищет ответ, она учится оценивать качество своего мышления.
Какие еще плюсы дает SPCT
1. Снижение предвзятости: по результатам тестов модели DeepSeek-GRM, обученные с SPCT, показали меньше систематических ошибок и перекосов при оценке ответов из разных областей знаний по сравнению с другими подходами.
2. Эффективное масштабирование производительности: SPCT отлично показывает себя при масштабировании во время инференса (inference-time scaling). Простым языком: от модели можно получить значительно более качественные и продуманные ответы, просто выделив ей больше вычислительных ресурсов в момент генерации ответа. При этом LLM может параллельно сгенерировать несколько наборов принципов/критик, проанализировать их и выдать лучший результат. DeepSeek утверждают, что такой подход может быть эффективнее, чем простое увеличение размера самой модели.