DeepSeek выложили анонс R2: но решат ли их инновационные методы проблему вранья или модель ждет судьба OpenAI o3?
Я уже разбирал их новый метод обучения Self-Principled Critique Tuning (SPCT), который учит модели самокритике. И вот на днях DeepSeek анонсировали DeepSeek-R2, построенную на этих наработках. Учитывая шум, который наделала R1, ожидания высоки, но сможет ли R2 оправдать их на деле, а не только на бумаге?
Что нам обещают:
- Продвинутую мультиязычность - надеюсь, что уберут рандомные иероглифы из ответов.
- Мощный кодинг - v3 была в этом прямо хороша.
- Мультимодальность из коробки: текст, картинки, аудио, видео.
- Эффективность - модель должна требовать еще меньше ресурсов.
- Инновационные методы обучения (SPCT, GRM), здесь остановимся поподробнее.
Главный вопрос: не повторит ли R2 судьбу o3 от OpenAI?
Идея SPCT, где модель сама формулирует принципы и критикует свой ответ, звучит красиво. В прошлый раз я описывал, как это должно помогать в сложных задачах, где нет однозначно "правильного" ответа, в отличие от стандартного RLHF. Но там же у самих DeepSeek были вопросы к практической реализации такого сложного процесса самоанализа.
И вот главный момент: смогли ли DeepSeek побороть не только общую склонность LLM к галлюцинациям, но и потенциальные сложности самого SPCT? Или нас ждет очередная модель, которая впечатляет на бенчмарках, но на практике будет периодически генерировать дичь и доказывать, что она права, как это делают те же модели OpenAI семейства 'o'?
Они заявили про крутой метод, но справились ли они с его недостатками и сложностями применительно к реальным, открытым задачам? Вот это действительно интересно.
Вердикт? Ждем релиза
DeepSeek R2 - это, безусловно, важный анонс и показатель амбиций Китая в AI-гонке. Но пока не увидим модель в деле, все это - лишь маркетинг. Ключевой момент - сможет ли R2 быть не просто мощной, но и надежной. Иначе ее ждет хайп на старте а затем уход в небытие после реального использования. Будем наблюдать.
Post #280
593