Очень смущают регулярные статьи вида «опенсорс всего на пол шага отстают от проприетарных моделей». Для меня это очень больная тема, потому что у нас в Т работает очень крутая фундаментальная команда, которая регулярно вытаскивает продуктовые инициативы из задницы, когда оказывается что опенсорс работает далеко не так радужно, как хочется.
И если раньше проблема скорее была в сатурированых и оверфитнутых бенчах, то сейчас с усложнением агентских сценариев, кажется проблема чуть тоньше. Вот мы делали агентов поддержки. Жирный хвост запросов в полностью цифровом саппорте - невероятно сложная вещь. И после того, как ребята проделали огромную работу: оцифровали и стандартизировали эти регламенты с точностью до самого галимого edge-case, оказалось, что GPT-5 в такой среде дает галлюцинаций как средний сотрудник поддержки (абсолют увы раскрыть не могу), а всё самое современное поколение квенов Кими дипсиков и прочих - отбитые 20% галлюцинаций. Очевидно, это в прод не поедет.
Хотя по бенчам все достаточно близко. И моя гипотеза, что тут две проблемы:
а/ подавляющее количество бенчей предполагает существование правильного ответа. Как в ЕГЭ - написать хоть что-то лучше чем не писать ничего. Вот модели и подхватывают это поведение фундаментально от целеполагания. Все, включая китайские, но те, как более агрессивные оверфитеры серьезнее от этого страдают
б/ китайцы жестко дистиллятся и мы видим артефакты сильной опоры на SFT / шумного реворда от LLM-критика. Живая RL среда в этом смысле меньше спихивает политику в режим «отвечай любой ценой»
Можно еще поспекулировать на эту тему, но факт остается: как бы нам продуктово не было удобно забить на дообучение, но на опенсорсе в действительно сложных задачах все еще невозможно бежать без тюнов. И это сильно усложняет агентизацию рф компаний: нет так много ребят могут позволить себе заводить онлайн рл на огромном кластере и имеют процессы, автоматизация которых финансово это упражнение оправдывает.
Post #116
590
- 👍 10
- ❤ 7