TGViewer
Лидерство и ИИ [Артем Бондарь] Лидерство и ИИ [Артем Бондарь] @artemonml · 835 subscribers
Post #116 590
Очень смущают регулярные статьи вида «опенсорс всего на пол шага отстают от проприетарных моделей». Для меня это очень больная тема, потому что у нас в Т работает очень крутая фундаментальная команда, которая регулярно вытаскивает продуктовые инициативы из задницы, когда оказывается что опенсорс работает далеко не так радужно, как хочется.

И если раньше проблема скорее была в сатурированых и оверфитнутых бенчах, то сейчас с усложнением агентских сценариев, кажется проблема чуть тоньше. Вот мы делали агентов поддержки. Жирный хвост запросов в полностью цифровом саппорте - невероятно сложная вещь. И после того, как ребята проделали огромную работу: оцифровали и стандартизировали эти регламенты с точностью до самого галимого edge-case, оказалось, что GPT-5 в такой среде дает галлюцинаций как средний сотрудник поддержки (абсолют увы раскрыть не могу), а всё самое современное поколение квенов Кими дипсиков и прочих - отбитые 20% галлюцинаций. Очевидно, это в прод не поедет.

Хотя по бенчам все достаточно близко. И моя гипотеза, что тут две проблемы:
а/ подавляющее количество бенчей предполагает существование правильного ответа. Как в ЕГЭ - написать хоть что-то лучше чем не писать ничего. Вот модели и подхватывают это поведение фундаментально от целеполагания. Все, включая китайские, но те, как более агрессивные оверфитеры серьезнее от этого страдают
б/ китайцы жестко дистиллятся и мы видим артефакты сильной опоры на SFT / шумного реворда от LLM-критика. Живая RL среда в этом смысле меньше спихивает политику в режим «отвечай любой ценой»

Можно еще поспекулировать на эту тему, но факт остается: как бы нам продуктово не было удобно забить на дообучение, но на опенсорсе в действительно сложных задачах все еще невозможно бежать без тюнов. И это сильно усложняет агентизацию рф компаний: нет так много ребят могут позволить себе заводить онлайн рл на огромном кластере и имеют процессы, автоматизация которых финансово это упражнение оправдывает.
  • 👍 10
  • ❤ 7
More from @artemonml
  1. Sep 28, 2026Появилось немного времени и наконец погрузился в вопросы агентизации SDLC. У нас в Т есть…
  2. Sep 21, 2026Я сначала кринжевал с Барсика, купившего автомобиль в тбанке, а потом осознал весь постмод…
  3. Sep 19, 2026А зачем вообще вести тг канал? Иногда меня про это спрашивают знакомые, но чаще я сам зада…
  4. Sep 16, 2026Попугая научили говорить «эскалация» и он стал senior engineering manager’ом Какое-то врем…
  5. Sep 12, 2026Я думал, что буду писать «обо всём», но оказалось, что глубоко занимают меня на деле тольк…
  6. Sep 11, 2026Ну и для пропустивших айти пикник прилетели записи выступлений, где я в частности делился…
Threads Profile ViewerView any public Threads profile without an account.Open ThreadLook →Writing with AI? Make it sound human.Metric37 rewrites AI drafts so they read naturally. Free AI detector, 1,500 words free.Try Metric37 →