Как и обещал - поподробнее про дистилляцию моделей.
На днях Anthropic (компания, которая выпускает Claude) провела расследование и вскрыла, по их словам, крупнейший в истории ИИ случай промышленного шпионажа. 25 000 поддельных аккаунтов полтора месяца выкачивали ответы их модели - почти 29 000 000 диалогов. Следы ведут к Alibaba (это не только магазин AliExpress, но ещё и один из крупнейших в мире разработчиков языковых моделей - Qwen). К слову, чуть раньше уже была похожая история с китайскими DeepSeek, Moonshot и MiniMax.
Сама по себе дистилляция - это когда большую, умную и дорогую модель (учитель) используют, чтобы обучить модель поменьше и подешевле (ученика). Ученик не знает, как именно работает модель учителя, к самим вычислениям доступа у него нет - он просто раз за разом смотрит, что именно тот отвечает, и учится отвечать в точности так же, перенимая заодно и манеру рассуждать. Идея в целом не новая, её ещё лет десять назад описал Джеффри Хинтон, один из отцов всего этого направления.
Перенимается при этом не всё. Ученик хорошо схватывает манеру учителя и его ответы на привычных задачах, но не саму способность думать. Пока задачи знакомые - держится близко к оригиналу; на чём-то по-настоящему новом начинает сильно плыть, ведь он научился повторять, а не понимать. Поэтому копия здорово притворяется оригиналом ровно до тех пор, пока не требуется шагнуть дальше него.
Именно этим и занимались те 25 000 аккаунтов - генерировали и накапливали ответы Claude, чтобы потом учить на них свою модель.
Получается ли таким путём копия оригинала? Нет, ученик остаётся слабее. У DeepSeek есть честный пример с конкретными цифрами: они официально дистиллировали свою большую модель в несколько маленьких, и на сложных задачах учитель выдавал около 80% верных ответов, а лучший ученик - около 72%. Тоже прилично, но это лишь уменьшенное, приближённое эхо оригинала.
Более дешёвую стоимость моделей от китайских разработчиков обычно объясняют хитрой инженерией: сама модель огромная, но на каждый запрос включается лишь небольшая её часть. Например, у DeepSeek из 600 с лишним миллиардов параметров на один запрос работают лишь несколько десятков - включается только нужный под задачу «кусок» сети (этот приём называют mixture of experts). Оттого и обучение, и ответы выходят заметно дешевле. Это правда, но это лишь полдела. Железо и инженерию они и вправду экономят.
Вот только самое сложное в разработке передовых LLM-моделей вовсе не это. Самое сложное и самое дорогое - это концептуальные части, те идеи, благодаря которым получается заставить модель работать лучше, чем работали её предшественники; на это уходят сотни миллионов и лучшие головы. И вот именно это дистилляция позволяет получить почти даром: выучиться сразу на готовых ответах лидера, минуя всю дорогую разведку. Снять с чужой модели самое ценное.
Отследить подобные действия очень непросто, ещё сложнее их доказать. В целом, такое обычно ловят по поведению: аккаунты шлют запросы синхронно, одинаковыми шаблонами, целенаправленно вытаскивают именно рассуждения - по этому почерку их вычисляют и сшивают в одну группу.
Если очень сильно упрощать, значительная часть китайских моделей - это сворованные американские лидеры рынка. Только сворованы здесь не железо и не код напрямую, а самое дорогое - идеи, логика работы и знания.
Который год в СМИ заявляют, что Китай вот-вот догонит и перегонит США в гонке ИИ, - а он всё так и держится на шаг позади (и, кстати, не только Китай). И это довольно закономерно: если весь твой подход к разработке - это списать, заглянув соседу по парте через плечо, то догнать этого соседа, а тем более обогнать, - задача не из простых.
Post #90
181