По мотивам поста у partially_unsupervised
Моя команда недавно делала классификатор текста с небольшим количеством трейн данных. В итоге, пайплайн был очень прост:
- подбор промпта (p-tune, aka finetune на минималках) к YaGPT на задачу классификации
- дистиляция YaGPT в простую NLP-модель (чуть ли не MLP) для быстрого инференса
Супер-быстро, рвет кастомные обученные с нуля сетки в пух и прах. Дообученный bert тоже. Основной челлендж скорее в определении таргета и сборе качественных данных
В целом, с развитием LLAMA / DeepSeek и прочих open-source LLM все больше компаний делают скорее бэкенд-обертки и промпты/логику поверх (файнтюн - просто более хитрая обертка), а не разрабатывают свои DL-решения. Получается, что для большинства компаний глубоких знаний в DL больше не нужно, только "fit-predict"? И трушный DL мертв?
Я бы сказал, что рано бросать курсы по DL и переходить в prompt-инженеры)
Во-первых, тру DL остался в рисерч отделах многих компаний. И в России тоже!
Во-вторых, в целые отрасли еще не внедрены LLM и foundational models. И во многие из них в ближайшие 2-3 года вряд ли внедрят:
- Таблички! Тут все еще рулят кастомные фичи + бустинги. Есть интересные попытки затащить нейроки (TabNet), но они все еще очень кастомные
- Computer Vision: уже на грани с появлением VLM, но еще держится. Знали бы вы, сколько промптов я перепробовал, чтобы сгенерить +- нужную мне картинку к посту)
- RecSys и Search: не просто так я именно тут работаю 😅. Много кастомных нейронок (SASRec, HSTU) и очень сложная метрика для оптимизации (баланс интересов пользователя, продавца, маркетплейса, логистики и еще кучи всего) - LLM пока не справляется
- Отрасли с "особенностями": Медицина, промышленность, строительство
В общем, не перевелись еще
Ваш @ml4value
