TGViewer
from:adam from:adam @c3po_notes · 6.01K subscribers
Post #560 4.64K

Forwarded from Аня Подображных [Будни продакта]

В мире AI-продуктов бенчмарк — это не подготовка к продуктовой работе, это и есть продуктовая работа. Короткой дороги нет.

Ко мне регулярно приходят продакты, которые хотят построить своих ассистентов. И все хотят быстро. Демка правда собирается быстро. И на глаз даже кажется, что отвечает неплохо. Но первый же замер качества на нормальном датасете даёт ~50%

Почему никто не хочет строить бенчмарк и эвал, даже если знает о существовании этих слов? Потому что это нудно. Собрать запросы, убедиться, что они похожи на то, что люди реально будут спрашивать (иначе вся работа в стол). Понять, что такое хороший ответ, научиться согласованно размечать ответы на хорошие и нехорошие…

А что такое хороший ответ? Если девушка попросила красную помаду, и ассистент подобрал красную помаду, — это хорошо? Да вообще не факт. Может, она хотела весь вечер целоваться, не оставляя нигде следов. Откуда ж мы знаем.

Узнать можно только одним способом — спросить. Так мы и строили ассистента для подбора товаров: обзвонили людей, которые недавно что-то покупали, опросили их по методологии, близкой к JTBD: что искал, в каком контексте, какого результата ждал… Ценность не в том, чтобы найти товар по запросу, а в том, чтобы решить задачу, которая за этим запросом стоит.

Тогда работа ассистента распалась на две части: правильно собрать контекст с человека и правильно подобрать товар под этот контекст. Но что значит «правильно подобрать»? С помадой разобрались — не должна оставлять следов. А если «ноутбук для брата, чтобы играть в майнкрафт и делать проекты в скретче»? Я в ноутбуках не разбираюсь вообще. Для некоторых категорий нам пришлось привлекать экспертов, которые объясняли, как переводить человеческий запрос на язык фильтров и критериев подходящести. Так мы руками проделали работу ассистента на большом датасете. И именно поэтому поняли, как её автоматизировать и как проверять.

Сбор бенчмарка оказался половиной всей работы над продуктом, если не больше. Всё остальное (прототипы, выбивание целевого качества, переезд на маленькие модельки…) стояло на этом фундаменте.

Так что пропустить сбор бенчмарка — это как сказать "Я знаю короткую дорогу". А потом сделать крюк и пойти по навигатору ))

Через 2 недели на TurboML Conf наш ML-инженер Саша Замиралов расскажет как мы научили ассистента подбирать товары. Как строили бенчмарк, итерировались, как переезжали на маленькие модельки, улучшая скорость и не теряя в качестве. Будет довольно технический доклад — приходите, если не боитесь!

Рега закроется завтра: https://l.tbank.ru/turbo-ap
  • ❤ 29
  • 👍 7
More from @c3po_notes
  1. Sep 18, 2026Немного размышлений про эссе Дарио, в котором он просит индустрию замедлить темпы развития…
  2. Sep 15, 2026Часто слышу, что дистрибуция или скорость и есть моат. a16z прямо так и пишет: в потребите…
  3. Sep 12, 2026На этом фоне интересно посмотреть на другую сделку Bending Spoons. Пятью неделями раньше о…
  4. Sep 12, 2026Bending Spoons покупает Miro за почти $1,4 млрд. У этих ребят довольно понятная модель: ку…
  5. Sep 11, 2026Тут осознал, что теперь, когда думаю, как решить задачу, первым делом думаю не о самом реш…
  6. Sep 6, 2026В общем, впечатления от Астры очень смешанные. С одной стороны, она реально не нейрослопит…
Threads Profile ViewerView any public Threads profile without an account.Open ThreadLook →Writing with AI? Make it sound human.Metric37 rewrites AI drafts so they read naturally. Free AI detector, 1,500 words free.Try Metric37 →