TGViewer
from:adam from:adam @c3po_notes · 6.01K subscribers
Post #570 4.08K
Аня Подображных [Будни продакта] В мире AI-продуктов бенчмарк — это не подготовка к продуктовой работе, это и есть продуктовая работа. Короткой дороги нет. Ко мне регулярно приходят продакты, которые хотят построить своих ассистентов. И все хотят быстро. Демка правда собирается быстро. И…
Цифра ~50% почему-то часто не пугает людей, когда речь про AI-ассистентов. Каждый второй запрос в стену? Ну ок, бывает, докрутим. Это странно, ибо если переложить те же 50% на более классический продукт, который мы все умеем оценивать, отношение будет другим.

К примеру, интернет-магазин, который не создаёт каждый второй заказ, никто «докручивать» не будет — его чинят в ночь, в дождь, вопреки, потому что всем очевидно, что он сломан. Но представим магазин хитрее: заказ создаётся, а дальше то не доставят, то привезут не то или не туда, то спишут другую сумму. При этом снаружи всё может выглядеть как успех с непоколебимым покерфейсом: корзина, чекаут, «спасибо за покупку».

Ассистенты чаще ломаются именно так. Там, где классический софт падает с ошибкой, LLMки отвечают: «подписку отменил», а по факту ничего не отменил, «операция корректна», а она снесла прод-базу. Ровно тот самый идеальный покерфейс, и у пользователя обычно не хватает компетенций отличить правильный ответ от уверенного вранья.

Отсюда и разница в обратной связи. Косячащий магазин закидают жалобами и единицами в отзывах за день: чтобы понять, что привезли не то, экспертиза не нужна. А к ассистенту человек приходит ровно потому, что сам не знает ответа. Отличить хороший результат от плохого ему часто нечем, так что уверенный бред спокойно собирает свои пятёрки, либо собирает негатив с большой задержкой, либо вовсе выглядит как падающий ретеншн.

Откуда тогда спокойствие команд? Моя гипотеза: дело в лёгкости лицезрения. Метрики магазина дешёвые: доля созданных заказов, SLA доставки, возвраты. Собираются за день и орут с дашборда красными огнями. Если даже никто дашборд не построил, то быстро прибежит СЕО и заставит сделать сэппуку. Метрика качества ассистента дорогая, это тот самый бенчмарк и эвалы и нудные месяцы работы. А пока эвалов нет — нет и дашборда, на котором могло бы загореться красное.

А когда мы измеряем что-то, то часто это улучшаем. Если не измеряется, то «вроде работает» будет достаточно. Дешёвая метрика тычет тебя носом в провал, а дорогая разрешает жить в неведении и называть это оптимизмом.

Так что если у команды ассистента нет бенчмарка и эвалов, это не значит, что у неё нет 50% фейлов. Это значит, что она узнает о них последней.
  • 👍 15
  • 😁 10
  • 💯 10
  • ❤ 7
  • 🔥 3
More from @c3po_notes
  1. Sep 18, 2026Немного размышлений про эссе Дарио, в котором он просит индустрию замедлить темпы развития…
  2. Sep 15, 2026Часто слышу, что дистрибуция или скорость и есть моат. a16z прямо так и пишет: в потребите…
  3. Sep 12, 2026На этом фоне интересно посмотреть на другую сделку Bending Spoons. Пятью неделями раньше о…
  4. Sep 12, 2026Bending Spoons покупает Miro за почти $1,4 млрд. У этих ребят довольно понятная модель: ку…
  5. Sep 11, 2026Тут осознал, что теперь, когда думаю, как решить задачу, первым делом думаю не о самом реш…
  6. Sep 6, 2026В общем, впечатления от Астры очень смешанные. С одной стороны, она реально не нейрослопит…
Threads Profile ViewerView any public Threads profile without an account.Open ThreadLook →Writing with AI? Make it sound human.Metric37 rewrites AI drafts so they read naturally. Free AI detector, 1,500 words free.Try Metric37 →