А вы наймёте нейросеть? (продолжение)
Раньше я рассказывал как популярные LLM пытаются отвечать на вопросы с собеседований.
Контекст простой: LLM получает график в виде картинки и задание в виде текста, думает недолго и пытается ответить за человека, который претендует на позицию аналитика в коммерческой компании.
Результаты до этого были разные. Конечно, они были спорные, конечно, было много умных формулировок, была уверенность в своей правоте, были хорошие мысли, которые могли бы быть началом интересного разговора. Но важные смысловые мелочи терялись постоянно.
Есть у меня ещё одна задача. Меня часто за неё критикуют. Считается, что она слишком жестокая для собседования аналитиков.
А я считаю, что у неё очень "сильный сигнал", то есть результаты по этой задаче имеют высокую корреляцию с набором других важных навыков. Как сказали бы в ЧГК, это "разводящий" вопрос.
С одной стороны, вы уже знаете, что есть подвох. С другой стороны, ну мы же тут развлекаться пришли.
Давайте попробуем её посмотреть.
Задача №3
Представьте, что у нас есть хороший приносящий деньги бизнес, за который не стыдно: у нас есть много лояльных клиентов. Например, у нас есть интернет-магазин и есть email-рассылка с каталогом товаров, на которую законно и этично подписана большая аудитория. Они видят в своём почтовом ящике письмо от их любимого бренда, открывают его, смотрят описания товаров (акций, спецпредложений — ну чего-то), в конце письма есть кнопка “Купить” (нейтрального цвета как обычная кнопка в интерфейсе) после нажатия на которую переходим на сайт. Там уже можно что-то купить.
Продуктовой команде пришла в голову идея поднять продажи с помощью изменения цвета кнопки.
Нам опять повезло, не психология, не привязанность к бренду, не долгосрочные прогнозы, а продажи здесь и сейчас.
Решили провести тест: разделили всю нашу лояльную (давшую согласия на обработку персональных данных и рекламную рассылку) аудиторию на три группы: контрольную (в которой примерно 90% аудитории) и две экспериментальных, с зелёной и красной кнопкой (примерно по 5%).
Ждём фиксированное время и смотрим на следующие результаты теста.
Зелёным подсвечены места, где результат теста статистически лучше базового. Если бы где-то было статистически хуже — это было бы подсвечено красным.
Тест "крутился" правильное время, ошибок в формуле подсчёта статзначимости тоже нет.
Post #247
217

- ❤ 2