Спикер: Никита Дубко
Представьте ситуацию, которая, конечно, никак не могла произойти с вами. Где-то в далекой-далекой галактике…
Есть компания, которая делает сервис по учету денег для малого бизнеса. В конце квартала она подводит итоги и видит: 7-day retention заметно снизился. СЕО тут же дает шесть недель, чтобы нормализовать метрику.
Приходит антикризисный консультант, видит гневные письма в поддержку, жалобы от крупного клиента и выдает: «Проблема в онбординге. Сделаем его хорошо — все будет замечательно». А еще к вопросу подключается LLM и подтверждает: да, нужно улучшать онбординг.
Компания берется за работу. Не успевает — подключает больше людей. Проводит A/B-тестирование и видит, что метрика повышается. Ура?
Только спустя полтора месяца выясняется: дашборд был сломан изначально. Тот самый 7-day retention отображался неверно.
В какой момент команда перестала проверять, что происходит?
1. Дискавери: от одного весомого звонка мы пугаемся и начинаем что-то менять.
2. Авторитет как критерий выбора: СЕО, консультант и LLM сказали «надо» — значит надо.
3. Ошибка невозвратных затрат в реализации: «Мы уже вложились, давайте добавим ресурсов», чтобы
4. Измерение результата: недельное A/B-тестирование на маленькой выборке дало желаемую, но невалидную метрику.
Мы — биологические существа, совершаем ошибки. Даже зная про искажения, в моменте их сложно распознать. Нужен процесс, который поможет отделить искажение от реальности.
Почему LLM не спасает автоматически
Есть такой термин — sycophancy (подхалимство). Исследования подтверждают: людям нравится, когда ИИ с ними соглашается, и они считают такие ответы более достоверными. Если запросить: «Докажи мне, что моя идея хороша, даже если фактов нет», LLM подхалимничает. В нее это заложено.
Как заставить ИИ быть честным
🤩 Задайте нейтральный промпт: «Не опирайся на мое мнение. Посмотри объективно и поспорь со мной».
🤩 Пропишите условие: «Думай на английском, отвечай на русском». Запросы на английском дают более точные рассуждения из-за токенизации.
🤩 Используйте агентные скиллы. На GitHub есть куча инструментов, которые перепишут ваши промпты так, чтобы ИИ работал рациональнее.
Агентная система «Гуси-доколебуси»
Это четыре независимых субагента:
⏺ Пруфер
В окне без контекста отделяет факты от не-фактов в вашем PRD.
⏺ Шаблонизатор
Приводит данные к сравнимой структуре, убирая неопределенность.
⏺ Душнила
Пытается опровергнуть написанное, найти данные, которые сломают гипотезу, и подобрать условия остановки проекта. Иногда его нужно просто взять и остановить.
⏺ Летописец
Фиксирует изначальные гипотезы. После релиза помогает проверить, совпали ли они с реальностью, чтобы не было выводов типа: «А ну, я так и думал» .
Когда вы скормите такой системе кейс, она не скажет, что точно делать. А скажет: «Ты еще сходи и подумай. Здесь у тебя искажение, здесь домыслы». И предложит проверить источник метрики.
В кейсе компании из далекой-далекой галактики гуси не знали, что дашборд сломан, но сделали предположение, которое можно проверить.
Следующий уровень — LLM-Wiki
Одного чата мало, контекст теряется. Более эффективным будет принцип LLM-Wiki. Вы берете свои сырые источники данных и скармливаете LLM. Она находит противоречия и выдает ответы со ссылками.
Чтобы не переполнить контекст, можно использовать пакет QMD, работающий с текстами как со смысловой базой данных.
Как не оказаться на месте компании из далекой-далекой галактики
Запустите аудит «Гусей-доколебусей» на своих старых задокументированных решениях.
Формируя промпт, примените скилл «Объекция», чтобы прибраться в запросе.
Вы как люди можете ошибаться. Но хорошо бы иметь процесс, позволяющий делать не такие критичные ошибки. Как минимум потому, что вы начнете их замечать.
Поставьте этому посту реакцию 👍, если хотите увидеть отдельный разбор когнитивных искажений с доказательной базой.
@pplsense


