Чем больше я знаю про AI, тем меньше мне кажется, что я в нем разбираюсь. AI native Даннинг-Крюгер
Кажется, AI придумали специально, чтобы эффект Даннинга-Крюгера наконец вышел в народ. Еще никогда не было так легко за полчаса получить убедительное доказательство собственной экспертизы. Подключил Claude Code, дал доступ к паре систем, написал агента он сам сходил за данными, что-то проанализировал и вернулся с нормальным результатом. Ну все, примерно понятно, как работает AI. Вайбкодинг вообще сводить людей с ума)
Именно скорость первого результата здесь довольно сильно обманывает. В обычном продукте между идеей и работающей системой слишком много этапов, чтобы случайно их не заметить. С AI можно почти сразу увидеть красивый output, а вся сложность процесса, который должен стабильно его производить, остается за кадром.
Я давно работаю с AI в продуктах, а сейчас все больше занимаюсь тем, как AI встраивается в процессы компаний. И чем глубже я туда лезу, тем меньше для меня значит сам факт «мы сделали агента».
Мне хочется увидеть сам процесс: в какой точке появляется агент, каков его уровень автономности и какие решения он может принимать сам. Где лежит ответственность за результат. Какие действия обратимы, а где ошибка уже имеет серьезный blast radius. На каких шагах нужен human-in-the-loop и это реальный контроль или человек просто механически нажимает approve на все, что приносит модель.
Потом про качество. На каких сценариях все проверяется, как собран evaluation set, какие ошибки допустимы и где нужен quality gate. Как отличить случайную ошибку от системной деградации. Что происходит после смены модели, промпта, инструмента или данных. Есть ли regression evals и можно ли понять, что именно сломало процесс.
Дальше экономика. Сколько на самом деле стоит один успешно выполненный кейс с учетом модели, tool calls, инфраструктуры, повторных попыток и времени человека на проверку. Сколько стоил этот процесс до автоматизации. Что будет с экономикой, если ради нужного качества придется отправлять 30% кейсов человеку. И какой уровень ошибки вообще можно терпеть, если разные ошибки стоят бизнесу по-разному.
Наконец, все это нужно поддерживать. Кто заметит, что качество поплыло? Кто разбирает failed cases? Кто обновляет evals, когда меняется процесс? Кто отвечает за агента через полгода после запуска, когда его создатель уже занят чем-то другим?
И вот тут Даннинг-Крюгер в AI становится особенно заметным. AI дает ощущение компетенции гораздо быстрее, чем сама компетенция успевает появиться. Ты уже можешь собрать впечатляющую штуку, но еще не видеть половины вопросов, от которых зависит ее надежность.
Собрать агента сейчас дешево и быстро. Понять, где ему можно доверять, сколько стоит его автономность и кто отвечает за ошибки, все еще гораздо сложнее.
Наверное, поэтому чем больше я знаю про AI, тем меньше меня впечатляет сам факт, что агент работает))
Post #337
1.71K

- ❤ 30
- 💯 19
- 👍 9
- 🔥 7
- 👏 4
- 😁 3
- 🎉 3
- 🥰 2