Часть 1
Часть 2 (вы тут)
3️⃣ 0.9 * 0.9 * 0.9 * 0.9 * 0.9 = 0.6
О чем речь? О качестве современных агентов. LLM обладают некоторой стохастичностью ответа, могут иметь галлюцинации, поэтому математика агентских систем может быть удручающей: при качестве отдельного ответа 90% мы получаем на 5 итерациях агента с качеством 60% из-за того, что ошибка на одном из шагов повлияет на все последующие.
По этой причине каждому советую побороть желание сразу бежать делать агента и следовать следующей цепочке:
request -> flow -> agent
Прогноз на 2026 #4: Многие LLM-agent проекты схлопнутся, поскольку агенты на фронтир моделях не смогут адаптироваться под переезд на более дешевые/маленькие LLM (ограничение production, или требования заказчика/регулятора, или снижение бюджета). Развитие small-LM не успеет дойти до нужного качества в 4B моделях, приблизившись к нему только в 2027 году.
4️⃣ Притча о мальчике, который кричал
R&D очень хочет построить агентов, а бизнес очень хочет рассказать об LLM-агентах клиентам/инвесторам (потому что кривая хайпа по гартнеру). Эта лихорадка приводит к тому, что многие проекты лоббируются и внедряются без должной проверки качества. Но с насыщением рынка у всех появятся LLM фичи. А раз есть у всех, то это не назвать конкурентным преимуществом. На чем вывозить дальше?
Прогноз на 2026 #5
: Рынок изменит риторику с вопроса "а может ли агент делать Х?" на вопрос "с каким качеством агент может Х?", само наличие LLM в продукте перестанет быть конкурентным преимуществом.
5️⃣ Как же мерить качество LLM фичей?
За этот год собрал коллекцию паттернов и антипаттернов оценки качества, которым хотел бы поделиться с вами:
1) Лабы жадно пылесосят интернет, поэтому ценность открытых бенчмарков сводится на нет ("Training on the test set is a new art form", - Андрей Карпати). Верьте регулярно обновляемым бенчмаркам (как SWE-rebench) или стройте свой закрытый (как LLM in business workloads). К слову, мы пошли по второму пути для оценки LLM в обнаружении вредоносного кода.
2) Не используйте LLM судей. Во-первых смотрите выше в посте п.3, во-вторых они предвзяты к длине и стилю текста, в-третьих деградируют при смене модели.
3) Следите за стабильностью ответа, делайте тесты на воспроизводимость с аугментацией входных даннх (подчерпнул из разбора статьи по LLM в анализе уязвимостей)
4) Тестируйте не только финальное решение, но и цепочку размышлений. Используйте SGR/SO для валидации качества промежуточных этапов размышления модели.
Прогноз на 2026 #6
: Крупные вендоры и независимые консалтинговые агентства начнут монетизировать оценку качества агентов в коммерческих рынках. Появятся закрытые бенчмарки, на которые станут опираться вендоры для продвижения своих AI-first продуктов
P.S. Всё, пошел резать салаты к новому году, всех обнял 🎄