TGViewer
семантический слой семантический слой @semanticlayer · 104 subscribers
Post #7 300
LLM и продуктовая аналитика

Когда ChatGPT только появился, целая плеяда стартапов сразу же попыталась использовать его для помощи аналитикам. На первый взгляд, в этом есть смысл: у компаний есть огромные хранилища данных, в этих данных (предположительно) есть какие-то полезные инсайты. Если бы что-то могло соединить точки в наших массивах данных, это был бы ChatGPT или что-то подобное.

Как мы знаем, не все так просто. Семантический слой, про который тут часто говорим, как категория продуктов, возможно станет мостом к этому переходу. Но это только один из подходов к современному conversational BI, который хорошо решает задачу репортинга.

Однако задача аналитика на самом деле - искать правильные вопросы. Начальные вопросы могут быть ясными, но вы не знаете, куда они приведут вас в зависимости от того, что вы найдете. Поэтому детальный причинно-следственный анализ через conversational B может быть сложнее.

И тут приходит логичная, и даже не очень новаторская для 2024, идея – а почему бы не применить трансформеры к сырому логу ивентов. При правильно расставленной телеметрии, любое взаимодействие пользователя с цифровым продуктом можно представить через аккуратную последовательность ивентов. А трансформеры отлично справляются с последоватльностями.

Интересный подход в этом направлении делает американский продукт Motif Analytics (один из основателей - физтех btw). Они громко заявляют о создании foundational модели, обученной на продуктовых ивентах (правда это маркетинговое название / подход, чем реально общедоступная сетка).

Чтобы моделировать последовательности событий с минимальными изменениями в исходных данных, они используют подход, имитирующий обучение LLM на текстовых данных. Команда разработала свой токенизатор для событий, который позволяет гибко фиксировать их время и различные свойства. Они также создали кастомную функцию потерь с несколькими временными масштабами: изменили цель обучения, чтобы сделать модели менее близорукими, поощряя их изучать, как события будут развиваться в течение следующих нескольких минут, часов и дней, а не просто предсказывать следующее ивент из набора.

Технологически решение интересное. Но сложно представить, что такой продукт конкурирует с условным Amplitude. Скорее всего аудитория – компании, которые шлют десятки миллионы ивентов в сутки, держат все in-house и нанимают целую команду аналитиков и дата-саентистов.

Но что тут мне нравится, что продукт не пытается создать ИИ-агента для продуктовой аналитики и не пытается самостоятельно заниматься анализом, заставляя компьютеры действовать как аналитики. Вместо этого он относится к LLM как к тому, чем он является на самом деле: к легковесному молниеносному калькулятору с потрясающей памятью.

Такая модель и сам подход не только быстро отвечает на вопросы вроде "сколько пользователей сделали ивент A перед ивентом B и не счернулись", но и предоставляет возможность моделировать динамику продукта. Например, можно спросить вопрос –”если я поменяю первый экран в онбординге мобильного приложения, как это скажется на конверсии в первую покупку?” и получить какой-то бейзлайн, который можно будет сравнить с онлайн экспериментом.

Конечно звучит немного абстрактно, но это в теории новый подход, находящийся между A/B тестированием (дорогим, но дающим уверенности в причинности) и общей отчетностью (которая больше рассматривает корреляции, но не причинности).

P.S. Очень похожий популярный проект есть в российском сообществе — Retenteering, Python библиотека для анализа пользовательских траекторий и CJM. Довольно мощный инструмент для продуктовой аналитики, который позволяет анализировать траектории, находить похожие и выявлять узкие места в продукте. Вместо LLM используются вычислительно простые методы из прикладного анализа данных, такие как TF-IDF и TSNE для снижения размерности графов траекторий, что облегчает визуализацию и анализ на плоской карте, изучая их кластеры и различия.
More from @semanticlayer
  1. Nov 13, 2025​​Семантический слой Когда-то, работая аналитиками, мы делали сотни дашбордов. Заказчики и…
  2. Oct 14, 2025Что, на самом деле происходит в слиянии Fivetran и dbt Думаю, все уже слышали о самом свеж…
  3. Sep 29, 2025кажется наблюдаем закат движения modern data stack https://www.theinformation.com/articles…
  4. Aug 26, 2025прочитал слегка старую (от июня), но годную заметку от General Analysis про уязвимости в с…
  5. Aug 22, 2025photo post
  6. Jun 25, 2025результаты. использовали Llama-3.1-8BInstruct и сравнивали с другими text-to-sql подходами…
Threads Profile ViewerView any public Threads profile without an account.Open ThreadLook →Writing with AI? Make it sound human.Metric37 rewrites AI drafts so they read naturally. Free AI detector, 1,500 words free.Try Metric37 →