Продолжение ответов на вопросы, которые не успели охватить в рамках эфира 20 апреля:
11. Есть ли возможность писать настройки для технического промпта?
По умолчанию – нет. Технический промпт не редактируется пользователем. Но если потребуется, команда DataForge может либо дописать нужное, либо сделать возможность редактирования.
12. Есть ли гарантия, что на один и тот же запрос агент будет выдавать одинаковый результат?
Нет, такой гарантии нет. LLM-агенты работают стохастически. Даже при температуре = 0 результат может быть немного разным, особенно в интерпретациях. Цифры же из SQL должны совпадать.
13. Можно ли изменять температуру?
Да, есть такая возможность в интерфейсе. На данный момент температура выставлена в 0 (минимум креативности).
14. SQL генерируется алгоритмически или LLM?
Генерируется LLM (в рамках подхода Text-to-SQL). В дальнейшем планируется также генерация Python-скриптов.
15. Можно ли анализировать ETL-процессы и строить визуальный pipeline?
Пока нет. ETL-процессы напрямую не анализируются. Но есть партнёрство с Loginom, и связка с их ETL-решением прорабатывается.
16. Как описывается реестр метрик? По метаданным таблиц или парсится ETL?
По метаданным таблиц и структуре хранилища. Агент анализирует таблицы, поля, связи и автоматически формирует показатели, измерения, факты и справочники.
17. Какой размер хранилища данных использован в примере?
Тестовая база данных содержит порядка 6 миллионов строк.
18. Есть ли риск, что агент «придумает» описание хранилища?
Риск не нулевой, но снижен за счёт:
🔥температура = 0,
🔥агент работает на основе реальной структуры БД,
🔥результат проверяется аналитиками перед использованием.
19. Как объём данных влияет на скорость обработки?
При автоматическом создании описаний хранилища объём данных влияет слабо, так как агент не выкачивает все данные, но скорость зависит от сложности схемы БД, количества таблиц и связей. А при автоматическом построении отчётов влияние объёма данных зависит от сложности генерируемых для этих отчётов выборок данных.
20. Если формулы на уровне BI, как система их понимает/ загружает?
Формулы описываются в семантическом слое DataForge (РПИ – реестр показателей и измерений). BI-системы не разбирают формулы самостоятельно – они подключаются к готовым витринам или используют API DataForge.
Продолжение вопросов ниже ⬇️
DataForge | Подпишитесь и следите за обновлениями платформы 🔗