TGViewer
Nik в мире данных Nik в мире данных @analytics_engineer · 1.31K subscribers
Post #80 2.23K
Access Agents + метаданные: как разрулить доступ в огромном Lakehouse

TL;DR

В статье и докладе Meta описывает мультиагентную систему:

- Data User Agents 🧑 - ускоряют получение доступа пользователями (вплоть до «частичного» предпросмотра для чувствительных данных).
- Data Owner Agents 🤖 - автоматизируют управление доступом от лица владельцев сущностей и соблюдают политики доступа.
- Orchestrator Agent 🌺 - управление переговорами между агентами и обработка принятого решения

В видео говорится, что система настроена консервативно: при сомнительных кейсах доступ не выдаётся автоматически. При этом более 70% запросов обрабатывается без вовлечения владельцев данных.

Где посмотреть? 🎦

Видео - https://www.youtube.com/watch?v=qT1Il-pzQGQ

Статья - https://engineering.fb.com/2025/08/13/data-infrastructure/agentic-solution-for-warehouse-data-access/

Зачем? 👍

Цель - демократизировать доступ к данным. Если в стартапах/scale-up ручные аппрувы и простые эвристики (а-ля «дай данные по каталогу сотрудников») ещё работают, то на масштабе бигтеха нужно риск-ориентированное принятие решений.

Идея такая: с обеих сторон работают агенты, и они принимают решение на основе набора сигналов и их весов.

Со стороны датасета: тип и назначение данных, политика изменений, критичность и конфиденциальность, частота обновлений, примеры запросов.

Со стороны пользователя/ИИ-агента: детали юзкейса, информация о сотруднике/роли, требуемая скорость и критичность доступа, плюс анализ шаблонов запросов.Дополнительно ведётся постоянный мониторинг актуальности метаданных и самих решений.

Как проверять 🙆(near real-time/microbatch), оценивать качество и держать деградации под контролем?
- Risk-score модель для принятия решения.
- Валидация решения: прогон на эталонном наборе. Одного раза недостаточно - нужна защита от деградаций агента во времени.
- Контроль качества: ведутся trace-логи; по ним можно выборочно перепроверять решения, разбирать corner cases и повышать долю автоматизации.
- Human-in-the-loop: быстрые апелляции и фидбек владельцев данных возвращаются в evals и обучающую петлю (data flywheel).

Выводы 🔼
Как по мне (да, я слегка biased 😅), это неплохой пример успешного применения агентов для внутренних процессов. Система существенно ускоряет доступ в большинстве кейсов и при этом не превращает on-call в хаос.

А как выдают доступ в ваших компаниях?
  • 🔥 9
  • 🤝 1
More from @analytics_engineer
  1. Aug 30, 2026AI Dev Tools Zoomcamp 2026 launches tomorrow. The course teaches you how to: - Choose the…
  2. Aug 10, 2026В целом, заметил, что в моем bubble нетворке обсуждают подписки и конкретные модели сильно…
  3. Jul 28, 2026Решил сделать площадку для обсуждений / созвонов по Agentic / AI Engineering in Data на ос…
  4. Jul 20, 2026Ищу к себе двух инженеров, удаленка (100-150$k) Вакансия ближе к разработке и ML https://j…
  5. Jul 6, 2026в бигтехе после сокращений, флатерингов, лейфоф промзошла тихая девальвация уровней. она и…
  6. Jun 30, 2026DEMate - тот, кто тебя заменит Meta пошарила статью про DEmate - внутреннего AI-ассистента…
Threads Profile ViewerView any public Threads profile without an account.Open ThreadLook →Writing with AI? Make it sound human.Metric37 rewrites AI drafts so they read naturally. Free AI detector, 1,500 words free.Try Metric37 →