7 октября вышел MLflow 3.17.0. Главная тема релиза: специализированные модели-судьи вместо больших LLM для частых проверок и управление доступом на уровне отдельных ресурсов.
🤖 Jev-судьи от TypeSafe: для проверок «да/нет» и конечных категорий теперь работает
model="typesafe:/jev-latest" прямо в mlflow.genai.evaluate(). Jev возвращает структурное решение, MLflow записывает его как оценку, а распределение вероятностей сохраняется в метаданных: близкие вердикты видно при разборе результатов. Через AI Gateway ключ лежит на сервере, работают бюджеты и фолбэк на OpenRouter при лимитах провайдера.⚙️ Трейсинг решений:
mlflow.typesafe.autolog() трейсит вызовы System One: состояние, вопрос, структурный ответ, латентность и токены. Каждое решение агента видно вместе с вероятностью, без копания в сыром ответе.🔒 Права на подресурсы: RBAC теперь покрывает runs, traces, оценки, логированные модели, review queues и версии моделей, промптов, скореров и MCP-серверов. Появился явный DENY: ревьюер читает эксперимент, но трейсы к нему не видит. Wildcard-гранты ограничены доступом к родительскому контейнеру.
📊 Быстрые дашборды трейсов: опциональные ежедневные SQL-сводки (
MLFLOW_SQL_TRACE_ROLLUPS_ENABLED=true) разгружают аналитику по счётчикам, латентности, токенам и стоимости. Свежие данные идут по сырым запросам, история берётся из сводок.⚠️ При апгрейде: SQL-серверам требуется
mlflow db upgrade с остановленными писателями и бэкапом. Смешанные версии в rolling-режиме не поддерживаются, читайте гайд по миграции.💼 Зачем бизнесу: оценка агентов на больших датасетах дорожает с каждым judge-вызовом, и перенос рутинных проверок «да/нет» на специализированные модели срезает счёт заметно. Права на уровне трейсов открывают MLflow командам, где внешним ревьюерам нельзя показывать данные пользователей. У меня MLflow крутится на домашнем сервере с ранами decision-lab: контейнер ждёт обновления, любопытно посмотреть на Jev в деле против gpt-судьи.
#MLflow #MLOps #оценка #трейсинг #агенты
———
@tsingular
