Agent 可观测性常犯一个错:精确记录模型调用、提示词和 token,却在 Agent 真正开始操作软件时失去追踪。这种痕迹看起来很干净,事故却无法定位。Honeycomb 的 Agent Timeline 仪表指南指出,GenAI span 应涵盖 Agent 引发的所有工作:模型调用、工具调用、任务移交、下游服务、数据库查询和后台任务。Conversation ID 是跨 trace、服务、多轮交互的用户级工作单元,它决定了团队拿到的是完整的 trace 还是一堆无法关联的 span。
OpenTelemetry GenAI agent-span 规范要求gen_ai.conversation.id仅在真实标识存在时填充,不得回退到 UUID、trace ID 或内容哈希。每个 agent 还需分配唯一的gen_ai.agent.name,子 agent 不能继承父名称。同时在 collector 层对 prompt 等敏感内容做脱敏,避免数据蔓延。Trace 不应止于遥测收集,而应成为评估、回归检测和发布门禁的控制面。Candidly 的案例显示,trace 特征预测客户对话是否解决的 AUC 达到 0.90。
先从产品会话边界注入真实 conversation ID,贯穿 Agent 运行时、LLM 调用、工具执行、队列和数据库,然后在测试环境主动制造故障来验证链路完整性。Agent 可观测性遵循的是 Agent 引发的实际工作,Conversation ID 是贯穿这根链条的线索。
#开发者 #工具 #AIAgent #ConversationID #OpenTelemetry #Honeycomb #LangSmith #AgentObservability #可观测性
@DevToolboxHub


