Dynatrace 收购 Arize:AI Agent 可观测性的新范式

Dynatrace 收购 AI 可观测性平台 Arize,旨在解决 AI Agent 产生海量 trace 数据、人类无法逐条审查的核心痛点,为开发者提供面向智能体的新一代可观测方案。
为什么传统可观测性撑不住 AI Agent?
当 AI Agent 开始在生产环境中自主决策、调用工具、编排多步任务时,一个问题随之浮现:没有人愿意看几十亿条 trace。
这不是夸张。一个复杂 Agent 每次执行可能产生数百甚至上千条 span,涵盖 LLM 调用、工具执行、上下文检索、重试逻辑等。乘以每天数百万次请求,trace 数据的规模远超人类审查能力。
传统 APM(应用性能监控)工具设计初衷是面向请求-响应模式的服务,其仪表盘和告警逻辑难以适配 Agent 的非线性、概率性、多轮交互特征。
Dynatrace 为何选择收购 Arize
Dynatrace 是老牌可观测性巨头,覆盖基础设施、应用性能、安全等领域。而 Arize 专注于 AI/ML 系统的可观测性,尤其在 LLM 推理链路追踪、评估和监控方面积累了专门能力。
这次收购的核心逻辑:
- 能力互补:Dynatrace 有企业级部署和基础设施监控能力,Arize 有 AI 推理链路的专业分析工具
- 场景驱动:企业部署 Agent 后,需要端到端可观测——从基础设施到模型推理到业务结果
- 数据规模挑战:Agent 产生的 trace 量级需要自动化分析,而非人工审查
对开发者意味着什么
如果你正在构建 AI Agent,以下是这次收购带来的实际启示:
1. 可观测性设计要前置
不要等到 Agent 上线后才补监控。在开发阶段就应规划:
- 每个 LLM 调用的输入/输出记录
- 工具调用的参数和返回值
- 决策分支的上下文快照
- 异常路径的完整链路
2. 关注 Agent 特有的指标
传统指标(延迟、错误率)不够用,Agent 场景还需要:
- 推理质量:输出是否符合预期
- 工具调用准确率:是否选对了工具、传对了参数
- 任务完成率:多步任务是否成功结束
- 幻觉检测:输出是否包含虚假信息
3. 自动化分析是刚需
面对海量 trace,人工审查不现实。需要:
- 自动异常检测和聚类
- 基于采样策略的重点 trace 提取
- 模式识别和趋势分析
- 与告警系统的联动
实践建议
无论你是否使用 Dynatrace/Arize,以下原则适用于任何 Agent 可观测性方案:
| 层面 | 关注点 | 工具/方法 |
|---|---|---|
| 推理层 | LLM 调用质量、延迟、token 消耗 | OpenTelemetry + 自定义 span |
| 编排层 | 任务流、分支决策、重试 | 工作流引擎日志 + trace 关联 |
| 工具层 | 外部 API 调用成功率、超时 | 标准 APM 工具 |
| 结果层 | 任务完成率、用户满意度 | 业务指标 + 反馈收集 |
总结
AI Agent 的可观测性不是传统 APM 的简单延伸,而是需要专门的数据模型、分析方法和交互界面。Dynatrace 收购 Arize 释放的信号很明确:行业正在为 Agent 时代的可观测性重新定义工具链。
对开发者而言,现在就该开始思考:你的 Agent 出问题后,你如何快速定位原因?如果没有答案,这就是需要优先解决的问题。


本文基于 The New Stack 的公开内容,由 AI 辅助整理改写后发布。
原标题:“No human wants to look at billions of traces”: Dynatrace bought Arize because agents need a new kind of observability
阅读原文