智能工具库

Dynatrace 收购 Arize:AI Agent 可观测性的新范式

Dynatrace 收购 Arize:AI Agent 可观测性的新范式

Dynatrace 收购 AI 可观测性平台 Arize,旨在解决 AI Agent 产生海量 trace 数据、人类无法逐条审查的核心痛点,为开发者提供面向智能体的新一代可观测方案。

2026-10-02 0来源:The New Stack

为什么传统可观测性撑不住 AI Agent?

当 AI Agent 开始在生产环境中自主决策、调用工具、编排多步任务时,一个问题随之浮现:没有人愿意看几十亿条 trace。

这不是夸张。一个复杂 Agent 每次执行可能产生数百甚至上千条 span,涵盖 LLM 调用、工具执行、上下文检索、重试逻辑等。乘以每天数百万次请求,trace 数据的规模远超人类审查能力。

传统 APM(应用性能监控)工具设计初衷是面向请求-响应模式的服务,其仪表盘和告警逻辑难以适配 Agent 的非线性、概率性、多轮交互特征。

Dynatrace 为何选择收购 Arize

Dynatrace 是老牌可观测性巨头,覆盖基础设施、应用性能、安全等领域。而 Arize 专注于 AI/ML 系统的可观测性,尤其在 LLM 推理链路追踪、评估和监控方面积累了专门能力。

这次收购的核心逻辑:

  • 能力互补:Dynatrace 有企业级部署和基础设施监控能力,Arize 有 AI 推理链路的专业分析工具
  • 场景驱动:企业部署 Agent 后,需要端到端可观测——从基础设施到模型推理到业务结果
  • 数据规模挑战:Agent 产生的 trace 量级需要自动化分析,而非人工审查

对开发者意味着什么

如果你正在构建 AI Agent,以下是这次收购带来的实际启示:

1. 可观测性设计要前置

不要等到 Agent 上线后才补监控。在开发阶段就应规划:

  • 每个 LLM 调用的输入/输出记录
  • 工具调用的参数和返回值
  • 决策分支的上下文快照
  • 异常路径的完整链路

2. 关注 Agent 特有的指标

传统指标(延迟、错误率)不够用,Agent 场景还需要:

  • 推理质量:输出是否符合预期
  • 工具调用准确率:是否选对了工具、传对了参数
  • 任务完成率:多步任务是否成功结束
  • 幻觉检测:输出是否包含虚假信息

3. 自动化分析是刚需

面对海量 trace,人工审查不现实。需要:

  • 自动异常检测和聚类
  • 基于采样策略的重点 trace 提取
  • 模式识别和趋势分析
  • 与告警系统的联动

实践建议

无论你是否使用 Dynatrace/Arize,以下原则适用于任何 Agent 可观测性方案:

层面 关注点 工具/方法
推理层 LLM 调用质量、延迟、token 消耗 OpenTelemetry + 自定义 span
编排层 任务流、分支决策、重试 工作流引擎日志 + trace 关联
工具层 外部 API 调用成功率、超时 标准 APM 工具
结果层 任务完成率、用户满意度 业务指标 + 反馈收集

总结

AI Agent 的可观测性不是传统 APM 的简单延伸,而是需要专门的数据模型、分析方法和交互界面。Dynatrace 收购 Arize 释放的信号很明确:行业正在为 Agent 时代的可观测性重新定义工具链。

对开发者而言,现在就该开始思考:你的 Agent 出问题后,你如何快速定位原因?如果没有答案,这就是需要优先解决的问题。

Featued image for: “No human wants to look at billions of traces”: Dynatrace bought Arize because agents need a new kind of observability

Signal by Arize

本文基于 The New Stack 的公开内容,由 AI 辅助整理改写后发布。

原标题:“No human wants to look at billions of traces”: Dynatrace bought Arize because agents need a new kind of observability

阅读原文