AgentOps 不是 MLOps:当代理投入生产时,监控堆栈会出现哪些问题

代理程序破坏了五个 MLOps 监控假设,哪些继承的信号现在将失败的运行视为正常运行。AgentOps 不是 MLOps:当代理程序投入生产时,监控堆栈中发生的问题首先出现在 Towards Data Science 上。

来源:走向数据科学

多年来,保持模型在生产中保持健康意味着使其与您交付的模型保持接近。您可以通过参考窗口观察漂移。您可以根据 SLO 跟踪延迟。您根据坚持检查准确性。一些动作,你重新训练。

一旦模型开始调用工具,它就停止工作。

业界反应很快。 Gartner 预计,到 2027 年底,超过 40% 的代理人工智能项目将被取消,理由是成本不断上升、价值不明确以及风险控制不足。每个可观察性供应商现在都提供代理跟踪。

未经审查的是团队实际如何进行迁移。大多数人将其作为补充来运行:新的跨度位于旧堆栈的顶部;没有任何结果。继承的信号仍然会发出,并且现在有一些信号在失败的运行中报告健康。

我从运行的多步骤审核管道中了解到这一点,该管道分散到并行模型审核者并将他们的结论写入应用程序数据存储中。它发出的第一个错误判决有一个完全绿色的痕迹:每个跨度都成功,延迟正常,输出错误。

通过添加进行迁移:无人审核的部分

添加的内容是真正的进步。 OpenTelemetry 的 GenAI 语义约定现在定义代理范围:create_agent、invoke_agent、execute_tool 和 plan。该规范仍然具有开发状态,在对其进行标准化之前值得了解。

Langfuse、LangSmith、Arize Phoenix、W&B Weave 和 AgentOps 都发出它的某个版本,因此您可以获得运行的瀑布图:触发了哪个工具、返回了什么、花费了多少。

从未被重新检查的部分是下面的所有内容。漂移监视器继续运行。再训练触发器保持旧的阈值不变。并且警报从未超越单一边界。这些组件对适用于无状态评分服务的假设进行编码,并停止适用于运行循环的系统。

五个假设最重要:

运行期间的输出具有可比性。相同的输入,大致相同的输出,因此差异意味着某些东西。

假设

对其进行编码的信号