我们没有预见到的 3× 代币法案

看似无害的多代理架构迁移如何悄然使我们的 LLM 成本增加两倍,以及实际解决方案。我们没有看到的 3× 代币法案即将到来的帖子首先出现在《走向数据科学》上。

来源:走向数据科学

我正在浏览我们的代理申请仪表板,注意到上周的 LLM 使用量激增,流量与几周以来的水平完全相同。最初我们认为这是一个日志错误,但它发现了一个真正的问题。

它几乎与我们几周前发布的架构更改完全一致:我们已将管道的一部分从单代理设置转移到多代理设置。不同的代理处理任务的不同部分,通过 LangGraph 进行协调,并由主管节点决定接下来会发生什么。从纸面上看,这是一次干净利落的胜利,实现了更好的任务分解,每个智能体都做好一件事,而不是一个模型试图在一个庞大的提示中完成所有事情。您预计使用率会有所上升,每个任务的更多调用是该架构的成本,而且没有人假装不是这样。但令我们惊讶的是,对于功能上根本没有改变的任务,它大约增加了两倍。

本文内容

  • 停止工作的直觉
  • 追错嫌疑人
  • 看起来正确但还不够的修复
  • 实际效果如何
  • 一旦我们停止猜测,数字会是什么样子
  • 我仍然会重新考虑的内容
  • 如果您每个任务只运行过一次 LLM 调用,那么您的心理成本模型大致是线性的,更长的输入,更长的输出,更多的代币,更多的支出。你可以目视它并且距离足够近。

    当你引入编排的那一刻,直觉就崩溃了,而且是悄无声息地崩溃,这比大声崩溃更糟糕。主管代理现在对接下来发生的事情做出决定,而该决定本身就需要花费代币。每个子代理都带有自己的系统提示、自己的工具模式,通常还有前一个代理已经拥有的上下文副本。所有这些都不会显示为“正在完成更多工作”,从用户方面来看,任务仍然是相同的任务。它表现为更多的机器围绕着任务,而机器并不是免费的,因为它对使用该产品的人来说是不可见的。