详细内容或原文请订阅后点击阅览
代理开发的适量规范
我在有关代理的对话中不断看到同样的想法:详细的规格现在已经是旧世界的开销了。给模型一个粗略的目标,让它探索,修复返回的结果,然后继续前进。听起来很有效率,但也隐藏了成本。一个简单的提示看起来便宜且诱人,因为它可以立即开始实施。然后[...]
来源:O'Reilly Media _AI & ML我在有关代理的对话中不断看到同样的想法:详细的规格现在已经是旧世界的开销了。给模型一个粗略的目标,让它探索,修复返回的结果,然后继续前进。听起来很有效率,但也隐藏了成本。
一个简单的提示看起来廉价且诱人,因为它可以立即开始实施。然后校正循环开始。您检查输出、澄清意图、要求更改、重新运行测试、找到下一个差距,然后再做一次。仍然需要有人来决定结果是否符合真正的目标。那个人就成为了神谕者。
在另一个极端,完整的正式规范显然前期成本高昂。编写验收标准、契约测试或行为驱动开发 (BDD) 场景需要付出真正的努力。但下游成本不同,因为更多的预言机是可执行的。测试每次都会检查相同的条件。午餐前五分钟不会感到疲倦、匆忙或乐观。
这就是实际的权衡。问题不在于规范是好是坏。这是总成本最低的地方。对于大多数代理工作来说,它处于中间位置:足够的结构来约束工作,足够的示例来使意图具体化,以及足够的可执行检查以确保审查不会变成猜测。
零规格不是智能和精益;这只是昂贵的振动编码。
瓶颈移动了,但没有消失
软件工程从来都不是主要是打字甚至是生成代码。这是关于决定什么应该存在,什么不应该发生,哪些权衡重要,以及一旦问题触及现实世界“完成”意味着什么。
多年来,团队通过人为摩擦发现了规范缺失。审阅者注意到了一个边缘情况,QA 发现了没有人描述过的路径,一位高级工程师脑子里记着一半的真实需求,并一次在一次会议上翻译它们。这些都不是优雅的,但它确实迫使模棱两可的事情公开化。
编写规范是不够的
规范本身需要审查。
