详细内容或原文请订阅后点击阅览
Agent Seer:从规范理解中综合场景
评估使用外部工具的 AI 代理需要真实的测试场景,以捕获从业者如何组合工具并迭代对话轮次。手动构建此类场景需要深厚的领域专业知识,无法跨工具生态系统扩展,并且生成无法跟踪不断发展的 API 的静态基准。我们观察到工具规范(函数名称、自然语言描述和类型化参数模式)已经编码了足够的语义信息,可以合成真实的评估场景,而无需手动管理或实时工具执行。先知特工…
来源:Apple机器学习研究评估使用外部工具的 AI 代理需要真实的测试场景,以捕获从业者如何组合工具并迭代对话轮次。手动构建此类场景需要深厚的领域专业知识,无法跨工具生态系统扩展,并且生成无法跟踪不断发展的 API 的静态基准。我们观察到工具规范(函数名称、自然语言描述和类型化参数模式)已经编码了足够的语义信息,可以合成真实的评估场景,而无需手动管理或实时工具执行。 Agent Seer 构建了这些潜在信息:来自单个模型上下文协议 (MCP) 规范,没有示例,没有实时工具访问,也没有特定于域的调整。该管道丰富了原始模式,使用合成工具输出生成分级场景,并将其扩展为基于模拟数据的多轮对话,这些对话表现出强大的工具调用正确性和对话连贯性。通过将该管道应用于跨越不同领域和工具套件大小的七个 MCP 规范,并测量工具调用的正确性和对话连贯性来衡量评估质量。该管道在所有领域都实现了强大的质量,并具有对中小型规格的完整工具覆盖。此分析得出两个结果:参数模式复杂性是质量变化的最强相关性(工具套件大小起着较小的正交作用),参数值准确性是不完美场景中的主要故障模式,是粗粒度名称匹配指标不可见的子维度。
