详细内容或原文请订阅后点击阅览
为 API 调用代理生成无环境的综合数据
训练调用 API 的大型语言模型 (LLM) 代理需要大量高质量的轨迹。然而,大规模收集此类数据通常需要具有可执行 API 和现实的、预先填充的后端数据库的完全实施的环境,从而造成可扩展性的主要瓶颈。为了克服这个问题,我们提出了一种无环境的合成数据生成方法,利用法学硕士作为动态数字世界模型。仅给定 API 规范,我们的方法就会生成模仿代理和有状态环境之间交互的轨迹。具体来说......
来源:Apple机器学习研究训练调用 API 的大型语言模型 (LLM) 代理需要大量高质量的轨迹。然而,大规模收集此类数据通常需要具有可执行 API 和现实的、预先填充的后端数据库的完全实施的环境,从而造成可扩展性的主要瓶颈。为了克服这个问题,我们提出了一种无环境的合成数据生成方法,利用法学硕士作为动态数字世界模型。仅给定 API 规范,我们的方法就会生成模仿代理和有状态环境之间交互的轨迹。具体来说,法学硕士首先生成可使用提供的 API 解决的各种任务。然后,教师代理迭代地解决每个任务,同时 LLM 模拟器根据任务上下文和模拟历史生成一致的合成 API 响应。最后,法学硕士法官过滤轨迹以确保结果数据集的质量。我们在具有挑战性的 AppWorld 和 OfficeBench 基准上评估我们的方法,其中包括信息检索和状态更改任务。对我们的合成数据进行微调模型可以显着提高性能,这表明可以在没有任何可执行环境的情况下生成对 API 调用代理的有效监督。我们的结果将基于 LLM 的 API 模拟确立为一种实用的、可扩展的解决方案,用于跨不同 API 生态系统培训代理。
