从偏好到原则:基于量规的基础知识答案对齐

为开放域问答设计有效的奖励信号具有挑战性,因为高质量的响应必须同时满足答案质量的多个方面,而这些方面很难用整体标量目标来捕获。我们引入了一个基于评分标准的奖励框架,该框架根据检索到的证据生成特定于查询的评分标准,并分解为多个质量维度,从而在训练后提供细粒度的监督。对三个评估轴(构图、基础和遵循指令)进行平均,我们的方法改进了......

来源:Apple机器学习研究

为开放域问答设计有效的奖励信号具有挑战性,因为高质量的响应必须同时满足答案质量的多个方面,而这些方面很难用整体标量目标来捕获。我们引入了一个基于评分标准的奖励框架,该框架根据检索到的证据生成特定于查询的评分标准,并分解为多个质量维度,从而在训练后提供细粒度的监督。在三个评估轴(构图、基础和指令遵循)上进行平均,我们的方法比指令调整的基线提高了 6.5%,比平坦的标题变体提高了 4%,并且在所有评估数据集上都获得了一致的增益。根据检索到的证据调整评分标准可以提高事实支持,同时将评分标准分解为特定于质量的维度进一步提高连贯性、组织性和对查询要求的遵守。我们的结果表明,扎根的多维评分标准为复杂的开放域问答提供了更有效的奖励监督。