构图关键词检索结果

从偏好到原则:基于量规的基础知识答案对齐

From Preferences to Principles: Rubric-Based Alignment for Grounded Knowledge Answers

为开放域问答设计有效的奖励信号具有挑战性,因为高质量的响应必须同时满足答案质量的多个方面,而这些方面很难用整体标量目标来捕获。我们引入了一个基于评分标准的奖励框架,该框架根据检索到的证据生成特定于查询的评分标准,并分解为多个质量维度,从而在训练后提供细粒度的监督。对三个评估轴(构图、基础和遵循指令)进行平均,我们的方法改进了......