RLHF关键词检索结果

RVPO:通过方差正则化进行风险敏感调整

RVPO: Risk-Sensitive Alignment via Variance Regularization

当前无批评的 RLHF 方法通过算术平均值聚合多目标奖励,使它们容易受到约束忽略:一个目标的巨大成功可以在数字上抵消其他目标的关键失败(例如安全或格式),掩盖对于可靠的多目标对齐至关重要的低绩效“瓶颈”奖励。我们提出奖励方差策略优化(RVPO),这是一种风险敏感的框架,在优势聚合过程中惩罚奖励间的方差,将目标从“最大化总和”转变为“最大化一致性”。我们通过泰勒展开式展示......

异质偏好调整的个性化组相对策略优化

Personalized Group Relative Policy Optimization for Heterogenous Preference Alignment

尽管大型语言模型 (LLM) 具有复杂的通用功能,但它通常无法满足不同的个人偏好,因为标准的训练后方法(例如带有人类反馈的强化学习 (RLHF))会针对单一的全局目标进行优化。虽然组相对策略优化(GRPO)是一种广泛采用的同策略强化学习框架,但其基于组的归一化隐式假设所有样本都是可交换的,从而在个性化设置中继承了这一限制。这个假设将不同的用户奖励分布和......