Apple 机器学习 2小时前 · 2026-08-31 13:37:33 · 0 阅读
从偏好到原则:基于评分标准的开放域问答对齐方法
作者Aman Saini、Priyanshu Kumar、Eric Peng、Kai Yuan、Harsh Girase、Wanming Chen
为开放域问答设计有效的奖励信号颇具挑战,因为高质量的回答需要同时满足多个质量维度,而单一的标量目标难以兼顾。我们提出一种基于评分标准的奖励框架:针对每个查询生成以检索证据为依据的评分标准,并将其拆解为多个质量维度,从而在后续训练阶段提供细粒度的监督信号。在三个评估维度(写作质量、事实依据、指令遵循)上的平均结果显示,我们的方法相比指令微调基线提升了 6.5%,相比扁平化评分标准变体提升了 4%,且在所有评估数据集上均取得稳定提升。评分标准依托检索证据进行条件化,有助于增强事实支撑;将其拆解为不同质量维度,则进一步提升了回答的连贯性、组织结构以及对查询要求的遵循程度。实验结果表明,以证据为依据、多维度的评分标准能为复杂开放域问答提供更有效的奖励监督。
原始来源: Apple 机器学习