如何提升大型语言模型的质量?认识PIT:一种隐式自我改善框架

提升大型语言模型质量的方法:认识PIT,一种隐式自我改善框架

基于大的语言模型(Large Language Models,简称LLMs)在数学推理、摘要、对话、架构归纳和领域特定问题解决等各种复杂任务中取得了最先进的成果。LLMs 的成功取决于它们遵循指令并与人类偏好相一致的能力。然而,它们也存在一些局限性,可能会产生错误信息、推理错误或无用的内容。

为了提升 LLMs 的性能,人们提出了各种方法,越来越关注让LLMs自我提升其响应质量。提升LLMs性能的传统方法通常需要通过人工注释来收集更多多样化和高质量的训练数据,该过程代价高昂,尤其对于专业领域而言。基于提示的方法因其效果、效率和便捷性而受到青睐,但此类方法通常需要详细的评分标准作为输入,对于复杂的改进目标来说,这可能具有挑战性和高成本。

为了解决这个问题,来自伊利诺伊大学厄巴纳-尚佩恩分校和谷歌的研究人员提出了“隐式自我提升(PIT)框架”,该框架允许LLMs通过人类偏好数据学习改进目标,无需明确的评分标准。PIT利用偏好数据训练奖励模型,消除了额外的人力和数据收集需求。PIT的核心思想是从人类反馈(RLHF)的强化学习训练目标重新制定培训目标。PIT的目标不是为给定输入最大化响应质量,而是最大化响应与参考响应之间的质量差距,更接近人类偏好。

研究人员对真实世界和合成数据集进行了实验,评估了PIT与基于提示的方法的性能。实验结果表明,PIT在改善响应质量方面明显优于提示策略。

PIT通过重新制定RLHF培训目标,重点在模型和参考响应之间缩小质量差距。这种方法使PIT能够在没有明确的评分标准的情况下迭代改进响应。对真实数据集和合成数据的实验证明了PIT相对于提示方法的优越性,突显了它在提升LLMs响应质量方面的有效性。

PIT在自我改进中优于依赖提示的Self-Refine方法。尽管改进程度根据评估方法(如人工评估、第三方语言模型、奖励模型)而异,但PIT在实验中始终表现更好。

该研究还探讨了温度设置对自我改进方法的影响,指出PIT在低温下取得更好的结果,而Self-Refine则更适合高温。此外,研究还调查了课程强化学习和改进迭代次数的重要性,并强调在实际应用中需要仔细考虑停止条件。

总之,隐式自我提升(PIT)框架为提升大型语言模型的性能提供了一个有希望的途径。通过从人类偏好数据中学习改进目标,PIT解决了传统提示方法的局限性,并展示了在各种数据集和条件下提升LLMs响应质量的有效性。