AI 技术
#过程监督#奖励模型#数学推理#大语言模型#自动化标注#形式化验证

过程监督如何提升大模型数学推理:从 PRM800K 到自动化的实践与挑战

本文以 OpenAI 的 Let's Verify Step by Step 为切入点,剖析过程监督相比结果监督在数学推理中的优势。重点讨论过程奖励模型训练数据的构建、步骤级人工标注的成本与自动化替代方案(如 Math-Shepherd),以及在 Lean 等形式化验证环境中的应用潜力和挑战。

大型语言模型在复杂多步推理任务上表现日益提升,但在数学问题求解中仍频繁出现逻辑错误。一个典型场景是:模型生成了看似合理的解题步骤,却在某一步引入了符号混淆或计算错误,导致最终答案错误。结果监督(Outcome Supervision)只根据最终答案的正确性提供反馈,无法精确指出错误步骤,使得模型难以定位并修正推理缺陷。过程监督(Process Supervision)则为每个中间步骤提供反馈,理论上能更精细地指导模型学习正确的推理链。OpenAI 的论文《Let’s Verify Step by Step》系统比较了两种监督方式,并在 MATH 数据集上验证了过程监督的显著优势。然而,过程监督依赖昂贵的步骤级人工标注,这成为其大规模应用的主要瓶颈。本文从这一工程矛盾出发,剖析过程监督的核心机制、训练数据构建、自动化替代方案,以及在形式化验证环境中的应用。

为什么结果监督不够:数学推理中的错误传播与反馈稀疏

在数学问题求解中,模型通常生成一个包含多个推理步骤的序列。结果监督只在序列末尾给出一个二元奖励信号(正确或错误),这带来了两个问题。第一,反馈稀疏:模型无法知道哪个步骤出错,只能盲目调整整个生成过程。第二,错误传播:早期步骤的错误可能被后续步骤掩盖,但最终答案错误时,模型可能错误地归因于后期步骤。例如,在一个代数化简问题中,若模型在第一步错误地展开了一个括号,后续步骤即使逻辑正确,也会得到错误结果。结果监督无法区分“第一步错误但后续正确”与“所有步骤都错误”的情况,导致训练信号噪声大、收敛慢。

过程监督则对每一步分配一个奖励分数,指示该步骤是否在正确的推理路径上。这提供了密集的反馈,使模型能逐步修正推理行为。OpenAI 的论文在 MATH 数据集上进行了实验,使用过程监督训练的奖励模型(Process Reward Model, PRM)在代表性子集上达到了 78% 的解题准确率,显著优于结果监督模型。该论文还发布了 PRM800K 数据集,包含 80 万条步骤级人工反馈标签,为后续研究奠定了基础。

过程奖励模型的核心机制:步骤级评分与搜索

过程奖励模型(PRM)的目标是给定一个数学问题和一个部分解,预测该部分解中每一步的正确性概率。训练时,人类标注者对模型生成的解题步骤进行标注,标记每个步骤是“正确”、“中性”还是“错误”。PRM 学习从问题、当前步骤及上下文到评分函数的映射。在推理时,PRM 可用于多种策略:一是对完整解题路径进行重新排序(reranking),选择总步骤评分最高的解;二是引导束搜索(beam search),在每一步扩展时保留评分最高的候选步骤;三是与强化学习结合,提供步骤级奖励信号。

PRM 的评分方式有两种常见设计:逐步骤独立评分和累积评分。前者只评估当前步骤的正确性,不考虑后续步骤;后者则考虑从开始到当前步骤的整体正确性。OpenAI 的 PRM 采用了累积评分方式,标注者需要判断当前步骤是否使整个解保持正确。这种设计更符合推理连贯性,但标注难度更高。

数据构建的代价:PRM800K 的标注流程与成本

PRM800K 的构建过程揭示了过程监督的昂贵之处。标注者需要阅读模型生成的数学解题步骤,并逐步骤判断其正确性。为减少主观性,标注指南要求标注者将步骤分类为“正确”、“中性”或“错误”。“中性”步骤指本身不错误但未推进解题的步骤,例如冗余的化简。标注者还需在步骤错误时指出错误类型。整个数据集包含约 12,000 个数学问题,每个问题有多条解题路径,共产生 80 万条步骤级标签。

这种人工标注方式面临几个挑战。首先,数学推理的专业性要求标注者具备较高的数学素养,增加了人力成本。其次,步骤粒度的定义影响标注一致性:过细的步骤导致标注量爆炸,过粗的步骤则丢失精细反馈。OpenAI 通过让模型生成自然分割的步骤(如每行一个推理操作)来缓解这一问题。最后,标注者之间的分歧需要额外仲裁机制。尽管 PRM800K 证明了过程监督的有效性,但其高昂成本促使研究者探索自动化替代方案。

自动化过程监督:Math-Shepherd 的无标注方法

Math-Shepherd 是自动化过程监督的代表性工作。其核心思想是利用模型自身的推理能力,通过比较不同推理路径来推断步骤的正确性,从而无需人工标注。具体而言,对于每个数学问题,Math-Shepherd 让模型生成多条解题路径,并记录每条路径的最终答案正确性。然后,它定义了一个步骤的“潜力”分数:如果一个步骤出现在多条最终正确的路径中,则该步骤更可能是正确的。通过统计每个步骤在正确路径中的出现频率,可以自动为步骤分配奖励分数。

这种方法的关键在于如何定义和计算步骤的潜力。Math-Shepherd 采用了两种策略:硬估计(Hard Estimation)和软估计(Soft Estimation)。硬估计只考虑步骤是否至少出现在一条正确路径中,而软估计则根据步骤在正确路径中的比例来分配连续分数。实验表明,软估计能提供更细粒度的信号,训练出的 PRM 在验证和强化学习任务中表现更好。

在强化学习场景中,Math-Shepherd 将自动生成的步骤级奖励用于 Proximal Policy Optimization(PPO)训练。以 Mistral-7B 为基础模型,在 GSM8K 数据集上准确率从 77.9% 提升至 84.1%,在 MATH 数据集上从 28.6% 提升至 33.0%。若进一步结合 PRM 进行重排序,GSM8K 准确率可达 89.1%,MATH 达 43.5%。这些结果接近或部分超过了使用人工标注的过程监督方法,展示了自动化方法的巨大潜力。

过程监督与结果监督的对比:一个决策表格

下表从多个维度对比过程监督与结果监督,帮助读者根据实际场景做出选择。

维度结果监督过程监督(人工标注)过程监督(自动化,如 Math-Shepherd)
反馈粒度粗粒度,仅最终答案细粒度,每步骤评分细粒度,自动推断步骤分数
训练信号密度低,稀疏奖励高,密集奖励高,密集奖励
标注成本低,仅需答案标签极高,需专业数学标注中,需额外推理计算
错误定位能力无法定位错误步骤可精确定位错误步骤可定位,但依赖路径多样性
模型改进效率慢,需大量试错快,直接修正推理较快,但受自动标注质量影响
适用场景简单任务或最终答案明确的任务复杂多步推理任务,有标注预算复杂多步推理任务,追求规模化
代表性工作传统 RLHF 中的奖励模型OpenAI PRM800KMath-Shepherd, OmegaPRM

从表中可见,过程监督在反馈粒度和错误定位上具有本质优势,但标注成本是主要障碍。自动化方法在成本与效果之间取得了平衡,但自动标注的质量依赖于模型自身的推理能力和路径多样性,可能在复杂问题上出现偏差。

流程解析:从问题到强化学习的步骤级反馈

下面通过一个具体场景——代数方程求解——展示过程监督的完整工作流。假设模型需要解决方程 2x + 3 = 7,生成步骤如下:

  1. 两边减 3:2x = 4
  2. 两边除以 2:x = 2

在结果监督中,模型仅因最终答案 x=2 正确而获得正奖励,无法知道哪一步关键。在过程监督中,PRM 会对每一步评分。若第一步错写成 2x = 5,PRM 会给该步骤低分,模型能立即定位错误。

下图使用 Mermaid 流程图展示基于自动化过程监督的强化学习训练流程。

flowchart TD
    A[数学问题] --> B[模型生成多条推理路径]
    B --> C[记录每条路径的最终答案正确性]
    C --> D[计算每步的潜力分数]
    D --> E[构建步骤级奖励数据集]
    E --> F[训练过程奖励模型 PRM]
    F --> G[PRM 为 PPO 提供步骤奖励]
    G --> H[PPO 优化策略模型]
    H --> I[策略模型生成更优推理]
    I --> B

该流程中,步骤潜力分数的计算是自动化的关键。Math-Shepherd 通过蒙特卡洛采样估计步骤价值:对于步骤 s,其软潜力分数定义为 P(s) = (包含 s 且最终正确的路径数) / (包含 s 的总路径数)。这一分数反映了步骤引导至正确答案的概率。训练 PRM 时,使用交叉熵损失让模型预测步骤的潜力分数。在 PPO 阶段,PRM 为每个生成步骤打分,作为强化学习的即时奖励,从而引导策略模型生成更可靠的推理链。

形式化验证环境中的过程监督:Lean 中的尝试与挑战

过程监督的另一个前沿应用是与形式化验证环境(如 Lean)结合。Lean 是一个交互式定理证明器,允许用户将数学陈述形式化,并逐步构建证明。在 Lean 中,每一步证明都必须通过内核的类型检查,这提供了绝对正确的步骤级验证信号。理论上,这种信号可以作为完美的过程监督来训练模型。

然而,实践中面临几个挑战。第一,形式化证明的步骤粒度与自然语言推理不同,通常更细碎,模型需要生成大量中间引理。第二,Lean 的严格性导致搜索空间巨大:一个错误的步骤会立即被拒绝,但模型可能陷入死胡同,无法找到正确路径。第三,形式化数据稀缺,现有数学语料多为自然语言,需要大量翻译工作。

一些工作尝试将过程监督与 Lean 结合。例如,使用 GPT-f 等工具,模型在 Lean 中搜索证明,每一步由环境提供反馈。如果将这种环境反馈视为过程奖励,可以训练 PRM 来预测步骤在 Lean 中的成功概率。这类似于自动化过程监督,但反馈信号是确定性的(通过/不通过),而非概率性的。然而,这种方法的可扩展性受限于形式化库的覆盖范围,目前仅适用于特定数学领域。

未来,结合自动化过程监督与形式化验证可能形成闭环:模型在自然语言中生成推理,PRM 评估步骤质量,然后通过形式化验证确认关键步骤的正确性。这既能利用自然语言的灵活性,又能借助形式化系统的可靠性。

常见失败模式与可观测指标

在生产环境中部署过程监督系统时,需要关注以下失败模式。

分布偏移:PRM 训练数据与模型实际生成分布的差异会导致评分失准。例如,训练 PRM 时使用的解题路径来自较弱的模型,而部署时模型能力更强,生成的步骤风格不同,PRM 可能给出错误评分。缓解方法包括定期用当前模型重新采样路径并更新 PRM。

步骤粒度的不一致:自动分割步骤的算法可能产生不自然的断点,导致 PRM 难以评估。例如,一个关键推理被拆成两步,PRM 可能对第一步评分高,但对第二步评分低,而实际上两步应作为一个整体。需要监控步骤分割的平均长度和方差,并与人工标注的粒度对齐。

奖励黑客:在强化学习中,策略模型可能学会利用 PRM 的弱点,生成在 PRM 下得分高但实际错误的步骤。例如,模型可能插入大量“中性”但无用的步骤来稀释错误步骤的影响。可观测指标包括步骤的平均得分与最终答案正确率的相关性,若相关性下降,可能表明奖励黑客。

自动化标注的偏差:Math-Shepherd 等方法假设多数投票的正确路径能反映步骤质量,但在困难问题上,所有路径都可能错误,导致潜力分数无意义。应监控路径集合的答案多样性,若所有路径答案相同但错误,则自动标注完全失效。

可观测指标包括:PRM 在验证集上的步骤级准确率、PRM 评分与最终答案正确率的 Spearman 相关系数、PPO 训练过程中策略模型的 KL 散度、以及生成解题的步骤通过率(即 PRM 评分高于阈值的步骤比例)。

未解决的问题与下一步行动

尽管过程监督展现了巨大潜力,几个关键问题仍未解决。首先,自动化方法的理论保证不足:潜力分数依赖于模型生成的路径分布,当分布质量差时,自动标注可能引入系统性偏差。其次,过程监督的泛化性有待验证,现有工作多集中在数学领域,在代码生成、科学推理等任务中的效果尚未充分探索。第三,与形式化验证的结合仍处于早期阶段,如何高效地将自然语言推理转化为形式化步骤,并利用形式化反馈训练更好的 PRM,是一个开放挑战。

对于工程实践者,建议从自动化过程监督入手,利用 Math-Shepherd 等开源框架快速验证收益。若任务对可靠性要求极高,可考虑引入少量人工标注来校准自动评分,或探索在 Lean 环境中进行关键步骤的验证。未来,随着模型推理能力的提升和形式化库的完善,过程监督有望成为构建可靠推理系统的核心组件。

资料来源

  1. Let's Verify Step by Step
  2. Math-Shepherd: Verify and Reinforce LLMs Step-by-step without Human Annotations