这项由浙江大学与字节跳动联合开展的研究,以预印本形式发布于2026年7月,论文编号为arXiv:2607.18082,有兴趣深入了解的读者可以通过该编号查询完整论文。

当你向一位医生助手AI提问"这个孩子的症状最可能是什么病",你希望它给出的不只是一个空洞的猜测,而是一个有理有据、考虑周全、分析详尽的专业回答。然而,训练这样的AI,远比训练它做数学题难得多。数学题对不对,一眼就能看出来。但一份医学建议好不好,往往需要从多个维度来评判——它有没有识别关键症状?有没有推荐合适的检查手段?有没有提醒避免危险操作?这些维度,无法用一个简单的"对"或"错"来衡量。

正是为了解决这个难题,研究人员发展出了一种叫做"基于评分标准的强化学习"的训练方法,简单说就是:给AI制定一份详细的评分表,就像老师给学生打分时用的评分标准一样,每一项都有具体的考察点,然后根据这份评分表来训练AI。这个方向近几年颇受关注,但浙大与字节跳动的研究团队发现,现有的方法存在两个一直被忽视的根本性缺陷——而他们提出的解决方案,让模型训练效率提升了整整一倍。

一、评分表训练法:给AI一份"全面考卷"

要理解这项研究,先从"评分标准强化学习"说起。强化学习是一种让AI通过不断试错来进步的训练方式,就像训练一只小狗:做对了给零食,做错了不给。对于数学或编程这类有标准答案的任务,这种方法非常好用,因为答案对不对,一验证就知道。

但医疗问答、长篇写作这类开放性任务怎么办?这里没有"唯一正确答案",一个回答的质量取决于很多方面。于是研究者想到了用评分标准(英文叫Rubric)来打分:把一个好回答分解成多个具体标准,比如"是否正确识别了主要疾病"、"是否建议了影像学检查"、"是否提醒避免有创操作",每项打0分或1分,最后把所有分数汇总成一个总分,再用这个总分来训练AI。

这个思路很合理,实践中也确实有效果。然而,研究团队深入分析后,发现了两个严重的裂缝。

二、被遗忘的考题与被压制的正确答案:两种隐藏的失败

第一个裂缝,叫做"未被探索的标准"。

强化学习训练时,AI每次面对一道题,会同时生成一批回答(通常是8个),然后根据这批回答之间的相对好坏来学习。问题在于:如果这批回答中,没有一个满足某条评分标准,那这条标准就完全没有产生任何学习信号,相当于这道考题根本没被做到,AI无从知晓自己在这方面有多差、应该怎么改进。

打个比方,假设老师出了一道题考察"是否能引用具体文献支撑论点",但这个班上所有同学的作文里都没有引用任何文献,老师就算想打分也没有对比基础,这条考察点形同虚设。

研究团队统计发现,在用Qwen3-4B这个模型训练医学任务时,超过83%的训练样本都存在这种"未被探索的标准",平均每个训练样本有2.5条标准从未被任何回答满足过,而且这个问题从训练开始到结束始终存在,并不会随着训练推进自动消失。

第二个裂缝,更隐蔽,叫做"被压制的标准"。

这里需要理解一下"优势"这个概念。训练时,AI不是简单地被告知哪个回答好,而是计算每个回答相对于这一批回答平均水平的偏差,偏差为正的回答会被鼓励,偏差为负的会被压制。这个偏差值就叫做"优势"。

现在问题来了:总分是把所有标准的分数加在一起算出来的。某个回答可能在某条标准上表现很好,但在其他标准上一塌糊涂,导致总分很低,总体优势为负。在这种情况下,AI产生的"满足那条好标准的行为",反而会因为整体优势是负数而被惩罚——AI在学习过程中被告知"这种写法是错的,下次别这么写",但其实那个"写法"明明是对的,只是周围环境太差拖累了它。

更具体地说,假设一批8个回答里,只有2个满足了"建议腹部X光检查"这条标准,但这2个回答在其他方面表现很差,总分低于平均,优势是负数。那么AI不但学不到"应该建议腹部X光",反而学到了"别建议腹部X光"——完全颠倒的学习信号。

统计数据相当触目惊心:超过57%的训练样本存在这种"被压制的标准",平均每个样本有1.8条标准遭受压制,而且整个训练过程中这个比例始终高居不下。

这两个问题加在一起,意味着训练时大量有用的学习信号被白白浪费掉了,AI训练的效率极为低下。

三、现有解决方案的阿喀琉斯之踵

既然"未被探索的标准"是个问题,有没有人尝试解决过?有的。已有的一些方法会把评分标准作为额外提示直接写进AI生成回答时的输入里,相当于考试时把考察要点告诉学生,从而引导AI生成更能满足各条标准的回答。

这个思路能部分解决第一个问题,但它引入了一个新的麻烦:训练时AI是在"看着答题提示"生成回答的,但实际使用时用户不会也不该把这些提示告诉AI。这就造成了"训练时的环境"和"实际使用时的环境"不一致——专业术语叫"训练推理不匹配",通俗说就是"考场作弊练出来的能力,真正上考场却用不上"。

而且,这类方法完全没有处理第二个问题——被压制的标准。

四、CriPO:自己当自己的辅导老师

面对这两个问题,研究团队提出了一个叫做"基于标准的蒸馏策略优化"(CriPO,Criterion-Distilled Policy Optimization)的方法。它的核心哲学是:不要靠外部提示来引导AI生成更好的回答,而是让AI自己扮演自己的辅导老师,在原有回答的基础上,有针对性地给自己提供纠正信号。

CriPO的底层机制叫做"在线自我蒸馏",可以理解成这样一个过程:同一个AI模型,以两种不同的"模式"运行。一种是正常的学生模式,不知道评分标准,就像普通考试;另一种是辅导老师模式,知道哪些地方做得不够好,可以有针对性地修改。然后,学生模式的AI通过模仿辅导老师模式的AI,把额外的知识"蒸馏"进来。

关键在于:辅导老师模式虽然掌握了更多信息,但它作用的对象是学生模式已经生成的回答,而不是重新生成一个全新的回答。这样,训练时的分布和实际使用时的分布保持一致,彻底消除了"训练推理不匹配"的问题。

值得一提的是,研究团队最初尝试单独使用自我蒸馏来训练AI,但结果不好:无论用哪种变体的蒸馏方式,模型的表现都明显下降。究其原因,是蒸馏信号过于嘈杂,缺乏稳定的基础。于是他们决定保留原来的强化学习框架(GRPO)作为稳定的主干,把自我蒸馏作为一个辅助模块叠加上去,两者各司其职,互相补充。

五、针对"未探索标准"的行为注入机制

CriPO解决第一个问题的方式,叫做"行为注入"。

每当发现某条评分标准在这一批回答中从未被满足,CriPO就会构建一个特殊的"标准注入辅导老师"。这个老师会拿到这批回答里表现最好的那个,然后在此基础上,专门针对那些从未被满足的标准,做最小幅度的修改——就像老师拿着一个接近满分的作文,告诉学生"你只差这一点点没提到,稍微加几句话就好了"。

为什么要选最好的那个回答?因为它已经满足了大部分标准,老师只需要做很小的修改就能覆盖剩余的标准,产生的修改建议更精准、更可靠,而不是在一个到处是错误的回答上做大规模改动,引入太多噪音。

老师修改完之后,CriPO在逐个词的层面上比较老师版本和原始版本的差异:老师在哪些词的位置改变了预测,哪些地方没动?只有那些差异显著的位置,才被认为是真正承载了"缺失标准相关信息"的关键位置,需要让学生模式的AI向老师学习。

这里有一个精妙的设计:实验发现,在一篇回答里,其实只有大约34.6%的词位置贡献了95%的差异量,其余65.4%的位置改变微乎其微,不是真正的修改,而是因为提示词变化引起的"无意义扰动"。于是CriPO只对那些差异贡献超过阈值的位置施加学习信号,过滤掉噪音,让学习更精准。

技术上,这个学习信号采用的是"正向KL散度"。简单理解,就是要求学生模式在那些关键位置,把老师更倾向的词的概率提上来,从而把"老师版本的行为"吸收进自己的生成偏好里。

六、针对"被压制标准"的优势翻转机制

CriPO解决第二个问题的方式,叫做"优势翻转"。

当一批回答里有某几个回答总体优势为负,但其中满足了某条被压制标准,CriPO会构建另一种"反事实辅导老师"。这位老师的任务相反:专门对原始回答进行修改,把那条被满足的标准对应的内容删掉或改掉,使修改后的版本不再满足这条标准,而其余内容尽量保持不变。

把原始版本和这个"删除版本"一比较,就能找到哪些词位置是专门用于表达这条被压制标准的。具体来说,如果某个词在原始版本中出现的概率比在删除版本中高很多,并且删除版本在那个位置明显更倾向于其他词,那这个词就被认定为"承载了被压制标准的关键词"。

找到这些关键词之后,CriPO做了一个看似简单却效果显著的操作:把这些词位置上的优势值,从负数直接翻转成一个小的正数(默认设为0.1)。这样,原本整体"应该被惩罚"的回答,在这几个特定词上反而变成了"应该被鼓励",精准地保留了有用的行为,而其余有问题的部分仍然受到正常的惩罚。

整体优化目标就是两部分之和:常规强化学习损失(用翻转后的优势值计算)加上行为注入的辅助蒸馏损失,两者按照一个可调节的系数平衡,共同引导AI向更好的方向进步。

七、实验结果:效率翻倍,跨域泛化

研究团队在医学问答和科学问答两个领域做了系统测试,使用Qwen3-1.7B和Qwen3-4B两个不同大小的模型,对比了标准GRPO、HeRL(一种已有的探索增强方法)、OPSD(单独使用自我蒸馏)以及CriPO的多个变体。

结果相当清晰。在Qwen3-1.7B上,标准GRPO训练完后平均分为59.2,而CriPO达到了62.4,提升了3.2分。在Qwen3-4B上,GRPO为68.2,CriPO达到69.6,提升1.4分。单独使用自我蒸馏的OPSD方法则灾难性地崩溃了,在各个数据集上的表现远低于原始模型,印证了自我蒸馏不能单独使用的判断。

CriPO的两个组件分别发挥了各自的作用。只处理未探索标准的CriPO-U版本,在降低未探索标准比例方面效果最显著;只处理被压制标准的CriPO-S版本,在减少被压制标准数量上更胜一筹。完整的CriPO综合了两者优势,在平均表现上最为稳定和出色,这说明两类失败模式是互补的,解决方案也需要互相配合。

最引人注目的是训练效率数据。研究团队仔细对比了收敛曲线,发现CriPO大约在第175步就达到了GRPO充分训练后的最高水平,而GRPO需要完整训练200步才能达到同样水平——换句话说,CriPO只用了大约一半的步骤就赶上甚至超过了标准方法的终点。从实际用机时间来看,即便算上CriPO每步额外的计算开销(毕竟要构建辅导老师、计算额外的散度),CriPO完成训练的总时间依然显著短于GRPO完成同等步数的时间。

研究团队还额外测试了CriPO是否会在医学和科学领域之外产生"副作用",用指令跟随类基准测试评估了模型的通用能力,发现CriPO训练后的模型与原始模型表现基本持平,说明这种定向纠正并没有破坏模型的其他能力。

八、训练过程的深层观察

除了最终分数,研究团队还观察了训练过程中的几个有趣现象。

从奖励曲线看,CriPO在整个训练过程中的奖励都高于GRPO,而且爬升更快、更稳。从熵(可以理解为模型探索多样性的指标,熵越高说明模型在尝试更多不同的回答方式)来看,CriPO训练的模型始终保持比GRPO更高的熵,尤其是带有行为注入的CriPO-U版本,熵的提升最为明显——这直接验证了行为注入确实在帮助AI探索它原本不会主动生成的内容。

从回答长度来看,带有优势翻转的CriPO-S版本训练出的模型回答明显更长,研究团队进一步分析发现,这些更长的回答并非无意义的废话填充,而是包含了更深入的推理过程和对更多评分标准的覆盖,是质量真正提升的体现。

通过具体案例可以直观感受到差别:面对一道关于早产儿血便的医学问题,GRPO训练的模型选择了"内镜检查"这个错误答案,虽然偶尔提到了腹部X光,但没有将患儿的早产史、腹胀、血便和呼吸需氧量增加联系起来,只满足了识别相关症状这一项标准。CriPO训练的模型则系统性地识别出极早产带来的坏死性小肠结肠炎风险,解释了为何腹部X光系列检查是快速、无创的首选方案,并明确说明了为何内镜不适合作为早产儿的首要检查,同时满足了五项评分标准,给出了正确答案。

九、消融实验:每个设计都有其用意

研究团队还专门做了消融实验,去掉某个设计细节,看看分数如何变化,来验证每个设计选择是否真的有必要。

对于行为注入模块,去掉"只选最高优势回答进行注入"这一设计,分数从66.4降到65.6;去掉"只对差异最大的词位置进行学习"这一设计,分数降到65.5。两者都造成了明显下降,说明这两个设计选择都是有效的,而不是可有可无的装饰。

对于优势翻转模块,最关键的验证是:如果不是精准定位到承载被压制标准的词,而是随机选取同样数量的词来翻转优势,会怎样?结果从68.9大幅下降到64.9,跌幅远大于行为注入部分的消融。这个结果有力地说明,CriPO-S的效果不是来自于"给某些词更高的优势"这件事本身,而是必须要精准地找对那些承载了有用信息的词,才能真正发挥作用。

说到底,这项研究揭示的核心洞察其实很朴素:当我们用一张评分表来训练AI时,光有评分表是不够的,我们还要想清楚那张评分表里有多少题目根本没有被做到过,以及有多少正确的部分因为整体拖累而被错误地惩罚掉了。这两个问题在训练全程普遍存在,却长期隐藏在总分这个数字背后不为人察。CriPO的贡献,在于把这两个问题明确定义出来,并用一种不引入副作用的方式系统性地加以解决。

对于普通用户而言,这项研究意味着,未来面向医疗问答、长篇写作等需要多维度质量判断的AI助手,可以在更少的训练成本下达到更高的质量,对答案的覆盖面更全、对关键细节的关注更到位。这是一个不那么显眼但扎扎实实的进步。

如果你好奇背后更多的技术细节,可以通过arXiv编号2607.18082找到完整论文,作者团队来自浙江大学与字节跳动,论文发布于2026年7月。

Q&A

Q1:CriPO方法中的"被压制的标准"是什么意思,为什么会出现这个问题?

A:被压制的标准是指某些评分标准虽然被某个回答满足了,但由于总分低于平均水平,这个回答的整体优势是负数,导致AI反而因为满足了这条标准而受到惩罚。问题根源在于训练时把所有标准的得分加总成一个数字,好的局部行为会被整体糟糕的表现所掩盖,训练信号被扭曲了。

Q2:CriPO方法和已有的HeRL方法有什么本质区别?

A:HeRL把评分标准直接写进生成回答时的提示词里,训练时AI是"看着提示"生成的,但实际使用时没有这个提示,造成训练和使用时环境不一致的问题。CriPO则是让AI先正常生成回答,再用"辅导老师模式"在已有回答上提供纠正信号,训练和使用时AI的生成环境完全相同,不存在这个不一致问题。

Q3:基于评分标准的强化学习适合用在哪些类型的AI任务上?

A:这类方法主要适合那些没有唯一标准答案、质量需要从多个维度来衡量的开放性任务,比如医学问答、科学问答、长篇写作、法律分析等。对于数学题或编程这类有确定答案的任务,直接验证答案是否正确就够了,不太需要用评分标准这种方式。