咨询服务热线:400-099-8848
门锁在进口,房间里都开着:强化学习把AI的解题思路收窄到了哪里 |
| 发布时间:2026-09-29 文章来源:本站 浏览次数:18 |
你或许没意识到这件事有多反直觉。 一个通过强化学习练习的AI模型,单次做题的正确率能进步五十多倍,但是让它多做几回同一道题,它给出的解法却越来越单一。你会觉得,模型变强了,应该是越来越会举一反三才对,怎么反而变得像个只会一种套路的偏科生? 这正是这篇论文要挖的坑。研究者们盯上了一个叫Countdown的数字游戏,用几个整数通过加减乘除凑出方针数字。这个游戏有个特其他好处:它的一切正确解法都能被穷举出来。你不需求靠猜、靠采样去估量模型究竟掉了多少种解法,而是能够像查户口相同,把每一种或许的解法列个清单,再对照模型实践生成了哪些。 这种可穷举性,让研究者能做一件之前没人做成的事:准确定位AI在解题的哪一步走丢了。 **门口的挑选,仍是路上的失误** 先说清楚这篇论文想搞了解的中心对立。 **强化学习与可验证奖赏**(RLVR,Reinforcement Learning with Verifiable Rewards):一种练习方法,让AI模型重复测验解题,只需答案被验证为正确才给奖赏,通过这种试错让模型越来越拿手得到正确答案。 这套办法现在是练习AI做数学题、编程题的干流路子。DeepSeek-R1、Qwen系列的强推理模型,背面都有它的身影。但同时,业界也在用另一套兵器进步AI的体现:让AI对同一道题生成很多个答案,再从里边挑一个好的,或许投票选出多人赞成的答案。这套兵器有个姓名。 **测验时扩展**(test-time scaling):不改变模型自身,而是在回答问题时让它多想几遍、多算几回,靠"屡次测验"交换更高的正确率,比较常见的做法包括重复采样、自洽性投票、树搜索等。 这两套兵器本该是互补的,但论文发现它们其实在打架。RLVR越训,模型的解法越单一,那测验时扩展的"屡次测验"就越没意义,由于屡次测验出来的答案都长得差不多,等于白费功夫。 问题是,没人说得清这种解法收窄究竟发生在哪个环节。是模型压根不知道还有其他路能够走,一开端就没往那个方向迈出第一步?仍是它迈出了第一步,走到半途却算错了,没能走到结尾? 这两种状况天差地别。前者是"没进门",后者是"进门以后在屋里走失了"。假如是前者,那你得想办法让模型愿意去开那扇门;假如是后者,那你得帮它把屋里的路走顺。混着谈,只会开错药方。 论文用一个精巧的比喻式框架来拆解这个问题,他们把这道题的"进口"定义为一个详细的概念。 **进口宗族**(entrance family):在Countdown游戏里,一道题的正确解法能够依照它"第一步用的数字和运算符号"分组,比方面临{4,5,7,9}凑24,"用4乘以某个数初"便是一个进口宗族,这个宗族下面还或许分出"4乘7"和"4乘9"两条不同的后续途径。 打个比方,假如把解一道数学题幻想成走进一栋大楼找瑰宝,那么进口宗族便是大楼的每一个门。瑰宝藏在楼里的很多个房间,每个房间对应一种详细解法,而每个房间的进口都归归于某一扇大门。研究者想搞清楚的是:AI练习之后,是它压根不推开某些门(access,进入门槛),仍是它推开了门,进了房间以后却在里边转晕了找不到瑰宝(execution,履行才能)? **准确率涨了五十倍,解法却掉了三分之二** 研究者先用两套彻底独立的强化学习流程各跑了一遍,一套是自己用PPO算法练习Qwen2.5-3B模型,另一套是拿开源的用GRPO算法练习出来的Qwen2.5-3B-Instruct模型系列。两套流程用的算法不同、模型底座也有差异,假如两边都呈现相同的现象,那阐明这不是某个算法的特有毛病,而是RLVR练习这件事自身自带的副作用。 **PPO**(Proximal Policy Optimization,近端战略优化)和**GRPO**(Group Relative Policy Optimization,组相对战略优化):都是强化学习里常用的练习算法,简略说便是让模型在测验解题的进程中,依据体现好坏调整自己"生成答案"这个行为的概率分布,GRPO是近两年在大模型推理练习里流行起来的一种改善版别。 成果十分扎眼。PPO练习的模型,从50步训到275步,单次做对的概率(pass@1)涨了五十多倍,但假如把它在同一批测验题上生成320次答案,统计一下这些答案覆盖了整个正确解法空间的多大份额(论文管这个叫solution coverage,解法覆盖率),这个数字从0.337掉到了0.111,足足跌了67%。GRPO那套开源模型也相同,准确率翻了三倍多,解法覆盖率却掉了43%。 更扎心的是,研究者专门挑出那些"练习前后都能解出来"的标题做对照,排除掉"模型仅仅变笨了不会做这道题"这种混杂要素。在这批标题里,前期checkpoint找到的正确解法,只需31%在后期还能被模型从头生成出来。覆盖率从0.564掉到0.286,并且没有一道题是前期做不出来、后期反而学会了新解法的。 这阐明什么?这阐明RLVR练习并没有让模型学会更多解题思路,而是把它原本会的那些路子,狠狠地紧缩到了一条独木桥上。 那这种紧缩,是均匀发生在解题全程,仍是集中在某个环节?研究者依照不同的分类方法切开正确答案集合,发现越靠近"第一步挑选"的分类维度,覆盖率掉得越狠。粗粒度的"运算符类别"覆盖率掉了一半,细粒度的"第一步详细是哪两个数字先运算"这个维度,覆盖率直接掉到只剩三分之一。这个信号现已很显着了:问题出在开局,不是出在中盘。 **用"教师强制"给模型的每个词打分,发现门口的概率陷落得狠** 要准确锁定问题出在哪一步,研究者用了一个技巧,叫**教师强制**(teacher forcing):给模型一段现已写好的、正确的解题进程,让它逐词去"打分",看它给这段文字里每一个词分配的概率是多少,而不是让它自己生成。 这个办法的好处是,它不需求模型自己独立答对题,仅仅评估模型有多"认可"一条给定的正确途径。研究者把这些正确途径,依照"进入第一次运算之前"和"进入第一次运算之后"切成两段,别离看练习前后模型对这两段文字的概率打分改变多大。 成果是,在"进入第一次运算之前"这一段,每个词的负对数似然(能够了解成模型对这个词的"意外程度")在练习前后差了4.50,而在运算开端之后的履行阶段,这个差值只需0.28,前者是后者的16倍。GRPO那套模型上做相同的试验,倍数是11倍。 假如把模型生成答案的进程幻想成开车走一条路,教师强制打分就像是让司机从头走一遍地图上标好的道路,看他在每个路口犹疑了多久。研究者发现,司机在"要不要拐进这条巷子"的路口犹疑得特别久,概率大幅下降,一旦真的拐进巷子之后,他走巷子里剩下的路反而走得很顺,速度没什么改变。这阐明司机不是不会走巷子里的路,是他压根不太想拐进去了。 那假如强行把司机塞进巷子口呢?研究者做了这个试验,给模型一个极简的提示,只写出正确解法应该用哪个数字、哪个运算符初,类似"让我试试:4 乘",后边彻底不给任何提示。成果在PPO的晚期checkpoint上,这种"进口提示"让模型在指定宗族里完结正确解法的概率,从自在生成时的0.018,直接跳到0.212,进步了十倍多,作用简直等同于把整个第一步运算都直接告诉它。GRPO那边也复现了相同的现象,从0.104涨到0.188。 这就比方一个人原本会做某道菜,但由于很久没做过,现已不记得从哪一步下锅了。你只需求提示他"先把油倒进锅里",他立刻就能接着把整道菜做完,并且做得又快又好。他缺的不是手工,是那个初的提示。假如你不给这个提示,他就宁愿一直做他近重复练熟的那道菜,哪怕食材摆在眼前,他也想不起另一道菜该怎么起锅。 更绝的一个试验是,研究者把这种极简提示直接嫁接进模型自己现已失败的答题进程里,也便是说,让模型先按自己的方法测验、失败,然后在它卡壳的当地插入一句"进口提示",接着让它继续往下写。这种状况下,完结正确解法的概率是0.176,而不给任何提示、朴实让它自己重试的对照组,概率只需0.044。这阐明,即便是在模型自己走出来的、现已出错的思想轨道里,那扇被锁住的门仍然能被一句悄悄的提示从头翻开。 研究者还专门挑出28个"在前期checkpoint呈现过,但在后期320次自在采样里一次都没呈现"的进口宗族。给这些简直绝迹的宗族一个极简进口提示,后期模型完结它们的概率是0.529,乃至比前期checkpoint自己的体现(0.475)还高。换句话说,这些途径没有被忘记,仅仅没人去敲那扇门了,一旦有人敲,它照样能开。 **表面上换个说法没用,真实管用的是往模型里"注入"前期的回忆** 已然问题定位在进口,那么合乎逻辑的下一步便是:干涉手法应该瞄准进口,而不是瞄准答案的表面形式。 研究者先试了几种表面功夫。直接在提示词里要求模型"换一种办法解题",这种**提示工程**(prompt engineering,通过调整输入给模型的文字描述来影响输出成果)简直没用,解法覆盖率只涨了0.014。强行指定一个不同的初运算符,但不给详细的数字状况,也没用,覆盖率反而掉了0.007。进步生成时的**温度参数**(temperature,操控模型生成文字时随机性大小的一个数值,越高越"敢"挑选低概率的词)的确能让覆盖率涨一点,但代价是单次答对的概率跌了,从0.278掉到0.264,这归于拿准确率去换多样性,不是真实的解决办法。 真实有效的,是直接在模型内部"掺"一点前期checkpoint的信息进去。研究者试了一种叫**层插值**(layer interpolation)的手法,把练习后期模型第20到28层的参数,和练习前期第50步checkpoint的对应参数各取一半、线性混合起来,其他层保持后期的参数不变。这一招把解法覆盖率从0.111进步到0.152,进步了37%,并且单次答对的准确率不光没降,反而涨到了0.305。 这就像给一个人做回忆修复手术,不是把他整个人换回早年,而是只挖出大脑里"决议往哪走"的那一小块区域,注入年青时候还没被磨平棱角的回忆,其他部分,比方手上的技艺、算术才能,一点没动。这样他既保存了练习后学到的熟练操作,又找回了当年愿意测验不同道路的勇气。 假如不做这种精准的层级混合,而是简略粗暴地把整个模型换成前期版别,或许只在答案文字部分做混合,作用都很有限,乃至会连累准确率。这阐明起作用的关键,恰恰是"混合的位置对不对",而不是"混合的份额大不大"。 还有一种更省事的办法,是在测验的时候,不依赖模型自己去探究,而是人为地把采样次数平摊到每一个已知可行的进口宗族上,强制模型对每个或许的初都试一试。这在前期checkpoint上没有显着优势,由于那时模型自身探究得就够广,可一到晚期checkpoint,这种"强制分配"就立刻显现出价值,覆盖率进步了0.077,涉及的进口宗族数量多探究了0.430个。这恰好印证了理论预测:只需当模型自身的探究意愿现已陷落之后,外部强制分配才真实有用武之地。 **这事在更大的模型、更杂乱的标题上相同发生** Countdown游戏毕竟是个人为简化的场景,标题简略、解法能穷举。研究者接下来要验证的问题是,这套"进口收窄"的现象,会不会仅仅Countdown这个小试验室里的特例。 他们在GSM8K、MATH500、Minerva Math、OlympiadBench、AMC23、AIME24这六个规范数学基准测验上,用7B和14B规划的Qwen2.5模型做对照试验。由于这些标题的正确解法无法像Countdown那样穷举列出来,研究者改用了一个**结构署理目标**(structural proxy):已然无法直接数有多少种正确解法,那就去看模型给出的"第一步核算"究竟有多少种不同的形式,以此近似衡量开局的多样性。 成果和Countdown高度一致。通过SimpleRL(一种RLVR练习办法)练习之后,7B模型的准确率涨了13%,14B模型涨了17%,但是"第一步核算"的多样性(用信息熵衡量)别离掉了30%和41%,不同解题轨道的份额简直折半。研究者还专门做了一个更精细的验证,把练习前后的模型放在同一条参阅解法上打分,发现"第一步核算之前"的概率变动起伏,一直比"核算之后的履行阶段"大得多,这个现象在六个基准测验上无一例外。 有个详细的比方特别能阐明问题。GSM8K数据集里有一道题,讲亨利想烤比去年多一倍的饼干,成果多烤了15个,又摔碎了5个,终究剩110个,问去年烤了多少个。这道题存在至少三种解法思路:一种是从终究成果倒推回去(110加5减15再除以2),一种是列代数方程正向求解(设未知数x,列出2x加15减5等于110),还有一种是简化的净改变关系式。 根底模型Qwen-7B在64次采样里,10次用了倒推法,其他用了代数法,两条路都活着。通过直接RLVR练习之后的SimpleRL模型,64次采样里倒推法从10次直接变成0次,53次悉数挤到了代数法这一条路上,门被彻底焊死了。 但这不是必定的命运。OLMo-3这个模型系列走的是另一条练习道路,先做**监督微调**(SFT,Supervised Fine-Tuning,用人工标注的正确答案直接教模型模仿),再做**直接偏好优化**(DPO,Direct Preference Optimization,让模型学习"哪个答案更好"的相对偏好),终究才上RLVR。这个分阶段的流水线,在同一道饼干题上,SFT阶段倒推法呈现1次,DPO阶段呈现8次,RLVR阶段呈现6次,倒推法的门一直没被焊死,并且终究这个模型在这道题上的准确率也是满分。 这个对比透露了一件挺重要的事:解法收窄不是准确率进步有必要支付的代价,它更像是某种练习配方带来的副作用,换一种配方,副作用能够被规避。 研究者还专门做了一组监督微调的对照试验,直接用穷举出来的多种正确解法去练习模型,发现哪怕只给模型学一种解法(k=1),它保存的解法覆盖率(0.471)也超过了RLVR练习后期的模型(0.268)。假如给它学四种、八种解法,覆盖率能一路涨到0.766。这根本上阐明,只需你愿意在练习数据里多喂几种解法进去,模型是彻底有才能把这些解法都记住并保存下来的,收窄不是模型才能的天花板,而是RLVR这种"只奖赏成果、不管进程"的练习方法自身带来的挑选压力。 论文对这背面的机制也给出了一个直觉性的解说。RLVR每次更新参数,只依据模型实践采样出来的那些途径打分,假如某条途径在前期偶尔体现差一点,它被采样的概率就会稍微下降,而概率一下降,它下次被采样、被进一步验证、被强化的机会也就更少。这是一个自我强化的恶性循环,一开端极其细小的偶尔动摇,会在成千上万次练习迭代之后被滚雪球式地放大成彻底的途径消失。这不是模型"故意"要抛弃某条路,而是练习机制自身的数学结构决议了强者愈强、弱者愈弱。 假如把这个进程类比成一个班级里的评优机制,一开端几个学生解题办法各不相同,教师随机检查表彰了几个用某种解法的学生,这几个学生由于被表彰,更愿意继续用这种解法、也更简单被再次抽到表彰,而用其他解法的学生由于没被抽到,渐渐就不敢再用那种冷门解法了,不是他们不会,是他们觉得反正不会被表彰,渐渐地全班就趋同成一种解法。假如教师不这样随机检查,而是每种解法都确保检查到,那这种趋同就不会发生这么快。 **写在后边** 这篇论文里让我意外的一个细节,是那个"零拜访宗族"的稳定性查验。研究者忧虑自己说某个进口宗族"从没被采样到过"仅仅命运欠好,样本不行,所以又多采样了1024次,拆成两批各512次别离查验,成果337个"消失的宗族"里有336个在第二批512次采样里仍然一次都没呈现。这不是采样噪声,这是真的被锁死了,并且锁得挺死。 另一个让我重复揣摩的当地,是论文里那个关于"拜访"和"履行"的**沙普利值分化**(Shapley decomposition,一种源自博弈论、用来公正分配"奉献"的数学办法)。研究者算出来,练习前后模型解题概率的改变里,34.5%能够归因于"进口拜访的从头分配",65.5%归因于"给定进口后履行才能的进步"。这意味着履行才能其实是在变好的,仅仅它的舞台变窄了,比方一个演员演技越来越精深,但剧团只让他演一个人物。 这让我想到一个更大的问题,不局限于AI练习:任何一个反应机制,只需它的奖赏只盯着"成果对不对",而不关心"进程用了几种方法",它天然就会催生出这种赢家通吃的收窄效应。公司的绩效考核、学校的应试教育、乃至社会媒体的流量分发算法,内核逻辑都很类似。这篇论文用一个数字游戏把这个机制的运作细节,准确到了"每一个词的概率改变"这种颗粒度上,这种准确性自身就挺可贵的。 那扇被锁住的门背面,房间其实一直亮着灯,东西也都还摆在原处,仅仅没人再愿意走进去看一眼了。你说,这算不算是一种很安静的忘记? Q&A Q1:RLVR练习后AI模型解题多样性下降,是由于模型才能变弱了吗? A:不是。论文发现即便在练习前后都能解出来的标题上,模型仍然会丢掉很多原本会的解法,并且被"进口提示"唤醒后,这些丢掉的解法完结率能恢复到乃至超过前期水平,阐明才能还在,仅仅不再自动挑选那条路。 Q2:进口宗族详细指什么? A:进口宗族是指在Countdown数字游戏里,依照解题第一步运用的数字和运算符号对一切正确解法进行的分组,比方"用4乘以某数初"便是一个进口宗族,同一宗族下还或许分出不同的后续核算途径。 Q3:有没有办法让AI模型从头找回丢掉的解题思路? A:有。论文发现表面性的提示词修改根本无效,但把练习后期模型部分层的参数和练习前期checkpoint的参数做层级混合,或许在测验时强制模型对每个可行进口都测验一次,都能在不丢失准确率的前提下显着恢复解法多样性。 |