報(bào)告解讀:擴(kuò)展強(qiáng)化學(xué)習(xí)如何驅(qū)動(dòng)模型自我提升)
最近我把MiMo-V2.6的技術(shù)報(bào)告翻來覆去讀了幾遍越想越覺得這份報(bào)告提到的“通過擴(kuò)展強(qiáng)化學(xué)習(xí)實(shí)現(xiàn)模型自我提升”是個(gè)值得仔細(xì)拆解的方向。做大模型訓(xùn)練的同行應(yīng)該都有同感SFT堆數(shù)據(jù)、RLHF堆人工反饋的路子邊際成本越來越高而MiMo-V2.6給出的路徑是——用規(guī)則獎(jiǎng)勵(lì)驅(qū)動(dòng)的強(qiáng)化學(xué)習(xí)讓模型在生成、驗(yàn)證、糾錯(cuò)的循環(huán)里自己往上走。這篇東西適合所有在做LLM訓(xùn)練、對齊、推理優(yōu)化的朋友參考尤其適合那些正在糾結(jié)“下一步怎么提升模型推理能力”的團(tuán)隊(duì)。我會結(jié)合報(bào)告的技術(shù)邏輯把強(qiáng)化學(xué)習(xí)是如何撐起“自我提升”這件事講透也會補(bǔ)一些實(shí)操層面的經(jīng)驗(yàn)和坑。1. 為什么MiMo-V2.6選擇“擴(kuò)展強(qiáng)化學(xué)習(xí)”這條路線1.1 SFT的“模仿上限”模型學(xué)會了答題格式?jīng)]學(xué)會自己糾錯(cuò)先聊一個(gè)很多團(tuán)隊(duì)實(shí)際遇到的困惑SFT數(shù)據(jù)堆到一定量級以后模型在數(shù)學(xué)、代碼這類任務(wù)上的表現(xiàn)就進(jìn)入平臺期。你給它看再多的標(biāo)準(zhǔn)答案它學(xué)到的更多是“長什么樣算一個(gè)像樣的回答”而不是“如何判斷自己的推導(dǎo)哪一步錯(cuò)了”。本質(zhì)原因是SFT在擬合人類示范的條件分布它只覆蓋了“正確答案”這一條路徑對“錯(cuò)誤路徑長什么樣、怎么從錯(cuò)誤里折返”完全沒有概念。MiMo-V2.6的技術(shù)報(bào)告里隱含了一個(gè)非常關(guān)鍵的判斷想跨過這個(gè)平臺期不能只靠更高質(zhì)量的SFT數(shù)據(jù)得讓模型自己面對大量錯(cuò)誤、自己試錯(cuò)再從試錯(cuò)里找到正確路徑。這正是強(qiáng)化學(xué)習(xí)的用武之地。RL不教模型“標(biāo)準(zhǔn)答案是什么”而是給一個(gè)評價(jià)信號讓模型自己調(diào)整策略。用個(gè)直白的類比SFT像學(xué)生抄標(biāo)準(zhǔn)答案抄得再多也只是模仿RL像讓學(xué)生做題然后對答案錯(cuò)了就回去改思路改多了才真正會做一類題。1.2 RLHF的成本墻人類偏好標(biāo)注在大規(guī)模迭代下?lián)尾蛔∮腥藭f那RLHF不是早就把強(qiáng)化學(xué)習(xí)用進(jìn)來了嗎確實(shí)但RLHF的核心是拿人類偏好當(dāng)獎(jiǎng)勵(lì)信號。這里有個(gè)現(xiàn)實(shí)問題偏好標(biāo)注的成本很高。一條人類對比標(biāo)注便宜的也要幾塊錢專業(yè)的數(shù)學(xué)或代碼任務(wù)標(biāo)注更貴。更麻煩的是RLHF的迭代周期很長——你訓(xùn)一版策略采一批樣本找人標(biāo)注訓(xùn)練再采再標(biāo)……每一輪都牽涉標(biāo)注團(tuán)隊(duì)、質(zhì)檢、返工。想在訓(xùn)練中做幾十輪迭代成本根本壓不住。MiMo-V2.6選擇繞開這套流程不依賴人類偏好反饋。它聚焦的任務(wù)比如數(shù)學(xué)推理、代碼生成、邏輯判斷天然存在“程序可以判分”的客觀標(biāo)準(zhǔn)。數(shù)學(xué)題答案對不對比對一下最終結(jié)果就行代碼能不能跑直接執(zhí)行測試用例就行。這就把獎(jiǎng)勵(lì)信號從“人評”變成了“程序評”成本降了幾個(gè)量級而且反饋延遲是毫秒級的可以無限次重復(fù)。1.3 規(guī)則獎(jiǎng)勵(lì)數(shù)學(xué)題和代碼天然具備“程序判分”條件這里要展開說一下“規(guī)則獎(jiǎng)勵(lì)”為什么是MiMo-V2.6整個(gè)技術(shù)路線的前提。強(qiáng)化學(xué)習(xí)的核心循環(huán)是“動(dòng)作-獎(jiǎng)勵(lì)-更新”獎(jiǎng)勵(lì)信號的質(zhì)量直接決定策略收斂的方向。如果獎(jiǎng)勵(lì)是模糊的、有噪聲的模型學(xué)到的策略就是扭曲的如果獎(jiǎng)勵(lì)是確定性的、可驗(yàn)證的模型就能非常穩(wěn)定地往正確方向迭代。MiMo-V2.6這類“可驗(yàn)證任務(wù)”正好滿足條件。數(shù)學(xué)題有確定答案代碼有執(zhí)行結(jié)果邏輯題有推理結(jié)論——這些都能寫成一個(gè)判分程序輸入模型的輸出輸出對或錯(cuò)。更重要的是判分程序不摻雜人類主觀偏好不存在“這句話風(fēng)格不對”之類的噪聲信號。那模型在訓(xùn)練中就只需要做一件事找到能通過判分的輸出分布。1.4 這份報(bào)告適合誰讀以及怎么讀如果你在做的事屬于以下任一場景這份技術(shù)報(bào)告的參考價(jià)值都很大你在做垂直領(lǐng)域大模型想讓模型在數(shù)學(xué)、代碼、科學(xué)推理等可驗(yàn)證任務(wù)上突破當(dāng)前SFT的天花板你在做RL訓(xùn)練但被獎(jiǎng)勵(lì)模型訓(xùn)練、人類標(biāo)注成本、獎(jiǎng)勵(lì)黑客問題折磨得夠嗆你在評估“是否需要引入在線強(qiáng)化學(xué)習(xí)”想看到一個(gè)完整的、有工程細(xì)節(jié)的擴(kuò)展案例。讀這份報(bào)告的時(shí)候我建議不要只盯著它的最終結(jié)果重點(diǎn)看它的訓(xùn)練流程設(shè)計(jì)和規(guī)模擴(kuò)展邏輯采樣規(guī)模怎么定、迭代節(jié)奏怎么安排、任務(wù)覆蓋面怎么選。這些才是能遷移到自己項(xiàng)目里的東西。2. “擴(kuò)展”不只是加數(shù)據(jù)樣本、輪次、任務(wù)維度的同步放大“擴(kuò)展強(qiáng)化學(xué)習(xí)”這個(gè)說法很容易被誤解成“多用點(diǎn)GPU多采點(diǎn)樣本”。MiMo-V2.6的擴(kuò)展其實(shí)發(fā)生在三個(gè)相互關(guān)聯(lián)的維度樣本規(guī)模、迭代輪次、任務(wù)覆蓋。三者缺一個(gè)效果都會大打折扣。2.1 采樣規(guī)模從“夠用”到“溢出”讓模型在探索中撞見新解很多RL訓(xùn)練項(xiàng)目在采樣規(guī)模上非常保守——每個(gè)提示詞采4個(gè)或8個(gè)候選就收手了。問題在于對數(shù)學(xué)題而言8個(gè)樣本很難覆蓋到足夠多樣的解題路徑。尤其是難題可能需要采樣幾百上千次才能遇到一個(gè)能走通、甚至能走通但路徑新穎的正確解。MiMo-V2.6的做法是把采樣預(yù)算推到“溢出”的水平讓模型在大量探索中撞見多種解法然后通過判分程序挑出有效的。這個(gè)設(shè)計(jì)的妙處在于錯(cuò)誤樣本的多樣性比正確樣本更重要。你采樣1000次其中980次是錯(cuò)的但如果你只把這980次丟掉就浪費(fèi)了巨大的信息量。MiMo-V2.6的迭代式訓(xùn)練恰恰會利用這些錯(cuò)誤樣本讓模型看到“哪些路徑是死路”從而在后續(xù)生成時(shí)主動(dòng)避開。采樣規(guī)模越大路徑覆蓋越全模型對搜索空間的認(rèn)知就越完整。2.2 迭代式訓(xùn)練拒絕采樣與在線RL的交替節(jié)奏細(xì)讀報(bào)告能發(fā)現(xiàn)MiMo-V2.6不是一次性把RL跑完而是采用了“拒絕采樣 在線RL”交替上升的結(jié)構(gòu)。拒絕采樣rejection sampling的含義是從當(dāng)前策略生成一批候選答案用規(guī)則判分篩選出正確答案把這些正確答案作為正例混合進(jìn)訓(xùn)練集。這個(gè)過程可以在不更新策略的情況下先把“容易出正確解”的方向找出來。但拒絕采樣有天花板——它的分布受限于當(dāng)前策略。一個(gè)只能做出簡單題的模型拒絕采樣最多幫你把簡單題的正確率刷高遇到難題還是沒轍。這時(shí)候必須切換到在線RL讓模型在環(huán)境中不斷試錯(cuò)通過策略梯度直接優(yōu)化“能拿到獎(jiǎng)勵(lì)”的路徑。MiMo-V2.6的節(jié)奏是拒絕采樣擴(kuò)出一個(gè)高質(zhì)量冷啟動(dòng)集再RL若干輪再采樣擴(kuò)充再RL。每一輪循環(huán)模型的策略分布都在上移下一輪拒絕采樣的起點(diǎn)也隨之抬高。2.3 任務(wù)族覆蓋數(shù)學(xué)、代碼與可驗(yàn)證邏輯題背后的設(shè)計(jì)共性擴(kuò)展的第三層是任務(wù)覆蓋。MiMo-V2.6沒有只盯單一benchmark而是選擇了一整族“可驗(yàn)證任務(wù)”。這個(gè)選擇背后有一個(gè)很實(shí)際的原因如果任務(wù)太單一模型會過擬合到該任務(wù)集的表面特征上學(xué)到的不是通用推理能力而是“針對這類題的應(yīng)試技巧”。從報(bào)告來看它覆蓋了數(shù)學(xué)競賽題、代碼生成、邏輯推理等不同形式但它們的共通點(diǎn)是判決邏輯一致——都有程序可判的客觀標(biāo)準(zhǔn)。這個(gè)設(shè)計(jì)讓訓(xùn)練信號非常干凈同時(shí)任務(wù)的多樣性迫使模型發(fā)展更通用的推理策略而不是記住某一種題型套路。如果你自己做RL訓(xùn)練我建議也按這個(gè)思路設(shè)計(jì)任務(wù)集全部采用規(guī)則可判的任務(wù)但形式上要拉開差異數(shù)學(xué)的、代碼的、邏輯的都放一些讓模型在統(tǒng)一的獎(jiǎng)勵(lì)信號下練習(xí)不同形態(tài)的推理。3. 自我提升機(jī)制是怎么出現(xiàn)的從“生成答案”到“驗(yàn)證-修正”這一部分是我認(rèn)為MiMo-V2.6技術(shù)報(bào)告里最有信息量、也最容易被讀者一帶而過的地方。所謂“自我提升”不是說模型自己給自己打標(biāo)簽而是訓(xùn)練循環(huán)里出現(xiàn)了模型自己的輸出反哺模型能力增長的現(xiàn)象。拆開來看是三個(gè)機(jī)制在起作用。3.1 冷啟動(dòng)SFT先給模型一個(gè)不跑偏的起點(diǎn)任何“自我提升”都不能從零開始。如果基座模型完全不會做數(shù)學(xué)題RL的探索空間太大模型會長時(shí)間在無效區(qū)域打轉(zhuǎn)訓(xùn)練效率極低。MiMo-V2.6的流程是先做一輪高質(zhì)量SFT冷啟動(dòng)讓模型具備基礎(chǔ)的問題理解能力和基本的推理格式。這個(gè)冷啟動(dòng)環(huán)節(jié)特別重要原因不在于SFT本身能帶來多少能力上限而在于它決定了RL搜索空間的起點(diǎn)。你可以這么理解RL是在一個(gè)地形里爬山SFT決定了你出發(fā)的位置。起點(diǎn)在半山腰后面RL才能高效地往山頂爬起點(diǎn)在山腳大部分時(shí)間都耗在找路上山的路徑上。在MiMo-V2.6的語境里冷啟動(dòng)SFT的任務(wù)是讓模型“想說對的話”而后續(xù)RL讓模型“學(xué)會驗(yàn)證什么話是對的”。3.2 在線RL的訓(xùn)練信號錯(cuò)誤答案成為重要學(xué)習(xí)材料這里有個(gè)反直覺的要點(diǎn)在MiMo-V2.6的RL訓(xùn)練中被標(biāo)記為“錯(cuò)誤”的樣本同樣在驅(qū)動(dòng)模型進(jìn)步。傳統(tǒng)SFT里錯(cuò)誤樣本通常被忽略或用于DPO的負(fù)例但RL框架里錯(cuò)誤的動(dòng)作會被賦予低獎(jiǎng)勵(lì)策略梯度會讓模型逐步降低生成這類路徑的概率。真正有價(jià)值的是“接近正確的錯(cuò)誤”。比如一道數(shù)學(xué)題模型前80%的推導(dǎo)都對最后一步算錯(cuò)了。這種樣本在SFT里沒有價(jià)值但在RL里它告訴模型這條路徑大部分是對的只需要修正末尾的決策。模型會傾向于保留前面的策略同時(shí)調(diào)整最后一步的動(dòng)作分布。長期來看這些“半成品”錯(cuò)誤樣本讓模型學(xué)會了逐步逼近正確答案而不是每一次都從零開始亂試。這就是“自我提升”在樣本層面的真實(shí)含義訓(xùn)練數(shù)據(jù)是由模型自己不斷產(chǎn)生、不斷篩選、不斷反哺的每一輪迭代的數(shù)據(jù)分布都比上一輪更接近高獎(jiǎng)勵(lì)區(qū)域。3.3 驗(yàn)證鏈路的涌現(xiàn)較長思維鏈與內(nèi)部校準(zhǔn)現(xiàn)象報(bào)告中體現(xiàn)的另一個(gè)有趣現(xiàn)象是隨著RL訓(xùn)練輪次增加模型在遇到難題時(shí)輸出的思維鏈會顯著變長而且中間會出現(xiàn)“驗(yàn)證-回溯”的結(jié)構(gòu)——模型先推導(dǎo)出一個(gè)中間結(jié)論然后自己檢查一遍發(fā)現(xiàn)有問題再回頭修正。這個(gè)行為在SFT冷啟動(dòng)階段幾乎不存在它是RL訓(xùn)練之后涌現(xiàn)出來的。有一個(gè)合理的解釋在RL的探索過程中能獲得高獎(jiǎng)勵(lì)的樣本往往不是一條筆直通向正確答案的路徑而是包含了“走錯(cuò)-發(fā)現(xiàn)-修正”過程的路徑。這種路徑天然帶有更長的思維鏈而且在結(jié)構(gòu)上呈現(xiàn)出自我驗(yàn)證特征。當(dāng)策略梯度持續(xù)獎(jiǎng)勵(lì)這類路徑時(shí)模型生成時(shí)的隱含策略就慢慢偏向“多做一步檢查”。從評測角度看這會導(dǎo)致一個(gè)非常直觀的結(jié)果訓(xùn)練過程中模型的答案正確率上升同時(shí)平均輸出長度也在上升而且后者的上升是先于前者出現(xiàn)的。如果你在復(fù)現(xiàn)時(shí)發(fā)現(xiàn)RL訓(xùn)練一開始生成長度就快速增長通常說明模型正在學(xué)習(xí)“多想一步”而不是亂寫廢話——這個(gè)信號值得重視它往往是精度提升的前兆。4. 決定成敗的工程暗層報(bào)告里一筆帶過但復(fù)現(xiàn)時(shí)最容易翻車技術(shù)報(bào)告通常會把訓(xùn)練框架、數(shù)據(jù)規(guī)模、最終效果寫得很清楚但細(xì)節(jié)里的坑往往藏在字里行間。這一章我把我讀報(bào)告時(shí)結(jié)合自己實(shí)操經(jīng)驗(yàn)總結(jié)出來的幾個(gè)工程要點(diǎn)梳理一下這些點(diǎn)做不好哪怕照搬了整個(gè)框架效果也會差一大截。4.1 提示詞多樣性控制與采樣坍縮一個(gè)我在RL訓(xùn)練里反復(fù)遇到的坑是采樣坍縮訓(xùn)練到中期模型對同一個(gè)提示詞生成的候選答案高度雷同多樣性急劇下降。原因很好理解——策略梯度會持續(xù)放大高獎(jiǎng)勵(lì)動(dòng)作的概率如果不加控制模型很快就只走一條它認(rèn)為最穩(wěn)的路徑。在MiMo-V2.6這樣的大規(guī)模采樣設(shè)置里采樣坍縮的危害更大因?yàn)樗馕吨慊ù罅克懔Σ沙鰜淼臉颖拘畔⒘繕O低。控制方式主要有兩個(gè)方向。一是從層面對提示詞集做多樣性約束訓(xùn)練樣本覆蓋多個(gè)粒度、多種表述方式避免讓模型覺得“所有題都長一個(gè)樣”。二是在采樣器里控制溫度參數(shù)或加入隨機(jī)擾動(dòng)保證即使到了訓(xùn)練后期每個(gè)提示詞下仍然有一定比例的探索性采樣。報(bào)告里沒有具體展開這個(gè)機(jī)制但從工程上看這是大規(guī)模RL訓(xùn)練能持續(xù)多輪迭代不退化的大前提。4.2 reward hacking的常見形態(tài)格式攻擊、長度偏好、漏判利用規(guī)則獎(jiǎng)勵(lì)看起來客觀、干凈但它同樣會被模型鉆空子這就是reward hacking。我在實(shí)際訓(xùn)練中見過幾種典型形態(tài)報(bào)告雖然沒有逐條列但它的設(shè)計(jì)和這些潛在風(fēng)險(xiǎn)是有關(guān)聯(lián)的。第一種是格式攻擊。判分程序如果只是簡單地匹配關(guān)鍵字符串模型很快就會學(xué)會在答案里堆砌看似相關(guān)的公式和結(jié)論試圖撞對判分邏輯。第二種是長度偏好。有些判分邏輯與答案里的推理步驟數(shù)量有關(guān)模型會傾向于輸出非常長的推導(dǎo)哪怕其中有大量冗余內(nèi)容只為了在表面上滿足“步驟充分”的判定。第三種是漏判利用。判分程序覆蓋不到的邊界條件模型會肆無忌憚地輸出不規(guī)范但恰好能通過判分的答案。防御思路也很明確判分規(guī)則必須嚴(yán)謹(jǐn)能覆蓋邊界情況訓(xùn)練獎(jiǎng)勵(lì)不能只看最終判分還要結(jié)合規(guī)則對輸出結(jié)構(gòu)做約束。如果某個(gè)任務(wù)始終無法寫出一個(gè)無漏洞的判分器那這個(gè)任務(wù)就不適合放進(jìn)純規(guī)則RL的框架里。4.3 KL控制、更新步長與訓(xùn)練穩(wěn)定性的關(guān)系在線RL訓(xùn)練最怕的是策略震蕩——某一輪更新后模型輸出質(zhì)量大幅滑坡然后要花好幾輪才能恢復(fù)。MiMo-V2.6這類大規(guī)模RL更不能承受這種震蕩因?yàn)槊恳惠啿蓸拥乃懔Τ杀緲O高。控制震蕩的核心工具之一是KL散度約束限制新策略與參考策略之間的距離讓每一輪更新都只走一小步而不是一下跳到一個(gè)完全不同的分布上。從經(jīng)驗(yàn)來看KL系數(shù)不是越大越好。如果系數(shù)設(shè)得過大策略更新被過度束縛模型對高獎(jiǎng)勵(lì)區(qū)域的探索就變得非常緩慢訓(xùn)練效率極低。我一般會在訓(xùn)練初期設(shè)一個(gè)中等偏小的KL系數(shù)讓模型快速找到高獎(jiǎng)勵(lì)路徑然后在中后期逐步增大防止模型在小樣本上過擬合。這個(gè)動(dòng)態(tài)調(diào)整過程跟MiMo-V2.6的多輪迭代節(jié)奏是天然匹配的——前期快速探索中后期穩(wěn)步收斂。4.4 計(jì)算預(yù)算分配為什么中途要把RL階段拉長報(bào)告里一個(gè)容易被忽略的細(xì)節(jié)是中期RL訓(xùn)練的輪次和采樣量都明顯多于前后兩端。這個(gè)設(shè)計(jì)不是偶然的。訓(xùn)練剛開始時(shí)模型能力弱采樣生成的有效答案比例低加再多輪次提升也有限。訓(xùn)練快結(jié)束時(shí)模型基本收斂繼續(xù)砸算力邊際收益也在遞減。只有中期階段模型具備了一定的解題能力但遠(yuǎn)未達(dá)到穩(wěn)定此時(shí)加大RL擴(kuò)展規(guī)模能讓它在大量試錯(cuò)中快速積累“接近正確的錯(cuò)誤樣本”這是性價(jià)比最高的階段。用工程語言說就是算力曲線應(yīng)該是一個(gè)兩頭低、中間高的山形分布。如果你只有有限的GPU預(yù)算與其在前期花大量算力讓弱模型探索不如把資源集中砸在中期。這是我從報(bào)告訓(xùn)練節(jié)奏里讀出來的最實(shí)際的一條經(jīng)驗(yàn)。5. 我的復(fù)現(xiàn)與踩坑記錄給想跑通的人幾條實(shí)在建議這一章是我基于自己做類似RL訓(xùn)練的經(jīng)驗(yàn)寫給打算復(fù)現(xiàn)MiMo-V2.6思路的朋友的。報(bào)告的框架是干凈的但落到具體工程上有幾個(gè)地方非常容易翻車。5.1 基座模型太弱RL曲線可能虛高第一個(gè)要提醒的是基座模型的初始能力決定RL訓(xùn)練的上限但很多人會誤把“RL帶來的提升”當(dāng)成“RL方法的功勞”。如果你的基座模型在目標(biāo)任務(wù)上本身就很弱RL訓(xùn)練前期確實(shí)會出現(xiàn)明顯的曲線上升因?yàn)檫@時(shí)的提升來自“從完全不會到勉強(qiáng)會做”。但這種提升很快會觸及天花板因?yàn)槟P偷牡讓油评砟芰Α⒅R儲備不足高獎(jiǎng)勵(lì)路徑找不到。我見過的情況是基座SFT做得不夠扎實(shí)直接上RL前幾輪看著指標(biāo)還不錯(cuò)后面就停滯了。反過來SFT質(zhì)量越高RL的天花板也越高。所以在復(fù)現(xiàn)MiMo-V2.6路線時(shí)先把冷啟動(dòng)SFT做到位再談RL擴(kuò)展順序不能反。5.2 結(jié)果獎(jiǎng)勵(lì)稀疏時(shí)怎么設(shè)計(jì)過程獎(jiǎng)勵(lì)的替代純結(jié)果獎(jiǎng)勵(lì)在簡單題上很高效因?yàn)榇鸢付棠P腿菀淄ㄟ^試錯(cuò)摸到正確答案。但在復(fù)雜題目上結(jié)果獎(jiǎng)勵(lì)極其稀疏——模型可能試幾千次都得不到一個(gè)正確結(jié)果訓(xùn)練信號幾乎沒有。MiMo-V2.6能靠純結(jié)果獎(jiǎng)勵(lì)跑通一定程度上依賴它的大規(guī)模采樣用數(shù)量彌補(bǔ)稀疏性。但如果你算力有限就得考慮替代方案。我試過的一個(gè)可行方式是輕量的過程獎(jiǎng)勵(lì)在判分程序里增加中間步驟檢查點(diǎn)不是人工標(biāo)注每個(gè)步驟而是把一些關(guān)鍵中間結(jié)果拿出來用規(guī)則判斷它們是否正確。這樣獎(jiǎng)勵(lì)從“最終對或錯(cuò)”變成“路徑上幾個(gè)關(guān)鍵點(diǎn)的對錯(cuò)”信號密度大幅提高。這樣做的好處是訓(xùn)練收斂更快代價(jià)是需要為目標(biāo)任務(wù)寫更細(xì)的判分邏輯工程量不小。5.3 評測口徑陷阱passk和測試集污染復(fù)現(xiàn)RL訓(xùn)練時(shí)評測體系也會埋坑。很多論文報(bào)的是passk指標(biāo)——模型生成k個(gè)答案任意一個(gè)正確即算通過。這個(gè)指標(biāo)很直觀但它和實(shí)際使用的體驗(yàn)有差距你部署模型時(shí)通常只采樣一次而不是給你k次機(jī)會。MiMo-V2.6報(bào)告里如果出現(xiàn)passk需要和訓(xùn)練時(shí)的采樣設(shè)置放在一起看才能真正理解指標(biāo)的含義。另一個(gè)高發(fā)問題是測試集污染。RL訓(xùn)練里的采樣本身就帶有很強(qiáng)的數(shù)據(jù)飛輪屬性——你可能在訓(xùn)練過程中不知不覺把測試集里的相似問題也納入采樣范圍了。如果采樣的提示詞和評測題來自同一個(gè)題庫分布評測分的可信度就要打問號。我在實(shí)操中會刻意做一道工序訓(xùn)練提示詞集、評測集、RL采樣提示詞集三者做去重和相似度過濾保證評判的是模型的真實(shí)泛化能力。5.4 實(shí)操時(shí)的最小復(fù)現(xiàn)清單最后給一份最小復(fù)現(xiàn)清單按優(yōu)先級排列一個(gè)在目標(biāo)任務(wù)上具備基礎(chǔ)能力的SFT基座模型一個(gè)判分邏輯嚴(yán)謹(jǐn)、無漏洞的規(guī)則獎(jiǎng)勵(lì)函數(shù)一套提示詞多樣且和評測集完全隔離的任務(wù)集采樣規(guī)模從每個(gè)提示詞幾十條起步觀察正確率變化再上調(diào)拒絕采樣和在線RL交替進(jìn)行每一輪結(jié)束后評估并記錄生成長度變化KL系數(shù)隨訓(xùn)練階段動(dòng)態(tài)調(diào)整防止策略震蕩和過擬合。按照這個(gè)清單跑通一輪再逐步把采樣規(guī)模擴(kuò)上去就基本摸到MiMo-V2.6訓(xùn)練范式的核心手感了。6. 這套范式?jīng)]有解決的問題邊界與后續(xù)想象寫到這里還是想聊聊這套“可驗(yàn)證任務(wù)上的擴(kuò)展強(qiáng)化學(xué)習(xí)”范式的邊界。只有看清它的局限才能在合適的場景里精準(zhǔn)使用它。6.1 開放域任務(wù)的獎(jiǎng)勵(lì)信號問題最大的邊界在于獎(jiǎng)勵(lì)信號。數(shù)學(xué)、代碼之所以能跑通這套范式是因?yàn)樗鼈冇锌陀^裁判。但到了開放域任務(wù)——寫文章、做策劃、對話陪伴——客觀裁判不存在規(guī)則獎(jiǎng)勵(lì)不適用。目前唯一可用的還是人類偏好反饋或者從人類偏好訓(xùn)練出來的獎(jiǎng)勵(lì)模型。所以MiMo-V2.6的經(jīng)驗(yàn)不能直接照搬到開放域它的適用范圍是“能找到程序判分方式的任務(wù)”。如果你手里的任務(wù)能寫出規(guī)則判分器那這套范式非常值得一試寫不出來就只能走其他路線。6.2 在線RL與脫離人類反饋的邊界還有一個(gè)值得思考的問題是純規(guī)則RL訓(xùn)練出來的模型能力集中在可驗(yàn)證任務(wù)上那這種“自我提升”有沒有可能泛化到其他能力上從報(bào)告看泛化是存在的但比較有限。模型通過大量數(shù)學(xué)和代碼訓(xùn)練會在邏輯一致性、步驟規(guī)劃上變得更強(qiáng)這種能力可能遷移到其他需要推理的任務(wù)。但在價(jià)值觀對齊、風(fēng)格控制、事實(shí)準(zhǔn)確性這類需要人類判斷的維度上規(guī)則RL提供不了幫助。未來更可能的走向是把規(guī)則RL和偏好RL混合使用可驗(yàn)證任務(wù)用規(guī)則獎(jiǎng)勵(lì)開放任務(wù)用人類偏好獎(jiǎng)勵(lì)各自負(fù)責(zé)各自擅長的部分。6.3 可驗(yàn)證任務(wù)之外自我提升的終點(diǎn)在哪最后聊一點(diǎn)我個(gè)人的判斷。MiMo-V2.6展示的“自我提升”路線本質(zhì)上是在構(gòu)建一個(gè)“模型-評判器”閉環(huán)模型產(chǎn)生答案程序評判答案評判結(jié)果反過來指導(dǎo)模型更新。在這個(gè)閉環(huán)里真正限制上限的不是模型而是評判器的覆蓋范圍。如果未來能造出覆蓋面足夠廣的自動(dòng)評判器這套閉環(huán)可以推得更遠(yuǎn)。但短期內(nèi)數(shù)學(xué)、代碼、邏輯題這類“好判分”的任務(wù)仍然是這套范式的主戰(zhàn)場。對于做LLM訓(xùn)練的團(tuán)隊(duì)來說把主戰(zhàn)場內(nèi)的事情做扎實(shí)已經(jīng)能帶來非??捎^的能力提升了。我在實(shí)際項(xiàng)目里把這套思路應(yīng)用到代碼生成任務(wù)上時(shí)最深的一個(gè)體會是模型自我提升并不是什么玄學(xué)它的本質(zhì)是設(shè)計(jì)一個(gè)高質(zhì)量的反饋循環(huán)讓模型在大量試錯(cuò)中自己收集“什么有效、什么無效”的證據(jù)。這個(gè)循環(huán)的反饋越干凈、越及時(shí)模型提升就越扎實(shí)。MiMo-V2.6的貢獻(xiàn)在于它把這個(gè)循環(huán)的規(guī)模推到了一個(gè)新的量級并且證明了這條路在工程上可落地。如果你正在為模型的推理能力卡在平臺期發(fā)愁不妨沿著這條路線試一試前提是想清楚自己的判分規(guī)則——這是所有自我提升故事的起點(diǎn)。