
文章主要內(nèi)容和創(chuàng)新點(diǎn)主要內(nèi)容本文聚焦于大型語(yǔ)言模型(LLMs)的后訓(xùn)練優(yōu)化,針對(duì)現(xiàn)有方法(如GRPO)忽略候選響應(yīng)間語(yǔ)義交互(互補(bǔ)或矛盾)的問(wèn)題,提出了Group Causal Policy Optimization(GCPO)方法?,F(xiàn)有GRPO方法通過(guò)組內(nèi)相對(duì)獎(jiǎng)勵(lì)提升效率,但假設(shè)候選響應(yīng)獨(dú)立,忽略了它們?cè)趯?shí)際推理任務(wù)中的語(yǔ)義關(guān)聯(lián);作者引入結(jié)構(gòu)因果模型(SCM),揭示候選響應(yīng)在“最終整合輸出”的條件下形成“碰撞結(jié)構(gòu)(collider structure)”,存在隱藏依賴關(guān)系;基于因果分析,GCPO通過(guò)兩個(gè)關(guān)鍵組件整合因果結(jié)構(gòu):(1)因果調(diào)整的獎(jiǎng)勵(lì)機(jī)制,將響應(yīng)投影到因果子空間;(2)KL正則化項(xiàng),使策略與因果投影的參考分布對(duì)齊;實(shí)驗(yàn)表明,GCPO在數(shù)學(xué)推理(如AIME、AMC)和代碼推理(如HumanEval)等多個(gè)基準(zhǔn)上持續(xù)優(yōu)于GRPO等現(xiàn)有方法。創(chuàng)新點(diǎn)因果視角下的候選響應(yīng)依賴建模:發(fā)現(xiàn)候選響應(yīng)在最終輸出的條件下形成碰撞結(jié)構(gòu),證明將預(yù)測(cè)投影到因果子空間可降低測(cè)試誤差,比僅基于查詢的基準(zhǔn)更可靠;因果感知的策略優(yōu)化方法:提出GCPO,通過(guò)因果調(diào)整的獎(jiǎng)勵(lì)和KL正則化項(xiàng),使模型學(xué)習(xí)組內(nèi)響應(yīng)的結(jié)構(gòu)一致性,提升語(yǔ)義魯棒性;跨基準(zhǔn)的一致性能提升:在數(shù)學(xué)和代碼推理任務(wù)中,GCP