
文章主要內(nèi)容和創(chuàng)新點主要內(nèi)容本文聚焦于大型語言模型(LLMs)的后訓(xùn)練優(yōu)化,針對現(xiàn)有方法(如GRPO)忽略候選響應(yīng)間語義交互(互補或矛盾)的問題,提出了Group Causal Policy Optimization(GCPO)方法?,F(xiàn)有GRPO方法通過組內(nèi)相對獎勵提升效率,但假設(shè)候選響應(yīng)獨立,忽略了它們在實際推理任務(wù)中的語義關(guān)聯(lián);作者引入結(jié)構(gòu)因果模型(SCM),揭示候選響應(yīng)在“最終整合輸出”的條件下形成“碰撞結(jié)構(gòu)(collider structure)”,存在隱藏依賴關(guān)系;基于因果分析,GCPO通過兩個關(guān)鍵組件整合因果結(jié)構(gòu):(1)因果調(diào)整的獎勵機制,將響應(yīng)投影到因果子空間;(2)KL正則化項,使策略與因果投影的參考分布對齊;實驗表明,GCPO在數(shù)學(xué)推理(如AIME、AMC)和代碼推理(如HumanEval)等多個基準(zhǔn)上持續(xù)優(yōu)于GRPO等現(xiàn)有方法。創(chuàng)新點因果視角下的候選響應(yīng)依賴建模:發(fā)現(xiàn)候選響應(yīng)在最終輸出的條件下形成碰撞結(jié)構(gòu),證明將預(yù)測投影到因果子空間可降低測試誤差,比僅基于查詢的基準(zhǔn)更可靠;因果感知的策略優(yōu)化方法:提出GCPO,通過因果調(diào)整的獎勵和KL正則化項,使模型學(xué)習(xí)組內(nèi)響應(yīng)的結(jié)構(gòu)一致性,提升語義魯棒性;跨基準(zhǔn)的一致性能提升:在數(shù)學(xué)和代碼推理任務(wù)中,GCP