
Weak-to-Strong Generalization via Direct On-Policy Distillation 全文總結(jié)+指定章節(jié)中英對照翻譯一、文章整體核心內(nèi)容總結(jié)1. 研究背景當(dāng)前基于可驗(yàn)證獎勵的強(qiáng)化學(xué)習(xí)(RLVR)是提升大模型數(shù)學(xué)推理能力的主流后訓(xùn)練方案,但存在極高算力成本:模型規(guī)模越大,生成采樣軌跡、迭代RL的開銷呈指數(shù)上漲,每一款新的強(qiáng)推理模型都要從頭跑完整RL,后訓(xùn)練成為性能擴(kuò)展瓶頸。傳統(tǒng)在策略蒸餾(OPD)直接模仿小RL模型的最終策略,存在致命缺陷:小模型的最終策略混合了RL帶來的推理增益與小模型本身的容量短板;若學(xué)生模型本身性能已經(jīng)超過小教師,單純模仿會直接拉低學(xué)生效果。2. 核心方案:Direct-OPD(直接在策略蒸餾)不蒸餾小RL模型的絕對輸出分布,而是提取RL帶來的策略偏移量作為可遷移隱式獎勵:取同一小模型RL前后兩個(gè)權(quán)重:RL前參考模型πTref\pi_{T_{ref}}