
論文總結(jié)與翻譯:《Finetuning Large Language Model as an Effective Symbolic Regressor》一、論文主要內(nèi)容該論文聚焦于符號(hào)回歸(SR)任務(wù)——從觀測(cè)數(shù)據(jù)中推導(dǎo)支配方程,這是科學(xué)發(fā)現(xiàn)的核心環(huán)節(jié)。當(dāng)前基于大型語(yǔ)言模型(LLMs)的符號(hào)回歸方法存在局限性,如依賴直接推理或提示工程,需大量推理迭代才能收斂到正確公式,且難以處理復(fù)雜方程,根源在于預(yù)訓(xùn)練LLMs的近似推理能力與SR任務(wù)高精度需求之間的固有矛盾。為解決此問(wèn)題,論文提出以下核心內(nèi)容:構(gòu)建SymbArena基準(zhǔn)數(shù)據(jù)集:包含148,102個(gè)多樣方程,形成18.3億token的語(yǔ)料庫(kù),覆蓋廣泛數(shù)學(xué)結(jié)構(gòu)與復(fù)雜度,且按方程框架劃分訓(xùn)練集(11,000個(gè)方程)與測(cè)試集(512個(gè)方程),避免結(jié)構(gòu)層面信息泄露;同時(shí)設(shè)計(jì)兼顧數(shù)值精度((R^2)、(Acc_{\tau}))與形式一致性(LLM基于語(yǔ)義的度量、啟發(fā)式字符串相似性度量)的評(píng)估方案,彌補(bǔ)傳統(tǒng)數(shù)值導(dǎo)向評(píng)估的不足。提出SymbolicChat基線模型:通過(guò)三階段訓(xùn)練優(yōu)化LLM的符號(hào)回歸能力。第一階段利用90%數(shù)據(jù)進(jìn)行指令微調(diào),將數(shù)據(jù)矩陣轉(zhuǎn)化為包含任務(wù)定義、操作說(shuō)明與輸入輸出對(duì)的提示,采用交叉熵?fù)p失與LoRA實(shí)現(xiàn)參數(shù)高效微調(diào);第二階段基于剩余10%數(shù)據(jù),通過(guò)Form-GRPO強(qiáng)化微調(diào),設(shè)計(jì)形式正確性、形式相似性、數(shù)值擬合、等價(jià)性四種獎(jiǎng)勵(lì),引導(dǎo)模型生成結(jié)