
文章主要內(nèi)容總結(jié)本文針對自然語言處理中自動(dòng)文本評估的挑戰(zhàn),尤其是多語言場景下基于大語言模型(LLM)的評估方法存在的依賴專有模型、需大量微調(diào)數(shù)據(jù)等問題,提出了一種基于檢查表工程的LLM評估框架(CE-Judge)。該框架無需訓(xùn)練,基于開源模型,支持點(diǎn)式(單個(gè)響應(yīng)評分)和成對(兩個(gè)響應(yīng)中選優(yōu))兩種評估模式,適用于多語言場景。CE-Judge的核心流程分為三階段:概念生成:從指令(或源文本)和響應(yīng)中提取抽象概念,作為評估的基礎(chǔ)骨架;檢查表生成:通過雙向生成(響應(yīng)到指令、指令到響應(yīng))構(gòu)建動(dòng)態(tài)檢查表,增強(qiáng)評估覆蓋度和描述性;判斷:結(jié)合原始指令/響應(yīng)和檢查表,由LLM生成評估結(jié)果,支持點(diǎn)式和成對評估。實(shí)驗(yàn)在多語言推理、對話和文學(xué)翻譯數(shù)據(jù)集上驗(yàn)證了CE-Judge的性能,結(jié)果顯示其優(yōu)于開源基線模型,且與GPT-4o等專有模型性能相當(dāng)。創(chuàng)新點(diǎn)無需訓(xùn)練且基于開源模型:擺脫了對專有模型或大量微調(diào)數(shù)據(jù)的依賴,降低了成本和時(shí)間開銷;支持多語言與雙評估模式:首次將檢查表方法擴(kuò)展到多語言場景,同時(shí)支持點(diǎn)式和成對評估;動(dòng)態(tài)雙向檢查表:通過“響應(yīng)到指令”和“指令到響應(yīng)”雙向生成檢查表,提升評估覆蓋度和描述性,避免預(yù)定義標(biāo)準(zhǔn)的局限性;精細(xì)成對評估