
文章主要內(nèi)容和創(chuàng)新點(diǎn)主要內(nèi)容本文針對(duì)大型語(yǔ)言模型(LLMs)易受越獄攻擊(通過(guò)精心設(shè)計(jì)的提示詞繞過(guò)安全協(xié)議,生成有害內(nèi)容)的問(wèn)題,提出了一種基于上下文共現(xiàn)張量潛在空間特征的檢測(cè)方法——CoCoTen。該方法通過(guò)以下步驟實(shí)現(xiàn)檢測(cè):構(gòu)建上下文共現(xiàn)矩陣:對(duì)輸入提示詞,在滑動(dòng)窗口(通常5-10個(gè)token)內(nèi)計(jì)算詞與詞的共現(xiàn)關(guān)系,生成共現(xiàn)矩陣;堆疊為張量:將多個(gè)提示詞的共現(xiàn)矩陣堆疊為三維張量(維度為詞匯量×詞匯量×提示詞數(shù)量);張量分解提取特征:使用CANDECOMP/PARAFAC(CP)分解張量,得到捕獲提示詞潛在特征的嵌入矩陣;半監(jiān)督分類:基于嵌入矩陣,使用K近鄰(KNN)算法(半監(jiān)督學(xué)習(xí))區(qū)分良性提示和越獄提示。實(shí)驗(yàn)結(jié)果顯示,CoCoTen在少標(biāo)簽數(shù)據(jù)場(chǎng)景下表現(xiàn)優(yōu)異(僅使用0.5%的帶標(biāo)簽提示時(shí),F(xiàn)1分?jǐn)?shù)達(dá)0.83,較基線提升96.6%),且運(yùn)行速度是基線方法的2.3-128.4倍,同時(shí)能通過(guò)詞匯中心性對(duì)提示詞的對(duì)抗性進(jìn)行排序,為L(zhǎng)LM安全防護(hù)提供了高效工具。創(chuàng)新點(diǎn)基于上下文共現(xiàn)張量的潛在特征提?。菏状螌⑸舷挛墓铂F(xiàn)矩陣堆疊為張量,通過(guò)張量分解捕獲提示詞的深層結(jié)構(gòu)模式,有效區(qū)分良性與越獄提示;適用于少標(biāo)簽數(shù)據(jù)場(chǎng)景:在僅使用0.5%-5