
文章主要內(nèi)容和創(chuàng)新點主要內(nèi)容本文針對大型語言模型(LLMs)易受越獄攻擊(通過精心設(shè)計的提示詞繞過安全協(xié)議,生成有害內(nèi)容)的問題,提出了一種基于上下文共現(xiàn)張量潛在空間特征的檢測方法——CoCoTen。該方法通過以下步驟實現(xiàn)檢測:構(gòu)建上下文共現(xiàn)矩陣:對輸入提示詞,在滑動窗口(通常5-10個token)內(nèi)計算詞與詞的共現(xiàn)關(guān)系,生成共現(xiàn)矩陣;堆疊為張量:將多個提示詞的共現(xiàn)矩陣堆疊為三維張量(維度為詞匯量×詞匯量×提示詞數(shù)量);張量分解提取特征:使用CANDECOMP/PARAFAC(CP)分解張量,得到捕獲提示詞潛在特征的嵌入矩陣;半監(jiān)督分類:基于嵌入矩陣,使用K近鄰(KNN)算法(半監(jiān)督學(xué)習(xí))區(qū)分良性提示和越獄提示。實驗結(jié)果顯示,CoCoTen在少標(biāo)簽數(shù)據(jù)場景下表現(xiàn)優(yōu)異(僅使用0.5%的帶標(biāo)簽提示時,F(xiàn)1分?jǐn)?shù)達(dá)0.83,較基線提升96.6%),且運行速度是基線方法的2.3-128.4倍,同時能通過詞匯中心性對提示詞的對抗性進(jìn)行排序,為LLM安全防護(hù)提供了高效工具。創(chuàng)新點基于上下文共現(xiàn)張量的潛在特征提?。菏状螌⑸舷挛墓铂F(xiàn)矩陣堆疊為張量,通過張量分解捕獲提示詞的深層結(jié)構(gòu)模式,有效區(qū)分良性與越獄提示;適用于少標(biāo)簽數(shù)據(jù)場景:在僅使用0.5%-5