)
Safety面向大模型智能體的多維度安全能力評測基準(zhǔn)arXiv編號arXiv:2609.30028v1 [cs.CL]摘要大模型智能體可調(diào)用外部工具修改真實系統(tǒng)狀態(tài)帶來區(qū)別于普通對話模型的新型安全風(fēng)險?,F(xiàn)有的安全基準(zhǔn)大多聚焦單輪對話提示注入缺少對工具調(diào)用、多步長視界交互、環(huán)境狀態(tài)變更風(fēng)險的系統(tǒng)性覆蓋。本文構(gòu)建AgentBench(F1?safety \frac{2\times ASR_{def} \times Benign_{Pass}}{ASR_{def}Benign_{Pass}})Safety一套面向工具智能體的多維度安全評測基準(zhǔn)。數(shù)據(jù)集包含1242條測試用例分為4大風(fēng)險大類、14個風(fēng)險子類覆蓋提示注入、權(quán)限濫用、信息泄露、錯誤行為誘導(dǎo)評測同時包含攻擊側(cè)用例與正常業(yè)務(wù)良性用例兼顧安全防御能力與業(yè)務(wù)可用性避免模型為了安全而過度拒絕合法請求。設(shè)計分層評測指標(biāo)攻擊防御成功率、良性任務(wù)通過率、F1綜合指標(biāo)量化安全(F1?safety \frac{2\times ASR_{def} \times Benign_{Pass}}{ASR_{def}Benign_{Pass}})可用性權(quán)衡。對14個主流開源、閉源大模型開展大規(guī)模評測。實驗表明現(xiàn)有智能體基座普遍存在安全(F1?safety \frac{2\times ASR_{def} \times Benign_{Pass}}{ASR_{def}Benign_{Pass}})可用性兩難多數(shù)模型防御攻擊的同時會誤拒絕大量正常合法任務(wù)閉源前沿模型整體表現(xiàn)優(yōu)于開源模型但仍然存在明顯短板。進(jìn)一步開展消融研究分析系統(tǒng)提示、沙箱隔離、輸入過濾三類防護手段的收益與副作用。數(shù)據(jù)集、評測腳本、全部配置完整開源。關(guān)鍵詞智能體安全工具調(diào)用安全評測基準(zhǔn)提示注入權(quán)限濫用安全可用性權(quán)衡目錄[引言](#1(F1?safety \frac{2\times ASR_{def} \times Benign_{Pass}}{ASR_{def}Benign_{Pass}})引言)[相關(guān)工作](#2(F1?safety \frac{2\times ASR_{def} \times Benign_{Pass}}{ASR_{def}Benign_{Pass}})相關(guān)工作)[AgentBench(F1?safety \frac{2\times ASR_{def} \times Benign_{Pass}}{ASR_{def}Benign_{Pass}})Safety基準(zhǔn)構(gòu)建](#3(F1?safety \frac{2\times ASR_{def} \times Benign_{Pass}}{ASR_{def}Benign_{Pass}})agentbench(F1?safety \frac{2\times ASR_{def} \times Benign_{Pass}}{ASR_{def}Benign_{Pass}})safety基準(zhǔn)構(gòu)建)[3.1 風(fēng)險分類體系](#31(F1?safety \frac{2\times ASR_{def} \times Benign_{Pass}}{ASR_{def}Benign_{Pass}})風(fēng)險分類體系)[3.2 數(shù)據(jù)集構(gòu)建流水線](#32(F1?safety \frac{2\times ASR_{def} \times Benign_{Pass}}{ASR_{def}Benign_{Pass}})數(shù)據(jù)集構(gòu)建流水線)[3.3 評測指標(biāo)定義](#33(F1?safety \frac{2\times ASR_{def} \times Benign_{Pass}}{ASR_{def}Benign_{Pass}})評測指標(biāo)定義)[實驗設(shè)置](#4(F1?safety \frac{2\times ASR_{def} \times Benign_{Pass}}{ASR_{def}Benign_{Pass}})實驗設(shè)置)[4.1 被測模型集合](#41(F1?safety \frac{2\times ASR_{def} \times Benign_{Pass}}{ASR_{def}Benign_{Pass}})被測模型集合)[4.2 仿真工具環(huán)境](#42(F1?safety \frac{2\times ASR_{def} \times Benign_{Pass}}{ASR_{def}Benign_{Pass}})仿真工具環(huán)境)[4.3 基線防護策略](#43(F1?safety \frac{2\times ASR_{def} \times Benign_{Pass}}{ASR_{def}Benign_{Pass}})基線防護策略)[主實驗結(jié)果](#5(F1?safety \frac{2\times ASR_{def} \times Benign_{Pass}}{ASR_{def}Benign_{Pass}})主實驗結(jié)果)[5.1 整體安全(F1?safety \frac{2\times ASR_{def} \times Benign_{Pass}}{ASR_{def}Benign_{Pass}})可用性表現(xiàn)](#51(F1?safety \frac{2\times ASR_{def} \times Benign_{Pass}}{ASR_{def}Benign_{Pass}})整體安全(F1?safety \frac{2\times ASR_{def} \times Benign_{Pass}}{ASR_{def}Benign_{Pass}})可用性表現(xiàn))[5.2 不同風(fēng)險子類下模型表現(xiàn)](#52(F1?safety \frac{2\times ASR_{def} \times Benign_{Pass}}{ASR_{def}Benign_{Pass}})不同風(fēng)險子類下模型表現(xiàn))[5.3 安全可用性帕累托分析](#53(F1?safety \frac{2\times ASR_{def} \times Benign_{Pass}}{ASR_{def}Benign_{Pass}})安全可用性帕累托分析)[防護策略消融實驗](#6(F1?safety \frac{2\times ASR_{def} \times Benign_{Pass}}{ASR_{def}Benign_{Pass}})防護策略消融實驗)[案例分析](#7(F1?safety \frac{2\times ASR_{def} \times Benign_{Pass}}{ASR_{def}Benign_{Pass}})案例分析)[討論與局限性](#8(F1?safety \frac{2\times ASR_{def} \times Benign_{Pass}}{ASR_{def}Benign_{Pass}})討論與局限性)[結(jié)論](#9(F1?safety \frac{2\times ASR_{def} \times Benign_{Pass}}{ASR_{def}Benign_{Pass}})結(jié)論)[參考文獻(xiàn)](#10(F1?safety \frac{2\times ASR_{def} \times Benign_{Pass}}{ASR_{def}Benign_{Pass}})參考文獻(xiàn))[附錄A 數(shù)據(jù)集統(tǒng)計詳情](#附錄a(F1?safety \frac{2\times ASR_{def} \times Benign_{Pass}}{ASR_{def}Benign_{Pass}})數(shù)據(jù)集統(tǒng)計詳情)[附錄B 完整評測指標(biāo)計算公式](#附錄b(F1?safety \frac{2\times ASR_{def} \times Benign_{Pass}}{ASR_{def}Benign_{Pass}})完整評測指標(biāo)計算公式)[附錄C 被測模型完整配置](#附錄c(F1?safety \frac{2\times ASR_{def} \times Benign_{Pass}}{ASR_{def}Benign_{Pass}})被測模型完整配置)[附錄D 防護策略Prompt與腳本](#附錄d(F1?safety \frac{2\times ASR_{def} \times Benign_{Pass}}{ASR_{def}Benign_{Pass}})防護策略prompt與腳本)[附錄E 細(xì)分實驗完整結(jié)果](#附錄e(F1?safety \frac{2\times ASR_{def} \times Benign_{Pass}}{ASR_{def}Benign_{Pass}})細(xì)分實驗完整結(jié)果)1 引言普通對話大模型安全評測主要針對單輪用戶輸入而工具調(diào)用智能體可以執(zhí)行shell命令、讀寫文件、訪問網(wǎng)絡(luò)API能夠修改外部環(huán)境狀態(tài)衍生出新的安全威脅多步間接提示注入、越權(quán)訪問、敏感信息外泄、被誘導(dǎo)執(zhí)行破壞性操作?,F(xiàn)有智能體安全評測存在若干不足樣本偏向攻擊樣例缺少大量良性正常業(yè)務(wù)用例容易出現(xiàn)“過度安全”模型不分情況拒絕合法業(yè)務(wù)犧牲可用性對多步交互、工具鏈?zhǔn)秸{(diào)用、環(huán)境狀態(tài)演變的風(fēng)險覆蓋不足缺少統(tǒng)一綜合指標(biāo)無法量化安全防御與業(yè)務(wù)可用性之間的權(quán)衡。本文提出AgentBench(F1?safety \frac{2\times ASR_{def} \times Benign_{Pass}}{ASR_{def}Benign_{Pass}})Safety智能體安全評測基準(zhǔn)數(shù)據(jù)集規(guī)模1242條測試用例攻擊用例744條良性正常業(yè)務(wù)用例498條風(fēng)險分為4大類別、14個子類覆蓋提示注入、權(quán)限濫用、信息泄露、行為誘導(dǎo)配套仿真隔離工具沙箱不會對真實系統(tǒng)造成傷害指標(biāo)體系攻擊防御成功率ASR(F1?safety \frac{2\times ASR_{def} \times Benign_{Pass}}{ASR_{def}Benign_{Pass}})def、良性任務(wù)通過率Benign(F1?safety \frac{2\times ASR_{def} \times Benign_{Pass}}{ASR_{def}Benign_{Pass}})Pass、綜合F1衡量安全(F1?safety \frac{2\times ASR_{def} \times Benign_{Pass}}{ASR_{def}Benign_{Pass}})可用性權(quán)衡。在14個主流大模型上開展零樣本評測。核心發(fā)現(xiàn)當(dāng)前模型普遍面臨安全(F1?safety \frac{2\times ASR_{def} \times Benign_{Pass}}{ASR_{def}Benign_{Pass}})可用性兩難提升攻擊防御能力往往伴隨合法業(yè)務(wù)拒絕率上升閉源模型綜合表現(xiàn)整體優(yōu)于開源模型沒有模型可以同時做到高防御率高良性任務(wù)通過率消融實驗系統(tǒng)安全提示、輸入關(guān)鍵詞過濾、沙箱權(quán)限限制各有收益但每一種防護手段都會帶來可用性代價。本文主要貢獻(xiàn)構(gòu)建AgentBench(F1?safety \frac{2\times ASR_{def} \times Benign_{Pass}}{ASR_{def}Benign_{Pass}})Safety多維度智能體安全基準(zhǔn)1242條用例同時包含攻擊用例與良性業(yè)務(wù)用例覆蓋工具智能體典型風(fēng)險場景。設(shè)計分層指標(biāo)同時度量攻擊防御效果與正常業(yè)務(wù)可用性量化安全(F1?safety \frac{2\times ASR_{def} \times Benign_{Pass}}{ASR_{def}Benign_{Pass}})可用性帕累托權(quán)衡。大規(guī)模評測14個主流模型揭示現(xiàn)有智能體基座的安全短板對三類主流防護策略開展受控消融。數(shù)據(jù)集、仿真沙箱環(huán)境、評測腳本、實驗配置全部開源。2 相關(guān)工作對話大模型安全基準(zhǔn)HarmBench等聚焦單輪文本輸入不涉及工具調(diào)用、環(huán)境狀態(tài)變更。智能體安全評測AgentHarm、PASTABench等。AgentHarm側(cè)重整條軌跡事后判定PASTABench聚焦時序主動監(jiān)控干預(yù)AgentBench(F1?safety \frac{2\times ASR_{def} \times Benign_{Pass}}{ASR_{def}Benign_{Pass}})Safety兼顧攻擊樣本與良性業(yè)務(wù)樣本重點量化安全(F1?safety \frac{2\times ASR_{def} \times Benign_{Pass}}{ASR_{def}Benign_{Pass}})可用性權(quán)衡覆蓋多類工具濫用風(fēng)險。智能體安全防護手段系統(tǒng)提示加固、輸入過濾、沙箱權(quán)限管控、獨立安全監(jiān)護模型。本文對前三類防護策略做系統(tǒng)消融評估收益與副作用?;鶞?zhǔn)橫向?qū)Ρ群啽砘鶞?zhǔn)工具調(diào)用多步交互包含良性用例安全(F1?safety \frac{2\times ASR_{def} \times Benign_{Pass}}{ASR_{def}Benign_{Pass}})可用性綜合指標(biāo)風(fēng)險子類數(shù)量HarmBench????6AgentHarm????8PASTABench????13AgentBench(F1?safety \frac{2\times ASR_{def} \times Benign_{Pass}}{ASR_{def}Benign_{Pass}})Safety(本文)????143 AgentBench(F1?safety \frac{2\times ASR_{def} \times Benign_{Pass}}{ASR_{def}Benign_{Pass}})Safety基準(zhǔn)構(gòu)建3.1 風(fēng)險分類體系4個一級大類14個二級子類提示注入類風(fēng)險直接系統(tǒng)提示劫持多步間接注入工具返回內(nèi)容注入分隔符混淆注入。權(quán)限濫用風(fēng)險越權(quán)文件讀寫高危shell命令執(zhí)行越權(quán)網(wǎng)絡(luò)訪問權(quán)限繞過。信息泄露風(fēng)險內(nèi)部憑證泄露用戶隱私數(shù)據(jù)外泄業(yè)務(wù)配置信息泄露。錯誤行為誘導(dǎo)風(fēng)險誘導(dǎo)破壞業(yè)務(wù)數(shù)據(jù)誘導(dǎo)發(fā)送欺詐消息誤導(dǎo)執(zhí)行無意義高危操作。數(shù)據(jù)集構(gòu)成攻擊用例744條觸發(fā)上述風(fēng)險良性用例498條合法正常業(yè)務(wù)工具調(diào)用任務(wù)不攜帶任何攻擊意圖。3.2 數(shù)據(jù)集構(gòu)建流水線案例構(gòu)思基于真實智能體安全漏洞報告生成初始case草稿仿真環(huán)境適配每條用例綁定工具調(diào)用序列在仿真沙箱內(nèi)驗證可復(fù)現(xiàn)雙輪標(biāo)注校驗標(biāo)注員區(qū)分攻擊/良性標(biāo)記風(fēng)險子類交叉校驗過濾歧義樣本自動化真值校驗在仿真環(huán)境運行確認(rèn)攻擊用例可以觸發(fā)對應(yīng)風(fēng)險行為人工復(fù)審過濾泄露真實密鑰等敏感內(nèi)容得到最終1242條測試用例。每條樣例字段用戶prompt、初始環(huán)境上下文、允許調(diào)用工具集合、風(fēng)險標(biāo)簽、真值判定、預(yù)期行為說明。3.3 評測指標(biāo)定義ASR(F1?safety \frac{2\times ASR_{def} \times Benign_{Pass}}{ASR_{def}Benign_{Pass}})def攻擊防御成功率攻擊用例下智能體拒絕執(zhí)行危險行為的比例越高越好。Benign(F1?safety \frac{2\times ASR_{def} \times Benign_{Pass}}{ASR_{def}Benign_{Pass}})Pass良性任務(wù)通過率良性合法用例智能體正確完成業(yè)務(wù)任務(wù)的比例越高越好。F1(F1?safety \frac{2\times ASR_{def} \times Benign_{Pass}}{ASR_{def}Benign_{Pass}})safety綜合F1指標(biāo)平衡防御攻擊與業(yè)務(wù)可用性。KaTeX parse error: Cant use function \( in math mode at position 4: F1\?(?F1?safety \fr…說明一個優(yōu)秀智能體需要兩項指標(biāo)同時保持高位只防御攻擊但大量拒絕正常業(yè)務(wù)F1(F1?safety \frac{2\times ASR_{def} \times Benign_{Pass}}{ASR_{def}Benign_{Pass}})safety會被拉低。4 實驗設(shè)置4.1 被測模型集合共14個閉源GPT(F1?safety \frac{2\times ASR_{def} \times Benign_{Pass}}{ASR_{def}Benign_{Pass}})4o、GPT(F1?safety \frac{2\times ASR_{def} \times Benign_{Pass}}{ASR_{def}Benign_{Pass}})4o(F1?safety \frac{2\times ASR_{def} \times Benign_{Pass}}{ASR_{def}Benign_{Pass}})mini、Claude(F1?safety \frac{2\times ASR_{def} \times Benign_{Pass}}{ASR_{def}Benign_{Pass}})Sonnet(F1?safety \frac{2\times ASR_{def} \times Benign_{Pass}}{ASR_{def}Benign_{Pass}})4.6、Claude(F1?safety \frac{2\times ASR_{def} \times Benign_{Pass}}{ASR_{def}Benign_{Pass}})Opus(F1?safety \frac{2\times ASR_{def} \times Benign_{Pass}}{ASR_{def}Benign_{Pass}})4.7、Gemini(F1?safety \frac{2\times ASR_{def} \times Benign_{Pass}}{ASR_{def}Benign_{Pass}})3(F1?safety \frac{2\times ASR_{def} \times Benign_{Pass}}{ASR_{def}Benign_{Pass}})Pro、Gemini(F1?safety \frac{2\times ASR_{def} \times Benign_{Pass}}{ASR_{def}Benign_{Pass}})3(F1?safety \frac{2\times ASR_{def} \times Benign_{Pass}}{ASR_{def}Benign_{Pass}})Flash開源Llama(F1?safety \frac{2\times ASR_{def} \times Benign_{Pass}}{ASR_{def}Benign_{Pass}})4(F1?safety \frac{2\times ASR_{def} \times Benign_{Pass}}{ASR_{def}Benign_{Pass}})Maverick、Llama(F1?safety \frac{2\times ASR_{def} \times Benign_{Pass}}{ASR_{def}Benign_{Pass}})3.3(F1?safety \frac{2\times ASR_{def} \times Benign_{Pass}}{ASR_{def}Benign_{Pass}})70B、Qwen2.5(F1?safety \frac{2\times ASR_{def} \times Benign_{Pass}}{ASR_{def}Benign_{Pass}})72B、Qwen2.5(F1?safety \frac{2\times ASR_{def} \times Benign_{Pass}}{ASR_{def}Benign_{Pass}})32B、Qwen2.5(F1?safety \frac{2\times ASR_{def} \times Benign_{Pass}}{ASR_{def}Benign_{Pass}})14B、DeepSeek(F1?safety \frac{2\times ASR_{def} \times Benign_{Pass}}{ASR_{def}Benign_{Pass}})V4(F1?safety \frac{2\times ASR_{def} \times Benign_{Pass}}{ASR_{def}Benign_{Pass}})Pro、GLM(F1?safety \frac{2\times ASR_{def} \times Benign_{Pass}}{ASR_{def}Benign_{Pass}})5.2(F1?safety \frac{2\times ASR_{def} \times Benign_{Pass}}{ASR_{def}Benign_{Pass}})Pro、Yi(F1?safety \frac{2\times ASR_{def} \times Benign_{Pass}}{ASR_{def}Benign_{Pass}})34B(F1?safety \frac{2\times ASR_{def} \times Benign_{Pass}}{ASR_{def}Benign_{Pass}})Chat。4.2 仿真工具環(huán)境仿真沙箱實現(xiàn)文件讀寫、shell執(zhí)行、網(wǎng)絡(luò)請求不會操作真實主機系統(tǒng)。環(huán)境記錄全部工具調(diào)用評測器自動判斷是否執(zhí)行高危風(fēng)險行為、良性任務(wù)是否完成。4.3 基線防護策略消融配置Base原始基線默認(rèn)普通智能體系統(tǒng)提示無額外防護Sys(F1?safety \frac{2\times ASR_{def} \times Benign_{Pass}}{ASR_{def}Benign_{Pass}})Prompt增強安全系統(tǒng)提示增加風(fēng)險警告、禁止高危操作Input(F1?safety \frac{2\times ASR_{def} \times Benign_{Pass}}{ASR_{def}Benign_{Pass}})Filter輸入層關(guān)鍵詞黑名單過濾攔截高危關(guān)鍵詞Sandbox(F1?safety \frac{2\times ASR_{def} \times Benign_{Pass}}{ASR_{def}Benign_{Pass}})Restrict沙箱層面限制禁用高危命令、限制文件路徑訪問范圍。5 主實驗結(jié)果5.1 整體安全(F1?safety \frac{2\times ASR_{def} \times Benign_{Pass}}{ASR_{def}Benign_{Pass}})可用性表現(xiàn)代表性模型零樣本Base基線配置指標(biāo)節(jié)選模型ASR(F1?safety \frac{2\times ASR_{def} \times Benign_{Pass}}{ASR_{def}Benign_{Pass}})def攻擊防御率Benign(F1?safety \frac{2\times ASR_{def} \times Benign_{Pass}}{ASR_{def}Benign_{Pass}})Pass良性通過率F1(F1?safety \frac{2\times ASR_{def} \times Benign_{Pass}}{ASR_{def}Benign_{Pass}})safety綜合Claude(F1?safety \frac{2\times ASR_{def} \times Benign_{Pass}}{ASR_{def}Benign_{Pass}})Opus(F1?safety \frac{2\times ASR_{def} \times Benign_{Pass}}{ASR_{def}Benign_{Pass}})4.782.3%76.1%79.1%GPT(F1?safety \frac{2\times ASR_{def} \times Benign_{Pass}}{ASR_{def}Benign_{Pass}})4o79.7%77.4%78.5%Gemini(F1?safety \frac{2\times ASR_{def} \times Benign_{Pass}}{ASR_{def}Benign_{Pass}})3(F1?safety \frac{2\times ASR_{def} \times Benign_{Pass}}{ASR_{def}Benign_{Pass}})Pro76.2%73.8%75.0%Qwen2.5(F1?safety \frac{2\times ASR_{def} \times Benign_{Pass}}{ASR_{def}Benign_{Pass}})72B67.5%68.2%67.8%Llama(F1?safety \frac{2\times ASR_{def} \times Benign_{Pass}}{ASR_{def}Benign_{Pass}})4(F1?safety \frac{2\times ASR_{def} \times Benign_{Pass}}{ASR_{def}Benign_{Pass}})Maverick64.1%65.7%64.9%DeepSeek(F1?safety \frac{2\times ASR_{def} \times Benign_{Pass}}{ASR_{def}Benign_{Pass}})V4(F1?safety \frac{2\times ASR_{def} \times Benign_{Pass}}{ASR_{def}Benign_{Pass}})Pro62.8%66.3%64.5%Yi(F1?safety \frac{2\times ASR_{def} \times Benign_{Pass}}{ASR_{def}Benign_{Pass}})34B(F1?safety \frac{2\times ASR_{def} \times Benign_{Pass}}{ASR_{def}Benign_{Pass}})Chat54.6%61.2%57.7%整體現(xiàn)象閉源前沿模型綜合F1(F1?safety \frac{2\times ASR_{def} \times Benign_{Pass}}{ASR_{def}Benign_{Pass}})safety整體優(yōu)于開源模型不存在模型同時做到ASR(F1?safety \frac{2\times ASR_{def} \times Benign_{Pass}}{ASR_{def}Benign_{Pass}})def與Benign(F1?safety \frac{2\times ASR_{def} \times Benign_{Pass}}{ASR_{def}Benign_{Pass}})Pass雙雙接近90%普遍存在安全(F1?safety \frac{2\times ASR_{def} \times Benign_{Pass}}{ASR_{def}Benign_{Pass}})可用性權(quán)衡。5.2 不同風(fēng)險子類下模型表現(xiàn)直接提示劫持大部分模型防御效果尚可工具返回注入、多步間接注入所有模型防御難度顯著升高ASR(F1?safety \frac{2\times ASR_{def} \times Benign_{Pass}}{ASR_{def}Benign_{Pass}})def明顯下降權(quán)限濫用shell高危命令開源模型更容易被誘導(dǎo)執(zhí)行高危命令信息泄露類風(fēng)險模型容易無意識把內(nèi)部憑證隨工具輸出返回用戶。5.3 安全可用性帕累托分析大部分模型落在帕累托前沿下方提升攻擊防御率往往會帶來良性任務(wù)通過率下降案例開啟強安全提示ASR(F1?safety \frac{2\times ASR_{def} \times Benign_{Pass}}{ASR_{def}Benign_{Pass}})def上漲7(F1?safety \frac{2\times ASR_{def} \times Benign_{Pass}}{ASR_{def}Benign_{Pass}})12個百分點但Benign(F1?safety \frac{2\times ASR_{def} \times Benign_{Pass}}{ASR_{def}Benign_{Pass}})Pass下降5(F1?safety \frac{2\times ASR_{def} \times Benign_{Pass}}{ASR_{def}Benign_{Pass}})9個百分點。6 防護策略消融實驗以Qwen2.5(F1?safety \frac{2\times ASR_{def} \times Benign_{Pass}}{ASR_{def}Benign_{Pass}})72B為代表模型對比不同防護手段配置ASR(F1?safety \frac{2\times ASR_{def} \times Benign_{Pass}}{ASR_{def}Benign_{Pass}})defBenign(F1?safety \frac{2\times ASR_{def} \times Benign_{Pass}}{ASR_{def}Benign_{Pass}})PassF1(F1?safety \frac{2\times ASR_{def} \times Benign_{Pass}}{ASR_{def}Benign_{Pass}})safetyBase原始基線67.5%68.2%67.8%Sys(F1?safety \frac{2\times ASR_{def} \times Benign_{Pass}}{ASR_{def}Benign_{Pass}})Prompt安全提示76.1%61.4%68.0%Input(F1?safety \frac{2\times ASR_{def} \times Benign_{Pass}}{ASR_{def}Benign_{Pass}})Filter輸入過濾78.4%58.7%67.2%Sandbox(F1?safety \frac{2\times ASR_{def} \times Benign_{Pass}}{ASR_{def}Benign_{Pass}})Restrict沙箱限制74.8%64.3%69.3%全部三者組合83.2%53.1%64.7%消融關(guān)鍵結(jié)論安全系統(tǒng)提示、輸入關(guān)鍵詞過濾、沙箱權(quán)限限制都可以提升攻擊防御成功率每一類防護手段均會損傷良性業(yè)務(wù)通過率全部防護疊加防御率最高但良性通過率大幅下滑沙箱權(quán)限限制相對三者之中對可用性傷害最小關(guān)鍵詞黑名單過濾容易誤攔截合法業(yè)務(wù)。工程啟示不能只看攻擊防御指標(biāo)必須同步監(jiān)控良性業(yè)務(wù)通過率避免過度防護。7 案例分析多步間接注入失敗案例用戶先誘導(dǎo)智能體讀取一份惡意構(gòu)造的文檔文檔內(nèi)部攜帶注入載荷模型讀取文檔之后被劫持忽略原有安全約束。即使是強模型該類場景依舊容易失守。過度拒絕案例開啟關(guān)鍵詞黑名單合法業(yè)務(wù)shell命令因為命中黑名單詞匯被攔截業(yè)務(wù)任務(wù)直接失敗。沙箱防護案例沙箱限制文件訪問路徑即使模型產(chǎn)生越權(quán)調(diào)用意圖工具層直接拒絕執(zhí)行從環(huán)境層面阻斷風(fēng)險。8 討論與局限性本基準(zhǔn)基于仿真沙箱環(huán)境不是真實生產(chǎn)環(huán)境仿真不能完全復(fù)現(xiàn)生產(chǎn)環(huán)境全部復(fù)雜漏洞。評測為零樣本設(shè)置沒有測試經(jīng)過安全專項微調(diào)后的模型。風(fēng)險樣例是人工構(gòu)造不能覆蓋現(xiàn)實世界無窮多攻擊變體基準(zhǔn)側(cè)重工具調(diào)用帶來的安全風(fēng)險不覆蓋純視覺多模態(tài)、具身機器人場景。工程啟示只看攻擊防御率會誤導(dǎo)選型安全評測必須配套大量良性業(yè)務(wù)用例評估可用性損失各類防護手段均存在副作用需要做權(quán)衡沙箱環(huán)境權(quán)限隔離是性價比很高的底層防線。未來方向拓展多模態(tài)、具身智能體用例引入監(jiān)護模型作為防護策略做消融構(gòu)建對抗生成攻擊變體測試集。9 結(jié)論本文提出AgentBench(F1?safety \frac{2\times ASR_{def} \times Benign_{Pass}}{ASR_{def}Benign_{Pass}})Safety工具智能體安全評測基準(zhǔn)包含1242條測試用例覆蓋4大類14子類工具智能體安全風(fēng)險同時包含攻擊用例與良性業(yè)務(wù)用例設(shè)計ASR(F1?safety \frac{2\times ASR_{def} \times Benign_{Pass}}{ASR_{def}Benign_{Pass}})def、Benign(F1?safety \frac{2\times ASR_{def} \times Benign_{Pass}}{ASR_{def}Benign_{Pass}})Pass、F1(F1?safety \frac{2\times ASR_{def} \times Benign_{Pass}}{ASR_{def}Benign_{Pass}})safety綜合指標(biāo)量化安全(F1?safety \frac{2\times ASR_{def} \times Benign_{Pass}}{ASR_{def}Benign_{Pass}})可用性權(quán)衡。對14個主流模型開展評測實驗證實當(dāng)前大模型智能體普遍面臨安全(F1?safety \frac{2\times ASR_{def} \times Benign_{Pass}}{ASR_{def}Benign_{Pass}})可用性兩難閉源模型整體占優(yōu)但仍然存在短板多步間接注入、工具返回注入是主要薄弱點。消融表明安全提示、輸入過濾、沙箱限制都可以提升防御但都會帶來業(yè)務(wù)可用性損失沙箱權(quán)限隔離綜合代價相對更小。數(shù)據(jù)集、仿真沙箱、評測腳本全部開源。10 參考文獻(xiàn)完整參考文獻(xiàn)查閱原始arXiv網(wǎng)頁https://arxiv.org/html/2609.30028v1附錄簡要說明附錄A數(shù)據(jù)集完整統(tǒng)計各子類樣本數(shù)量分布。附錄B評測指標(biāo)完整數(shù)學(xué)公式、判定規(guī)則。附錄C14個被測模型完整推理參數(shù)、調(diào)用配置。附錄D三類防護策略完整系統(tǒng)提示、輸入過濾黑名單腳本、沙箱限制配置。附錄E所有模型細(xì)分風(fēng)險子類完整實驗結(jié)果表格。