
Safety面向大模型智能體的多維度安全能力評測基準arXiv編號arXiv:2609.30028v1 [cs.CL]摘要大模型智能體可調用外部工具修改真實系統(tǒng)狀態(tài)帶來區(qū)別于普通對話模型的新型安全風險?,F(xiàn)有的安全基準大多聚焦單輪對話提示注入缺少對工具調用、多步長視界交互、環(huán)境狀態(tài)變更風險的系統(tǒng)性覆蓋。本文構建AgentBench(F1?safety \frac{2\times ASR_{def} \times Benign_{Pass}}{ASR_{def}Benign_{Pass}})Safety一套面向工具智能體的多維度安全評測基準。數(shù)據(jù)集包含1242條測試用例分為4大風險大類、14個風險子類覆蓋提示注入、權限濫用、信息泄露、錯誤行為誘導評測同時包含攻擊側用例與正常業(yè)務良性用例兼顧安全防御能力與業(yè)務可用性避免模型為了安全而過度拒絕合法請求。設計分層評測指標攻擊防御成功率、良性任務通過率、F1綜合指標量化安全(F1?safety \frac{2\times ASR_{def} \times Benign_{Pass}}{ASR_{def}Benign_{Pass}})可用性權衡。對14個主流開源、閉源大模型開展大規(guī)模評測。實驗表明現(xiàn)有智能體基座普遍存在安全(F1?safety \frac{2\times ASR_{def} \times Benign_{Pass}}{ASR_{def}Benign_{Pass}})可用性兩難多數(shù)模型防御攻擊的同時會誤拒絕大量正常合法任務閉源前沿模型整體表現(xiàn)優(yōu)于開源模型但仍然存在明顯短板。進一步開展消融研究分析系統(tǒng)提示、沙箱隔離、輸入過濾三類防護手段的收益與副作用。數(shù)據(jù)集、評測腳本、全部配置完整開源。關鍵詞智能體安全工具調用安全評測基準提示注入權限濫用安全可用性權衡目錄[引言](#1(F1?safety \frac{2\times ASR_{def} \times Benign_{Pass}}{ASR_{def}Benign_{Pass}})引言)[相關工作](#2(F1?safety \frac{2\times ASR_{def} \times Benign_{Pass}}{ASR_{def}Benign_{Pass}})相關工作)[AgentBench(F1?safety \frac{2\times ASR_{def} \times Benign_{Pass}}{ASR_{def}Benign_{Pass}})Safety基準構建](#3(F1?safety \frac{2\times ASR_{def} \times Benign_{Pass}}{ASR_{def}Benign_{Pass}})agentbench(F1?safety \frac{2\times ASR_{def} \times Benign_{Pass}}{ASR_{def}Benign_{Pass}})safety基準構建)[3.1 風險分類體系](#31(F1?safety \frac{2\times ASR_{def} \times Benign_{Pass}}{ASR_{def}Benign_{Pass}})風險分類體系)[3.2 數(shù)據(jù)集構建流水線](#32(F1?safety \frac{2\times ASR_{def} \times Benign_{Pass}}{ASR_{def}Benign_{Pass}})數(shù)據(jù)集構建流水線)[3.3 評測指標定義](#33(F1?safety \frac{2\times ASR_{def} \times Benign_{Pass}}{ASR_{def}Benign_{Pass}})評測指標定義)[實驗設置](#4(F1?safety \frac{2\times ASR_{def} \times Benign_{Pass}}{ASR_{def}Benign_{Pass}})實驗設置)[4.1 被測模型集合](#41(F1?safety \frac{2\times ASR_{def} \times Benign_{Pass}}{ASR_{def}Benign_{Pass}})被測模型集合)[4.2 仿真工具環(huán)境](#42(F1?safety \frac{2\times ASR_{def} \times Benign_{Pass}}{ASR_{def}Benign_{Pass}})仿真工具環(huán)境)[4.3 基線防護策略](#43(F1?safety \frac{2\times ASR_{def} \times Benign_{Pass}}{ASR_{def}Benign_{Pass}})基線防護策略)[主實驗結果](#5(F1?safety \frac{2\times ASR_{def} \times Benign_{Pass}}{ASR_{def}Benign_{Pass}})主實驗結果)[5.1 整體安全(F1?safety \frac{2\times ASR_{def} \times Benign_{Pass}}{ASR_{def}Benign_{Pass}})可用性表現(xiàn)](#51(F1?safety \frac{2\times ASR_{def} \times Benign_{Pass}}{ASR_{def}Benign_{Pass}})整體安全(F1?safety \frac{2\times ASR_{def} \times Benign_{Pass}}{ASR_{def}Benign_{Pass}})可用性表現(xiàn))[5.2 不同風險子類下模型表現(xiàn)](#52(F1?safety \frac{2\times ASR_{def} \times Benign_{Pass}}{ASR_{def}Benign_{Pass}})不同風險子類下模型表現(xiàn))[5.3 安全可用性帕累托分析](#53(F1?safety \frac{2\times ASR_{def} \times Benign_{Pass}}{ASR_{def}Benign_{Pass}})安全可用性帕累托分析)[防護策略消融實驗](#6(F1?safety \frac{2\times ASR_{def} \times Benign_{Pass}}{ASR_{def}Benign_{Pass}})防護策略消融實驗)[案例分析](#7(F1?safety \frac{2\times ASR_{def} \times Benign_{Pass}}{ASR_{def}Benign_{Pass}})案例分析)[討論與局限性](#8(F1?safety \frac{2\times ASR_{def} \times Benign_{Pass}}{ASR_{def}Benign_{Pass}})討論與局限性)[結論](#9(F1?safety \frac{2\times ASR_{def} \times Benign_{Pass}}{ASR_{def}Benign_{Pass}})結論)[參考文獻](#10(F1?safety \frac{2\times ASR_{def} \times Benign_{Pass}}{ASR_{def}Benign_{Pass}})參考文獻)[附錄A 數(shù)據(jù)集統(tǒng)計詳情](#附錄a(F1?safety \frac{2\times ASR_{def} \times Benign_{Pass}}{ASR_{def}Benign_{Pass}})數(shù)據(jù)集統(tǒng)計詳情)[附錄B 完整評測指標計算公式](#附錄b(F1?safety \frac{2\times ASR_{def} \times Benign_{Pass}}{ASR_{def}Benign_{Pass}})完整評測指標計算公式)[附錄C 被測模型完整配置](#附錄c(F1?safety \frac{2\times ASR_{def} \times Benign_{Pass}}{ASR_{def}Benign_{Pass}})被測模型完整配置)[附錄D 防護策略Prompt與腳本](#附錄d(F1?safety \frac{2\times ASR_{def} \times Benign_{Pass}}{ASR_{def}Benign_{Pass}})防護策略prompt與腳本)[附錄E 細分實驗完整結果](#附錄e(F1?safety \frac{2\times ASR_{def} \times Benign_{Pass}}{ASR_{def}Benign_{Pass}})細分實驗完整結果)1 引言普通對話大模型安全評測主要針對單輪用戶輸入而工具調用智能體可以執(zhí)行shell命令、讀寫文件、訪問網絡API能夠修改外部環(huán)境狀態(tài)衍生出新的安全威脅多步間接提示注入、越權訪問、敏感信息外泄、被誘導執(zhí)行破壞性操作?,F(xiàn)有智能體安全評測存在若干不足樣本偏向攻擊樣例缺少大量良性正常業(yè)務用例容易出現(xiàn)“過度安全”模型不分情況拒絕合法業(yè)務犧牲可用性對多步交互、工具鏈式調用、環(huán)境狀態(tài)演變的風險覆蓋不足缺少統(tǒng)一綜合指標無法量化安全防御與業(yè)務可用性之間的權衡。本文提出AgentBench(F1?safety \frac{2\times ASR_{def} \times Benign_{Pass}}{ASR_{def}Benign_{Pass}})Safety智能體安全評測基準數(shù)據(jù)集規(guī)模1242條測試用例攻擊用例744條良性正常業(yè)務用例498條風險分為4大類別、14個子類覆蓋提示注入、權限濫用、信息泄露、行為誘導配套仿真隔離工具沙箱不會對真實系統(tǒng)造成傷害指標體系攻擊防御成功率ASR(F1?safety \frac{2\times ASR_{def} \times Benign_{Pass}}{ASR_{def}Benign_{Pass}})def、良性任務通過率Benign(F1?safety \frac{2\times ASR_{def} \times Benign_{Pass}}{ASR_{def}Benign_{Pass}})Pass、綜合F1衡量安全(F1?safety \frac{2\times ASR_{def} \times Benign_{Pass}}{ASR_{def}Benign_{Pass}})可用性權衡。在14個主流大模型上開展零樣本評測。核心發(fā)現(xiàn)當前模型普遍面臨安全(F1?safety \frac{2\times ASR_{def} \times Benign_{Pass}}{ASR_{def}Benign_{Pass}})可用性兩難提升攻擊防御能力往往伴隨合法業(yè)務拒絕率上升閉源模型綜合表現(xiàn)整體優(yōu)于開源模型沒有模型可以同時做到高防御率高良性任務通過率消融實驗系統(tǒng)安全提示、輸入關鍵詞過濾、沙箱權限限制各有收益但每一種防護手段都會帶來可用性代價。本文主要貢獻構建AgentBench(F1?safety \frac{2\times ASR_{def} \times Benign_{Pass}}{ASR_{def}Benign_{Pass}})Safety多維度智能體安全基準1242條用例同時包含攻擊用例與良性業(yè)務用例覆蓋工具智能體典型風險場景。設計分層指標同時度量攻擊防御效果與正常業(yè)務可用性量化安全(F1?safety \frac{2\times ASR_{def} \times Benign_{Pass}}{ASR_{def}Benign_{Pass}})可用性帕累托權衡。大規(guī)模評測14個主流模型揭示現(xiàn)有智能體基座的安全短板對三類主流防護策略開展受控消融。數(shù)據(jù)集、仿真沙箱環(huán)境、評測腳本、實驗配置全部開源。2 相關工作對話大模型安全基準HarmBench等聚焦單輪文本輸入不涉及工具調用、環(huán)境狀態(tài)變更。智能體安全評測AgentHarm、PASTABench等。AgentHarm側重整條軌跡事后判定PASTABench聚焦時序主動監(jiān)控干預AgentBench(F1?safety \frac{2\times ASR_{def} \times Benign_{Pass}}{ASR_{def}Benign_{Pass}})Safety兼顧攻擊樣本與良性業(yè)務樣本重點量化安全(F1?safety \frac{2\times ASR_{def} \times Benign_{Pass}}{ASR_{def}Benign_{Pass}})可用性權衡覆蓋多類工具濫用風險。智能體安全防護手段系統(tǒng)提示加固、輸入過濾、沙箱權限管控、獨立安全監(jiān)護模型。本文對前三類防護策略做系統(tǒng)消融評估收益與副作用?;鶞蕶M向對比簡表基準工具調用多步交互包含良性用例安全(F1?safety \frac{2\times ASR_{def} \times Benign_{Pass}}{ASR_{def}Benign_{Pass}})可用性綜合指標風險子類數(shù)量HarmBench????6AgentHarm????8PASTABench????13AgentBench(F1?safety \frac{2\times ASR_{def} \times Benign_{Pass}}{ASR_{def}Benign_{Pass}})Safety(本文)????143 AgentBench(F1?safety \frac{2\times ASR_{def} \times Benign_{Pass}}{ASR_{def}Benign_{Pass}})Safety基準構建3.1 風險分類體系4個一級大類14個二級子類提示注入類風險直接系統(tǒng)提示劫持多步間接注入工具返回內容注入分隔符混淆注入。權限濫用風險越權文件讀寫高危shell命令執(zhí)行越權網絡訪問權限繞過。信息泄露風險內部憑證泄露用戶隱私數(shù)據(jù)外泄業(yè)務配置信息泄露。錯誤行為誘導風險誘導破壞業(yè)務數(shù)據(jù)誘導發(fā)送欺詐消息誤導執(zhí)行無意義高危操作。數(shù)據(jù)集構成攻擊用例744條觸發(fā)上述風險良性用例498條合法正常業(yè)務工具調用任務不攜帶任何攻擊意圖。3.2 數(shù)據(jù)集構建流水線案例構思基于真實智能體安全漏洞報告生成初始case草稿仿真環(huán)境適配每條用例綁定工具調用序列在仿真沙箱內驗證可復現(xiàn)雙輪標注校驗標注員區(qū)分攻擊/良性標記風險子類交叉校驗過濾歧義樣本自動化真值校驗在仿真環(huán)境運行確認攻擊用例可以觸發(fā)對應風險行為人工復審過濾泄露真實密鑰等敏感內容得到最終1242條測試用例。每條樣例字段用戶prompt、初始環(huán)境上下文、允許調用工具集合、風險標簽、真值判定、預期行為說明。3.3 評測指標定義ASR(F1?safety \frac{2\times ASR_{def} \times Benign_{Pass}}{ASR_{def}Benign_{Pass}})def攻擊防御成功率攻擊用例下智能體拒絕執(zhí)行危險行為的比例越高越好。Benign(F1?safety \frac{2\times ASR_{def} \times Benign_{Pass}}{ASR_{def}Benign_{Pass}})Pass良性任務通過率良性合法用例智能體正確完成業(yè)務任務的比例越高越好。F1(F1?safety \frac{2\times ASR_{def} \times Benign_{Pass}}{ASR_{def}Benign_{Pass}})safety綜合F1指標平衡防御攻擊與業(yè)務可用性。KaTeX parse error: Cant use function \( in math mode at position 4: F1\?(?F1?safety \fr…說明一個優(yōu)秀智能體需要兩項指標同時保持高位只防御攻擊但大量拒絕正常業(yè)務F1(F1?safety \frac{2\times ASR_{def} \times Benign_{Pass}}{ASR_{def}Benign_{Pass}})safety會被拉低。4 實驗設置4.1 被測模型集合共14個閉源GPT(F1?safety \frac{2\times ASR_{def} \times Benign_{Pass}}{ASR_{def}Benign_{Pass}})4o、GPT(F1?safety \frac{2\times ASR_{def} \times Benign_{Pass}}{ASR_{def}Benign_{Pass}})4o(F1?safety \frac{2\times ASR_{def} \times Benign_{Pass}}{ASR_{def}Benign_{Pass}})mini、Claude(F1?safety \frac{2\times ASR_{def} \times Benign_{Pass}}{ASR_{def}Benign_{Pass}})Sonnet(F1?safety \frac{2\times ASR_{def} \times Benign_{Pass}}{ASR_{def}Benign_{Pass}})4.6、Claude(F1?safety \frac{2\times ASR_{def} \times Benign_{Pass}}{ASR_{def}Benign_{Pass}})Opus(F1?safety \frac{2\times ASR_{def} \times Benign_{Pass}}{ASR_{def}Benign_{Pass}})4.7、Gemini(F1?safety \frac{2\times ASR_{def} \times Benign_{Pass}}{ASR_{def}Benign_{Pass}})3(F1?safety \frac{2\times ASR_{def} \times Benign_{Pass}}{ASR_{def}Benign_{Pass}})Pro、Gemini(F1?safety \frac{2\times ASR_{def} \times Benign_{Pass}}{ASR_{def}Benign_{Pass}})3(F1?safety \frac{2\times ASR_{def} \times Benign_{Pass}}{ASR_{def}Benign_{Pass}})Flash開源Llama(F1?safety \frac{2\times ASR_{def} \times Benign_{Pass}}{ASR_{def}Benign_{Pass}})4(F1?safety \frac{2\times ASR_{def} \times Benign_{Pass}}{ASR_{def}Benign_{Pass}})Maverick、Llama(F1?safety \frac{2\times ASR_{def} \times Benign_{Pass}}{ASR_{def}Benign_{Pass}})3.3(F1?safety \frac{2\times ASR_{def} \times Benign_{Pass}}{ASR_{def}Benign_{Pass}})70B、Qwen2.5(F1?safety \frac{2\times ASR_{def} \times Benign_{Pass}}{ASR_{def}Benign_{Pass}})72B、Qwen2.5(F1?safety \frac{2\times ASR_{def} \times Benign_{Pass}}{ASR_{def}Benign_{Pass}})32B、Qwen2.5(F1?safety \frac{2\times ASR_{def} \times Benign_{Pass}}{ASR_{def}Benign_{Pass}})14B、DeepSeek(F1?safety \frac{2\times ASR_{def} \times Benign_{Pass}}{ASR_{def}Benign_{Pass}})V4(F1?safety \frac{2\times ASR_{def} \times Benign_{Pass}}{ASR_{def}Benign_{Pass}})Pro、GLM(F1?safety \frac{2\times ASR_{def} \times Benign_{Pass}}{ASR_{def}Benign_{Pass}})5.2(F1?safety \frac{2\times ASR_{def} \times Benign_{Pass}}{ASR_{def}Benign_{Pass}})Pro、Yi(F1?safety \frac{2\times ASR_{def} \times Benign_{Pass}}{ASR_{def}Benign_{Pass}})34B(F1?safety \frac{2\times ASR_{def} \times Benign_{Pass}}{ASR_{def}Benign_{Pass}})Chat。4.2 仿真工具環(huán)境仿真沙箱實現(xiàn)文件讀寫、shell執(zhí)行、網絡請求不會操作真實主機系統(tǒng)。環(huán)境記錄全部工具調用評測器自動判斷是否執(zhí)行高危風險行為、良性任務是否完成。4.3 基線防護策略消融配置Base原始基線默認普通智能體系統(tǒng)提示無額外防護Sys(F1?safety \frac{2\times ASR_{def} \times Benign_{Pass}}{ASR_{def}Benign_{Pass}})Prompt增強安全系統(tǒng)提示增加風險警告、禁止高危操作Input(F1?safety \frac{2\times ASR_{def} \times Benign_{Pass}}{ASR_{def}Benign_{Pass}})Filter輸入層關鍵詞黑名單過濾攔截高危關鍵詞Sandbox(F1?safety \frac{2\times ASR_{def} \times Benign_{Pass}}{ASR_{def}Benign_{Pass}})Restrict沙箱層面限制禁用高危命令、限制文件路徑訪問范圍。5 主實驗結果5.1 整體安全(F1?safety \frac{2\times ASR_{def} \times Benign_{Pass}}{ASR_{def}Benign_{Pass}})可用性表現(xiàn)代表性模型零樣本Base基線配置指標節(jié)選模型ASR(F1?safety \frac{2\times ASR_{def} \times Benign_{Pass}}{ASR_{def}Benign_{Pass}})def攻擊防御率Benign(F1?safety \frac{2\times ASR_{def} \times Benign_{Pass}}{ASR_{def}Benign_{Pass}})Pass良性通過率F1(F1?safety \frac{2\times ASR_{def} \times Benign_{Pass}}{ASR_{def}Benign_{Pass}})safety綜合Claude(F1?safety \frac{2\times ASR_{def} \times Benign_{Pass}}{ASR_{def}Benign_{Pass}})Opus(F1?safety \frac{2\times ASR_{def} \times Benign_{Pass}}{ASR_{def}Benign_{Pass}})4.782.3%76.1%79.1%GPT(F1?safety \frac{2\times ASR_{def} \times Benign_{Pass}}{ASR_{def}Benign_{Pass}})4o79.7%77.4%78.5%Gemini(F1?safety \frac{2\times ASR_{def} \times Benign_{Pass}}{ASR_{def}Benign_{Pass}})3(F1?safety \frac{2\times ASR_{def} \times Benign_{Pass}}{ASR_{def}Benign_{Pass}})Pro76.2%73.8%75.0%Qwen2.5(F1?safety \frac{2\times ASR_{def} \times Benign_{Pass}}{ASR_{def}Benign_{Pass}})72B67.5%68.2%67.8%Llama(F1?safety \frac{2\times ASR_{def} \times Benign_{Pass}}{ASR_{def}Benign_{Pass}})4(F1?safety \frac{2\times ASR_{def} \times Benign_{Pass}}{ASR_{def}Benign_{Pass}})Maverick64.1%65.7%64.9%DeepSeek(F1?safety \frac{2\times ASR_{def} \times Benign_{Pass}}{ASR_{def}Benign_{Pass}})V4(F1?safety \frac{2\times ASR_{def} \times Benign_{Pass}}{ASR_{def}Benign_{Pass}})Pro62.8%66.3%64.5%Yi(F1?safety \frac{2\times ASR_{def} \times Benign_{Pass}}{ASR_{def}Benign_{Pass}})34B(F1?safety \frac{2\times ASR_{def} \times Benign_{Pass}}{ASR_{def}Benign_{Pass}})Chat54.6%61.2%57.7%整體現(xiàn)象閉源前沿模型綜合F1(F1?safety \frac{2\times ASR_{def} \times Benign_{Pass}}{ASR_{def}Benign_{Pass}})safety整體優(yōu)于開源模型不存在模型同時做到ASR(F1?safety \frac{2\times ASR_{def} \times Benign_{Pass}}{ASR_{def}Benign_{Pass}})def與Benign(F1?safety \frac{2\times ASR_{def} \times Benign_{Pass}}{ASR_{def}Benign_{Pass}})Pass雙雙接近90%普遍存在安全(F1?safety \frac{2\times ASR_{def} \times Benign_{Pass}}{ASR_{def}Benign_{Pass}})可用性權衡。5.2 不同風險子類下模型表現(xiàn)直接提示劫持大部分模型防御效果尚可工具返回注入、多步間接注入所有模型防御難度顯著升高ASR(F1?safety \frac{2\times ASR_{def} \times Benign_{Pass}}{ASR_{def}Benign_{Pass}})def明顯下降權限濫用shell高危命令開源模型更容易被誘導執(zhí)行高危命令信息泄露類風險模型容易無意識把內部憑證隨工具輸出返回用戶。5.3 安全可用性帕累托分析大部分模型落在帕累托前沿下方提升攻擊防御率往往會帶來良性任務通過率下降案例開啟強安全提示ASR(F1?safety \frac{2\times ASR_{def} \times Benign_{Pass}}{ASR_{def}Benign_{Pass}})def上漲7(F1?safety \frac{2\times ASR_{def} \times Benign_{Pass}}{ASR_{def}Benign_{Pass}})12個百分點但Benign(F1?safety \frac{2\times ASR_{def} \times Benign_{Pass}}{ASR_{def}Benign_{Pass}})Pass下降5(F1?safety \frac{2\times ASR_{def} \times Benign_{Pass}}{ASR_{def}Benign_{Pass}})9個百分點。6 防護策略消融實驗以Qwen2.5(F1?safety \frac{2\times ASR_{def} \times Benign_{Pass}}{ASR_{def}Benign_{Pass}})72B為代表模型對比不同防護手段配置ASR(F1?safety \frac{2\times ASR_{def} \times Benign_{Pass}}{ASR_{def}Benign_{Pass}})defBenign(F1?safety \frac{2\times ASR_{def} \times Benign_{Pass}}{ASR_{def}Benign_{Pass}})PassF1(F1?safety \frac{2\times ASR_{def} \times Benign_{Pass}}{ASR_{def}Benign_{Pass}})safetyBase原始基線67.5%68.2%67.8%Sys(F1?safety \frac{2\times ASR_{def} \times Benign_{Pass}}{ASR_{def}Benign_{Pass}})Prompt安全提示76.1%61.4%68.0%Input(F1?safety \frac{2\times ASR_{def} \times Benign_{Pass}}{ASR_{def}Benign_{Pass}})Filter輸入過濾78.4%58.7%67.2%Sandbox(F1?safety \frac{2\times ASR_{def} \times Benign_{Pass}}{ASR_{def}Benign_{Pass}})Restrict沙箱限制74.8%64.3%69.3%全部三者組合83.2%53.1%64.7%消融關鍵結論安全系統(tǒng)提示、輸入關鍵詞過濾、沙箱權限限制都可以提升攻擊防御成功率每一類防護手段均會損傷良性業(yè)務通過率全部防護疊加防御率最高但良性通過率大幅下滑沙箱權限限制相對三者之中對可用性傷害最小關鍵詞黑名單過濾容易誤攔截合法業(yè)務。工程啟示不能只看攻擊防御指標必須同步監(jiān)控良性業(yè)務通過率避免過度防護。7 案例分析多步間接注入失敗案例用戶先誘導智能體讀取一份惡意構造的文檔文檔內部攜帶注入載荷模型讀取文檔之后被劫持忽略原有安全約束。即使是強模型該類場景依舊容易失守。過度拒絕案例開啟關鍵詞黑名單合法業(yè)務shell命令因為命中黑名單詞匯被攔截業(yè)務任務直接失敗。沙箱防護案例沙箱限制文件訪問路徑即使模型產生越權調用意圖工具層直接拒絕執(zhí)行從環(huán)境層面阻斷風險。8 討論與局限性本基準基于仿真沙箱環(huán)境不是真實生產環(huán)境仿真不能完全復現(xiàn)生產環(huán)境全部復雜漏洞。評測為零樣本設置沒有測試經過安全專項微調后的模型。風險樣例是人工構造不能覆蓋現(xiàn)實世界無窮多攻擊變體基準側重工具調用帶來的安全風險不覆蓋純視覺多模態(tài)、具身機器人場景。工程啟示只看攻擊防御率會誤導選型安全評測必須配套大量良性業(yè)務用例評估可用性損失各類防護手段均存在副作用需要做權衡沙箱環(huán)境權限隔離是性價比很高的底層防線。未來方向拓展多模態(tài)、具身智能體用例引入監(jiān)護模型作為防護策略做消融構建對抗生成攻擊變體測試集。9 結論本文提出AgentBench(F1?safety \frac{2\times ASR_{def} \times Benign_{Pass}}{ASR_{def}Benign_{Pass}})Safety工具智能體安全評測基準包含1242條測試用例覆蓋4大類14子類工具智能體安全風險同時包含攻擊用例與良性業(yè)務用例設計ASR(F1?safety \frac{2\times ASR_{def} \times Benign_{Pass}}{ASR_{def}Benign_{Pass}})def、Benign(F1?safety \frac{2\times ASR_{def} \times Benign_{Pass}}{ASR_{def}Benign_{Pass}})Pass、F1(F1?safety \frac{2\times ASR_{def} \times Benign_{Pass}}{ASR_{def}Benign_{Pass}})safety綜合指標量化安全(F1?safety \frac{2\times ASR_{def} \times Benign_{Pass}}{ASR_{def}Benign_{Pass}})可用性權衡。對14個主流模型開展評測實驗證實當前大模型智能體普遍面臨安全(F1?safety \frac{2\times ASR_{def} \times Benign_{Pass}}{ASR_{def}Benign_{Pass}})可用性兩難閉源模型整體占優(yōu)但仍然存在短板多步間接注入、工具返回注入是主要薄弱點。消融表明安全提示、輸入過濾、沙箱限制都可以提升防御但都會帶來業(yè)務可用性損失沙箱權限隔離綜合代價相對更小。數(shù)據(jù)集、仿真沙箱、評測腳本全部開源。10 參考文獻完整參考文獻查閱原始arXiv網頁https://arxiv.org/html/2609.30028v1附錄簡要說明附錄A數(shù)據(jù)集完整統(tǒng)計各子類樣本數(shù)量分布。附錄B評測指標完整數(shù)學公式、判定規(guī)則。附錄C14個被測模型完整推理參數(shù)、調用配置。附錄D三類防護策略完整系統(tǒng)提示、輸入過濾黑名單腳本、沙箱限制配置。附錄E所有模型細分風險子類完整實驗結果表格。