![[論文分析]ZeroDayBench:面向網(wǎng)絡(luò)防御的未知零日漏洞LLM智能體評估](http://pic.xiahunao.cn/yaotu/[論文分析]ZeroDayBench:面向網(wǎng)絡(luò)防御的未知零日漏洞LLM智能體評估)
ZeroDayBench: Evaluating LLM Agents on Unseen Zero-Day Vulnerabilities for Cyberdefense論文重點(diǎn)ZeroDayBench是首個(gè)專門評估LLM智能體在真實(shí)零日漏洞場景下自主發(fā)現(xiàn)與修復(fù)能力的基準(zhǔn)測試集。該研究通過將已知CVE漏洞移植到功能相似但代碼不同的開源項(xiàng)目中構(gòu)建了22個(gè)前沿模型訓(xùn)練數(shù)據(jù)中不存在的高危漏洞任務(wù)CVSS ≥ 7.0測試了GPT-5.2、Claude Sonnet 4.5和Grok 4.1三款主流模型的零樣本推理能力。研究發(fā)現(xiàn)即使在full-info完整信息條件下表現(xiàn)最佳的Claude Sonnet 4.5也僅達(dá)到95.7%的通過率而在真正的零日情境下無任何額外信息所有模型的成功率均僅為12%–14%——這揭示了一個(gè)核心結(jié)論前沿LLM尚不具備自主解決真實(shí)零日漏洞修復(fù)任務(wù)的能力。核心研究內(nèi)容問題定義隨著LLM被越來越多地部署為自主軟件工程智能體其在代碼庫中自主發(fā)現(xiàn)和修復(fù)安全漏洞的能力備受關(guān)注。然而現(xiàn)有的網(wǎng)絡(luò)安全評估基準(zhǔn)存在兩個(gè)根本性問題一是依賴模糊測試發(fā)現(xiàn)的漏洞或歷史CVE這些數(shù)據(jù)很可能已存在于模型訓(xùn)練集中導(dǎo)致評估結(jié)果反映的是記憶檢索能力而非真正的推理能力二是現(xiàn)有基準(zhǔn)多聚焦于低影響漏洞無法反映高風(fēng)險(xiǎn)安全場景的真實(shí)需求。ZeroDayBench旨在解決這兩個(gè)核心缺陷提供一種能夠衡量模型零樣本推理能力而非記憶能力的評估框架。創(chuàng)新方法1漏洞移植Vulnerability Porting這是ZeroDayBench最核心的技術(shù)創(chuàng)新。研究團(tuán)隊(duì)并非直接使用已知CVE的原始漏洞代碼而是將真實(shí)CVE的根因移植到功能相似但代碼完全不同的目標(biāo)倉庫中。例如Redis CVE-2023-41056是一個(gè)在SDS字符串緩沖區(qū)調(diào)整大小中導(dǎo)致堆溢出和RCE的整數(shù)溢出漏洞團(tuán)隊(duì)將其移植到MinIO的wholeBitrotReader.ReadAt()函數(shù)中——該函數(shù)執(zhí)行類似的S3對象范圍讀取緩沖區(qū)操作使根因具備了可移植性。這種方法確保了漏洞在訓(xùn)練數(shù)據(jù)中不存在極大降低了模型通過記憶來作弊的可能性。2五級信息可見度設(shè)計(jì)研究設(shè)計(jì)了五個(gè)難度級別來模擬漏洞生命周期的不同階段zero-day僅告知找到并修補(bǔ)一個(gè)高危漏洞無任何額外信息cwe給出CWE通用類別如內(nèi)存破壞漏洞post-exploit提供攻擊者成功利用后的影響描述但不指明根因one-day告知具體哪個(gè)文件的哪個(gè)函數(shù)存在漏洞及問題性質(zhì)full-info提供精確的修復(fù)位置和具體操作說明這種設(shè)計(jì)能夠精細(xì)測量智能體在不同信息量下的表現(xiàn)揭示模型在真實(shí)漏洞響應(yīng)流程中各階段的能力邊界。3基于滲透測試的評估方法與傳統(tǒng)基準(zhǔn)僅檢查補(bǔ)丁是否生成不同ZeroDayBench引入了自定義的滲透測試評估方法通過驗(yàn)證修復(fù)后實(shí)時(shí)漏洞利用是否被阻止來評判補(bǔ)丁有效性。研究成果定量結(jié)果在三款模型的測試中Claude Sonnet 4.5以56.0%的總體通過率位居第一GPT-5.2以48.2%緊隨其后Grok 4.1 Fast為34.0%。在zero-day難度下三款模型表現(xiàn)相當(dāng)12.8%、14.4%、12.1%但隨著信息量增加Claude Sonnet 4.5展現(xiàn)出更明顯的優(yōu)勢——在full-info條件下達(dá)到95.7%的通過率遠(yuǎn)超GPT-5.2的76.2%和Grok的58.8%。行為分析研究發(fā)現(xiàn)了一個(gè)清晰的趨勢——信息越充分模型成功率越高這符合直覺但同時(shí)也說明當(dāng)前模型在自主漏洞發(fā)現(xiàn)真正的零日場景方面能力嚴(yán)重不足。實(shí)際落地應(yīng)用的可能性高可行性方向輔助安全審計(jì)在one-day及以上信息級別75%–95%成功率模型已能作為安全工程師的輔助工具在已知漏洞位置和類型的情況下生成有效補(bǔ)丁安全培訓(xùn)與演練ZeroDayBench可作為紅隊(duì)演練的訓(xùn)練平臺幫助安全團(tuán)隊(duì)測試和提升LLM輔助漏洞修復(fù)的能力低可行性方向完全自主的零日漏洞發(fā)現(xiàn)與修復(fù)在zero-day級別12%–14%的成功率遠(yuǎn)不能滿足生產(chǎn)環(huán)境的安全要求取代專業(yè)安全研究人員當(dāng)前模型在缺乏明確指引時(shí)表現(xiàn)欠佳無法替代人類專家的判斷技術(shù)細(xì)節(jié)漏洞注入技術(shù)漏洞注入通過針對性的代碼修改實(shí)現(xiàn)主要包括將安全庫調(diào)用替換為不安全的等價(jià)調(diào)用移除認(rèn)證檢查或輸入 sanitization例如移除MLFlow的quote()參數(shù) sanitization 函數(shù)以啟用 shell 注入CVE-2020-11978將GitPython切換為原始subprocess.run(shellTrue)調(diào)用CVE-2021-21300變體設(shè)計(jì)研究構(gòu)建了兩種類型的任務(wù)變體跨倉庫變體Cross-repo variation將同一個(gè)CVE移植到多個(gè)目標(biāo)中。例如CVE-2021-23017nginx DNS解析器中的off-by-one漏洞被移植到HAProxy、Squid和Tinyproxy三個(gè)C語言倉庫——它們各自以不同方式實(shí)現(xiàn)DNS解析。倉庫內(nèi)變體Intra-repo variation在單個(gè)目標(biāo)中實(shí)現(xiàn)同一根因的多種變體。Squid有7個(gè)CVE-2021-23017變體通過不同方法引入內(nèi)存破壞移除長度檢查、整數(shù)下溢、空字節(jié)投毒、雙重釋放等Mosquitto有3個(gè)CVE-2024-42655變體使用不同的ACL繞過方法。智能體架構(gòu)智能體采用簡單的循環(huán)架構(gòu)基礎(chǔ)LLM配備兩個(gè)工具# 偽代碼示意classZeroDayAgent:tools[BashTool(# 執(zhí)行任意bash命令timeout120,# 超過120秒則取消max_output10000# 超過10000字符則截?cái)?,EditTool()# 添加和編輯指定文件中的文本]max_turns100# 最大工具調(diào)用輪次terminationno tool callsormax turns reached漏洞復(fù)蓋范圍基準(zhǔn)涵蓋的漏洞類型包括RCE遠(yuǎn)程代碼執(zhí)行反序列化、命令注入、SSTI權(quán)限提升與認(rèn)證繞過SQL注入內(nèi)存破壞緩沖區(qū)溢出、off-by-one路徑遍歷涉及的開源項(xiàng)目包括MLFlow、Flyte、Mosquitto、vLLM、Dropbear、HAProxy、Squid、Tinyproxy、Jenkins、Minio、Verdaccio等。研究設(shè)定實(shí)驗(yàn)配置配置項(xiàng)詳情評估時(shí)間2026年1月15日至2月1日測試模型GPT-5.2推理設(shè)為Medium、Claude Sonnet 4.5、Grok 4.1 Fast啟用推理最大工具調(diào)用輪次100輪Bash命令超時(shí)120秒輸出截?cái)嚅撝?0,000字符運(yùn)行環(huán)境Docker容器化環(huán)境漏洞來源與篩選漏洞選自NVD和cvedetails.com公共數(shù)據(jù)庫篩選標(biāo)準(zhǔn)包括CVSS評分 ≥ 7.0高?;驀?yán)重主要攻擊向量包括RCE、權(quán)限提升、認(rèn)證繞過、命令注入包含拒絕服務(wù)和內(nèi)存破壞漏洞排除鏈?zhǔn)铰┒碿hained vulnerabilities硬件/軟件要求核心依賴Docker容器化隔離環(huán)境API訪問需要GPT-5.2、Claude Sonnet 4.5、Grok 4.1 Fast的API權(quán)限計(jì)算資源論文未明確說明具體硬件配置但考慮到涉及代碼庫編譯、測試執(zhí)行和LLM API調(diào)用建議具備至少16GB內(nèi)存和多核CPU的中高端開發(fā)機(jī)器綜合分析研究團(tuán)隊(duì)背景與可信度第一作者Nancy Lau是UC Santa Cruz計(jì)算機(jī)科學(xué)與工程系的博士生研究興趣聚焦于AI智能體的安全性此前有固件安全和CTF競賽背景。她曾創(chuàng)立本科網(wǎng)絡(luò)安全俱樂部并在SPAR項(xiàng)目下主導(dǎo)了AI漏洞檢測基準(zhǔn)的創(chuàng)建。其博士提案聚焦于通過強(qiáng)化學(xué)習(xí)實(shí)現(xiàn)安全編碼智能體。共同作者Louis Sloot來自卡內(nèi)基梅隆大學(xué)。HUD AI的Dylan Bowman等作者來自產(chǎn)業(yè)界。論文已被ICLR 2026的Agents in the Wild Workshop接收。從團(tuán)隊(duì)構(gòu)成來看該研究兼具學(xué)術(shù)嚴(yán)謹(jǐn)性UCSC、CMU等頂尖機(jī)構(gòu)和產(chǎn)業(yè)相關(guān)性HUD AI的參與并非純理論推演。第一作者在AI安全領(lǐng)域的持續(xù)深耕從固件安全到CTF再到AI智能體安全為研究提供了扎實(shí)的技術(shù)功底。技術(shù)真實(shí)性評估漏洞移植方法的可行性該方法在技術(shù)上是真實(shí)且可行的。漏洞的根因root cause往往具有跨代碼庫的可移植性——例如緩沖區(qū)邊界檢查缺失、輸入驗(yàn)證不足等邏輯缺陷可以在不同實(shí)現(xiàn)中出現(xiàn)。研究團(tuán)隊(duì)選擇功能相似的代碼位置進(jìn)行移植如Redis的SDS緩沖區(qū)和MinIO的S3范圍讀取這符合軟件安全研究的常規(guī)實(shí)踐。但需要指出的是嚴(yán)格保證這些補(bǔ)丁從未出現(xiàn)在訓(xùn)練數(shù)據(jù)中是無法做到的——研究團(tuán)隊(duì)自己也承認(rèn)這一點(diǎn)將其定位為降低直接記憶信號的汙染控制方法而非絕對保證。評估方法的有效性基于滲透測試的補(bǔ)丁驗(yàn)證方法比單純檢查補(bǔ)丁是否生成更為嚴(yán)格。這種方法能夠有效避免生成看似合理但實(shí)際無效的補(bǔ)丁這類假陽性在技術(shù)上是扎實(shí)的。模型選擇的合理性GPT-5.2、Claude Sonnet 4.5和Grok 4.1 Fast是2026年初的前沿模型在先前軟件工程基準(zhǔn)上表現(xiàn)優(yōu)異選擇這三款具有代表性。核心洞見1零日漏洞修復(fù)能力的真實(shí)瓶頸12%–14%的zero-day成功率是一個(gè)警示性數(shù)據(jù)。它說明當(dāng)前最先進(jìn)的LLM在面對真正未知的漏洞時(shí)自主發(fā)現(xiàn)能力極為有限。這不是記憶與推理的爭論而是根本性的推理能力缺失——模型可以在被告知問題位置后有效修復(fù)full-info達(dá)95.7%但無法自主定位問題。2信息級別的階梯效應(yīng)從zero-day12%到full-info95.7%Claude Sonnet 4.5的性能提升近乎線性。這說明漏洞修復(fù)的不同階段對AI能力的要求截然不同定位漏洞需要深度代碼理解和推理遠(yuǎn)比修復(fù)漏洞需要代碼生成能力困難。這一發(fā)現(xiàn)對安全工具的設(shè)計(jì)具有重要指導(dǎo)意義——與其追求全自動漏洞修復(fù)不如先開發(fā)輔助定位自動修復(fù)的人機(jī)協(xié)作模式。3對AI取代安全工程師論調(diào)的審慎回應(yīng)論文結(jié)果明確表明至少在零日漏洞防御領(lǐng)域AI遠(yuǎn)未達(dá)到取代人類專家的水平。但這也意味著AI可以作為強(qiáng)大的輔助工具——在人類指明方向后高效完成修復(fù)工作。局限性漏洞移植的人工成本高每個(gè)漏洞需要人工分析根因、尋找可移植的目標(biāo)代碼位置并進(jìn)行修改難以大規(guī)模擴(kuò)展評估模型的API依賴測試依賴特定商業(yè)模型的API結(jié)果可能隨模型版本更新而變化僅復(fù)蓋開源代碼庫對閉源商業(yè)軟件的可遷移性有待驗(yàn)證排除鏈?zhǔn)铰┒船F(xiàn)實(shí)中的零日漏洞往往是鏈?zhǔn)降暮喕嗽u估場景實(shí)踐應(yīng)用對安全工程師的建議1. 將LLM定位為高級修復(fù)助手而非自主安全分析師在zero-day和cwe級別12%–33%成功率讓LLM自主發(fā)現(xiàn)和修復(fù)漏洞風(fēng)險(xiǎn)極高。建議的工作流是人類定位漏洞 → LLM生成修復(fù)方案 → 人類審查驗(yàn)證。在one-day及以上級別75%–95%成功率LLM可作為高效的補(bǔ)丁生成工具。2. 利用五級信息框架設(shè)計(jì)人機(jī)協(xié)作流程ZeroDayBench的信息級別設(shè)計(jì)本身就映射了真實(shí)漏洞響應(yīng)流程漏洞發(fā)現(xiàn)階段對應(yīng)zero-day/cwe依賴人類專家的代碼審計(jì)能力影響評估階段對應(yīng)post-exploit人類分析攻擊面AI可輔助影響范圍評估修復(fù)實(shí)施階段對應(yīng)one-day/full-infoAI高效生成補(bǔ)丁人類審查3. 警惕訓(xùn)練數(shù)據(jù)汙染問題ZeroDayBench的漏洞移植方法提醒我們使用歷史CVE數(shù)據(jù)訓(xùn)練或評估的AI安全工具可能存在嚴(yán)重的過擬合風(fēng)險(xiǎn)。在采購或部署AI安全產(chǎn)品時(shí)應(yīng)要求供應(yīng)商提供在未見漏洞上的評估數(shù)據(jù)。對研究者的建議1. 擴(kuò)展漏洞移植的自動化程度當(dāng)前人工移植成本高、規(guī)模小僅22個(gè)任務(wù)。未來研究可探索自動化漏洞模式提取與移植方法以構(gòu)建更大規(guī)模的零日評估基準(zhǔn)。2. 研究定位能力與修復(fù)能力的解耦論文暗示模型的定位能力遠(yuǎn)弱于修復(fù)能力。這是一個(gè)值得深入研究的切入點(diǎn)——是否可以單獨(dú)訓(xùn)練或微調(diào)模型的漏洞定位能力是否可以開發(fā)專門的漏洞定位智能體與漏洞修復(fù)智能體協(xié)作3. 探索強(qiáng)化學(xué)習(xí)在安全智能體中的應(yīng)用第一作者Nancy Lau的博士研究恰好聚焦于此——通過RL實(shí)現(xiàn)安全編碼智能體。ZeroDayBench可作為這類研究的評估平臺測試RL增強(qiáng)的智能體是否能在zero-day場景中超越純LLM方法。參考資料來源原始論文: https://arxiv.org/pdf/2603.02297ICLR 2026 Workshop “Agents in the Wild”: https://iclr.cc/ Workshop信息作者信息: UC Santa Cruz (Nancy Lau), Carnegie Mellon University (Louis Sloot), HUD AI (Dylan Bowman, Mario Brajkovski, Jaideep Chawla), New York University (Dan Zhao)