驅動捷徑樹)
DENSE:將智能體軌跡提煉為面向自我改進的證據(jù)驅動捷徑樹arXiv編號:arXiv:2609.21423v1 [cs.AI]摘要線上部署的大模型智能體會產出海量執(zhí)行軌跡,但任務專屬驗證器、專家標注成本高昂,難以大規(guī)模獲取。本文研究:在沒有事后任務結果標簽的前提下,如何從原始軌跡中提煉可復用反饋信息,利用軌跡內部的局部進展、故障恢復、未完成需求等證據(jù)。提出DENSE(Distilling Evidence from Nested Subtask Executions,從嵌套子任務執(zhí)行中提煉證據(jù)),將軌跡證據(jù)組織為證據(jù)驅動嵌套捷徑樹。DENSE壓縮冗余嘗試,利用恢復證據(jù)跨層級調和各類問題;對已完成分支做摘要,同時對未解決分支做展開;把可復用進展與剩余待完成義務建立關聯(lián)。本文同時提出REFIT評測協(xié)議:源軌跡配對評測,在看不到事后任務結果標簽的條件下對比不同反饋;重置環(huán)境與模型上下文,使用反饋對同一任務重新發(fā)起嘗試。在Terminal?Bench 2.1基準上,DENSE在四款被測接收模型上,在所有非特權反饋方法中取得最高嚴格通過率。相對原始首輪執(zhí)行,嚴格通過率提升7.12?15.64個百分點;重跑時接收方模型token觀測消耗降低19.0?43.6%?;贕PT?5.5的消融實驗證實:嵌套子任務分析、捷徑構建、問題調和三者組合才能拿到完整增益。實驗表明,可以依靠證據(jù)驅動的軌跡復用來實現(xiàn)智能體自我迭代,降低對外部監(jiān)督的依賴。關鍵詞智能體軌跡蒸餾;自我改進;嵌套子任務;捷徑樹;無標簽反饋;REFIT協(xié)議;Terminal?Bench目錄引言DENSE:證據(jù)驅動的捷徑樹2.1 問題設定與總覽2.2 構建嵌套子任務2.3 帶證據(jù)的嘗試過程壓縮2.4 通過恢復證據(jù)調和問題2.5 渲染未完成需求義務REFIT:評估軌跡信息價值3.1 配對重跑實驗3.2 可用信息定義3.3 下游效用指標實驗4.1 實驗設置4.1.1 任務4.1.2 接收方模型4.1.3 執(zhí)行配置4.1.4 反饋生成模型4.1.5 評測指標與覆蓋率4.2 對比方法4.3 任務性能結果4.4 消融實驗