的證據(jù)驅(qū)動(dòng)捷徑樹)
DENSE:將智能體軌跡提煉為面向自我改進(jìn)的證據(jù)驅(qū)動(dòng)捷徑樹arXiv編號(hào):arXiv:2609.21423v1 [cs.AI]摘要線上部署的大模型智能體會(huì)產(chǎn)出海量執(zhí)行軌跡,但任務(wù)專屬驗(yàn)證器、專家標(biāo)注成本高昂,難以大規(guī)模獲取。本文研究:在沒有事后任務(wù)結(jié)果標(biāo)簽的前提下,如何從原始軌跡中提煉可復(fù)用反饋信息,利用軌跡內(nèi)部的局部進(jìn)展、故障恢復(fù)、未完成需求等證據(jù)。提出DENSE(Distilling Evidence from Nested Subtask Executions,從嵌套子任務(wù)執(zhí)行中提煉證據(jù)),將軌跡證據(jù)組織為證據(jù)驅(qū)動(dòng)嵌套捷徑樹。DENSE壓縮冗余嘗試,利用恢復(fù)證據(jù)跨層級(jí)調(diào)和各類問題;對(duì)已完成分支做摘要,同時(shí)對(duì)未解決分支做展開;把可復(fù)用進(jìn)展與剩余待完成義務(wù)建立關(guān)聯(lián)。本文同時(shí)提出REFIT評(píng)測(cè)協(xié)議:源軌跡配對(duì)評(píng)測(cè),在看不到事后任務(wù)結(jié)果標(biāo)簽的條件下對(duì)比不同反饋;重置環(huán)境與模型上下文,使用反饋對(duì)同一任務(wù)重新發(fā)起嘗試。在Terminal?Bench 2.1基準(zhǔn)上,DENSE在四款被測(cè)接收模型上,在所有非特權(quán)反饋方法中取得最高嚴(yán)格通過率。相對(duì)原始首輪執(zhí)行,嚴(yán)格通過率提升7.12?15.64個(gè)百分點(diǎn);重跑時(shí)接收方模型token觀測(cè)消耗降低19.0?43.6%。基于GPT?5.5的消融實(shí)驗(yàn)證實(shí):嵌套子任務(wù)分析、捷徑構(gòu)建、問題調(diào)和三者組合才能拿到完整增益。實(shí)驗(yàn)表明,可以依靠證據(jù)驅(qū)動(dòng)的軌跡復(fù)用來實(shí)現(xiàn)智能體自我迭代,降低對(duì)外部監(jiān)督的依賴。關(guān)鍵詞智能體軌跡蒸餾;自我改進(jìn);嵌套子任務(wù);捷徑樹;無標(biāo)簽反饋;REFIT協(xié)議;Terminal?Bench目錄引言DENSE:證據(jù)驅(qū)動(dòng)的捷徑樹2.1 問題設(shè)定與總覽2.2 構(gòu)建嵌套子任務(wù)2.3 帶證據(jù)的嘗試過程壓縮2.4 通過恢復(fù)證據(jù)調(diào)和問題2.5 渲染未完成需求義務(wù)REFIT:評(píng)估軌跡信息價(jià)值3.1 配對(duì)重跑實(shí)驗(yàn)3.2 可用信息定義3.3 下游效用指標(biāo)實(shí)驗(yàn)4.1 實(shí)驗(yàn)設(shè)置4.1.1 任務(wù)4.1.2 接收方模型4.1.3 執(zhí)行配置4.1.4 反饋生成模型4.1.5 評(píng)測(cè)指標(biāo)與覆蓋率4.2 對(duì)比方法4.3 任務(wù)性能結(jié)果4.4 消融實(shí)驗(yàn)