理解Agent研究進(jìn)展)
note方案選型做圖片輸入 function call 通用多模態(tài) Agent → 優(yōu)先看DeepSeek?Harness MTA?Agent做圖片多輪檢索求證 → DR?MMSearchAgent做長(zhǎng)文檔圖文問(wèn)答 → MDocAgent做成本優(yōu)化、工具調(diào)用節(jié)流 → ToolGate做GUI 屏幕自動(dòng)化 Agent → UI?TARS / Agent?TARS。新一代視覺 Agent 不會(huì)始終把整張圖片或整段視頻放進(jìn)上下文而是讓模型主動(dòng)如下這樣可以降低視覺 token 數(shù)量并提升模型處理高分辨率圖像和長(zhǎng)視頻的能力裁剪局部區(qū)域。放大關(guān)鍵區(qū)域。選擇視頻關(guān)鍵幀。通過(guò)工具生成 OCR 或 grounding 結(jié)果。按需構(gòu)建后續(xù)視覺上下文。文章目錄note一、2026多模態(tài)Agent研究熱點(diǎn)1、圖片問(wèn)答agent進(jìn)展2、視頻理解二、相關(guān)項(xiàng)目1、框架類2、多模態(tài)深搜三、方向確定四、多模態(tài) Agentic RL 框架1. PyVision-RL2. VAGEN3. OpenRLHF4. VerlTool5. VISTA-Gym6. Visual-ARFT7. Agent-R18. Verl一、2026多模態(tài)Agent研究熱點(diǎn)原生視覺工具調(diào)用最核心熱點(diǎn)VLM 不再僅做圖文問(wèn)答輸入圖片 → Agent 推理 → 調(diào)用檢索 / 截圖放大 / OCR / 搜索 / 計(jì)算器等工具像 DeepSeek V4?Flash?Vision?Exp 這條線保留原有 function call 能力新增圖片輸入原生把視覺嵌入 Agent 循環(huán)而不是外掛 OCR 預(yù)處理。痛點(diǎn)VLM 容易幻覺、分不清什么時(shí)候需要調(diào)用工具、多輪識(shí)圖求證不穩(wěn)定。長(zhǎng)時(shí)序多輪深度搜索 Agent多模態(tài)檢索智能體針對(duì)圖片做多輪搜索、反復(fù)核驗(yàn)解決 Agent 提前停止搜索、信息收集不全DR?MMSearchAgent、MTA?Agent 就是這類。Agent 成本與調(diào)用效率優(yōu)化ToolGateCVPR26代表方向增加前置路由模塊過(guò)濾不必要工具調(diào)用、減少冗余 step工具緩存、動(dòng)態(tài)路由、輕量化調(diào)度降低多步 Agent 的 token 開銷。專用場(chǎng)景多模態(tài) Agent文檔 AgentMDocAgent長(zhǎng)圖文 PDF、圖表、表格問(wèn)答、切片解析GUI 視覺 AgentUI?TARS / Agent?TARS截圖識(shí)別界面、點(diǎn)擊操作多模態(tài) Agent 訓(xùn)練范式升級(jí)RL 微調(diào)、反射自省、工具軌跡蒸餾用 Agent 軌跡數(shù)據(jù)微調(diào) VLM提升工具決策準(zhǔn)確率同時(shí)配套多模態(tài) Agent 評(píng)測(cè) benchmark 建設(shè)。1、圖片問(wèn)答agent進(jìn)展工作首次公開時(shí)間主要問(wèn)題工具/動(dòng)作訓(xùn)練最值得借鑒當(dāng)前可復(fù)現(xiàn)性IMAgent2025-12多圖推理、后段忽略視覺reflection、confirmation、圖像索引Pure RL 兩級(jí) mask多圖動(dòng)作空間與視覺注意力再分配論文可讀官方代碼/數(shù)據(jù)未發(fā)布SenseNova-MARS2025-12高分辨率與外部知識(shí)問(wèn)答crop、image search、text search冷啟動(dòng) BN-GSPO與搜索型業(yè)務(wù)最貼近的完整 pipeline代碼、模型、數(shù)據(jù)、benchmark 已發(fā)布CodeV2025-11工具過(guò)程不忠實(shí)Python 視覺工具SFT GRPO/TAPO基于工具結(jié)果的過(guò)程獎(jiǎng)勵(lì)代碼、模型、RL 數(shù)據(jù)已發(fā)布CodeVision2025-12固定工具難組合Code-as-ToolSFT dense process reward RL工具組合、錯(cuò)誤恢復(fù)、開放動(dòng)作空間訓(xùn)練代碼與數(shù)據(jù)已發(fā)布VISTA-Gym/R12025-11缺少統(tǒng)一視覺 Agent RL 環(huán)境grounding、parsing 等多輪采樣 端到端 RL任務(wù)/工具/日志/verifier 標(biāo)準(zhǔn)化官方倉(cāng)庫(kù)已公開美團(tuán) TAPO2026-06失敗軌跡中正確動(dòng)作被誤罰crop、圖搜、文搜等batch 內(nèi) credit transfer低成本糾正結(jié)構(gòu)化動(dòng)作 advantage論文可讀代碼/模型未發(fā)布2、視頻理解待補(bǔ)充二、相關(guān)項(xiàng)目1、框架類1框架類可直接搭建多模態(tài) Agent 基座DeepSeek?HarnessDeepSeek 2026定位Agent 運(yùn)行時(shí)框架近期新增 Vision 支持對(duì)接 V4?Flash?Vision?Exp實(shí)現(xiàn)圖片輸入 原生 function call 閉環(huán)可插拔 Agent 循環(huán)、工具、記憶、上下文管理倉(cāng)庫(kù)https://github.com/deepseek?ai/harnessAgent?TARS / UI?TARS字節(jié) 2026GUI 視覺 Agent定位屏幕截圖理解 GUI 操作 Agent視覺動(dòng)作智能體倉(cāng)庫(kù)https://github.com/bytedance/ui?tars核心截圖輸入 → 識(shí)別界面元素 → 輸出點(diǎn)擊動(dòng)作典型視覺工具 Agent 范式。2、多模態(tài)深搜2論文向多模態(tài) Agent頂會(huì) /arxiv有開源代碼MTA?AgentSalesforce 2026論文MTA?Agent: An Open Recipe for Multimodal Deep Search Agents方向多模態(tài)深度檢索 Agent自帶數(shù)據(jù)生成流水線、工具緩存訓(xùn)練arxivhttps://arxiv.org/html/2604.06376v1? 開源https://github.com/salesforce/mta?agentDR?MMSearchAgent2026論文DR?MMSearchAgent: Deepening Reasoning in Multimodal Search Agents解決多模態(tài)搜索 Agent 容易提前終止、搜不全適合圖片多輪識(shí)圖 聯(lián)網(wǎng)求證arxivhttps://arxiv.org/html/2604.19264v1? 開源https://github.com/DR?MMSearch/DR?MMSearchAgentMDocAgent2025文檔多模態(tài) Agent論文MDocAgent: A Multi?Modal Multi?Agent Framework for Document Understanding方向圖文混合文檔 DocQA文檔切片、圖表解析、檢索工具鏈arxivhttps://arxiv.org/pdf/2503.13964v1? 開源https://github.com/mdocagent/MDocAgentToolGateCVPR2026工具調(diào)用成本優(yōu)化論文ToolGate定位前置門控模塊不改動(dòng)主模型預(yù)判是否調(diào)用工具減少無(wú)效工具請(qǐng)求降低 Agent 成本arxivhttps://arxiv.org/pdf/2606.03054v1? 開源https://github.com/ToolGate2026/ToolGate三、方向確定做圖片輸入 function call 通用多模態(tài) Agent → 優(yōu)先看 DeepSeek?Harness MTA?Agent做圖片多輪檢索求證 → DR?MMSearchAgent做長(zhǎng)文檔圖文問(wèn)答 → MDocAgent做成本優(yōu)化、工具調(diào)用節(jié)流 → ToolGate做GUI 屏幕自動(dòng)化 Agent → UI?TARS / Agent?TARS。四、多模態(tài) Agentic RL 框架1. PyVision-RL項(xiàng)目https://github.com/agents-x-project/PyVision-RL定位面向圖像和視頻理解的多模態(tài) Agentic RL 框架。主要能力1使用 Python 作為視覺工具。2支持圖像裁剪、旋轉(zhuǎn)、局部分析等操作。3支持視頻關(guān)鍵幀選擇和按需構(gòu)建視覺上下文。4支持多輪工具交互。5使用 rollout 過(guò)采樣、過(guò)濾和排序策略。6加入累積工具 reward減少訓(xùn)練后模型不再調(diào)用工具的問(wèn)題。適合任務(wù)圖像搜索。圖像細(xì)節(jié)分析。圖片處理和視覺推理。視頻關(guān)鍵幀選擇。多輪視覺問(wèn)答。2. VAGEN項(xiàng)目https://github.com/mll-lab-nu/VAGEN定位面向多輪 VLM Agent 和視覺環(huán)境交互的 RL 框架。主要環(huán)境FrozenLake。Navigation。Sokoban。ManiSkill。SVG。主要能力1將任務(wù)表示為視覺狀態(tài)、Agent 動(dòng)作和環(huán)境反饋組成的 POMDP。2支持多輪環(huán)境交互。3對(duì)狀態(tài)估計(jì)和狀態(tài)轉(zhuǎn)移建模進(jìn)行獎(jiǎng)勵(lì)。4支持長(zhǎng)軌跡壓縮和 compaction RL。5主線基于 verl agent-loop便于自定義環(huán)境。適合任務(wù)GUI 操作。視覺導(dǎo)航。游戲環(huán)境。具身交互。需要連續(xù)觀察環(huán)境變化的 Agent 任務(wù)。3. OpenRLHF項(xiàng)目https://github.com/OpenRLHF/OpenRLHF定位通用 Agentic RL 底座近期增強(qiáng)了 VLM 和多輪 VLM Agent RL。主要能力1VLM 單輪 RL。2Multi-Turn VLM RL。3環(huán)境返回圖片或截圖。4自定義 Agent Executor。5PPO、GRPO、DAPO、REINFORCE 等算法。6LoRA/QLoRA 和異步 rollout。適合任務(wù)初始圖片 - Agent 行動(dòng) - 環(huán)境返回截圖 - Agent 繼續(xù)行動(dòng)如果已有自定義tool_impl.py、reward 和 rollout 邏輯OpenRLHF 可以作為通用遷移目標(biāo)。4. VerlTool項(xiàng)目https://github.com/TIGER-AI-Lab/verl-tool定位基于 verl 的工具 Agent RL 框架。主要能力統(tǒng)一工具 API。異步 rollout。多輪 trajectory。代碼執(zhí)行、搜索和 SQL 工具。圖像處理。視頻幀選擇。圖像/視頻 observation。DAPO recipe。適合已有工具和 reward 代碼的團(tuán)隊(duì)。當(dāng)前agent_my目錄中的工具、reward 和 rollout 邏輯后續(xù)可以重點(diǎn)評(píng)估向該框架遷移。5. VISTA-Gym論文https://arxiv.org/html/2511.19773v1定位視覺工具集成的 Agent 訓(xùn)練環(huán)境。主要工具和任務(wù)包括1GroundingDINO、SAM、EasyOCR 等視覺工具。2圖表理解。3文檔解析。4幾何和數(shù)學(xué)推理。5區(qū)域定位和結(jié)構(gòu)化視覺反饋。該方向適合OCR。圖表理解。文檔問(wèn)答。視覺定位。工具選擇。多步視覺推理。6. Visual-ARFT項(xiàng)目https://github.com/Liuziyu77/Visual-RFT需要區(qū)分1Visual-RFT主要是單輪視覺 RLVR例如分類、檢測(cè)、grounding 和視覺問(wèn)答。2Visual-ARFT重點(diǎn)是視覺 Agent支持網(wǎng)頁(yè)搜索、圖片裁剪、圖片旋轉(zhuǎn)和代碼分析圖片。主要基座包括Qwen2-VL、Qwen2.5-VL適合研究視覺搜索和圖像處理工具增強(qiáng)的多模態(tài)推理。7. Agent-R1項(xiàng)目https://github.com/AgentR1/Agent-R1主要抽象包括AgentFlowBase AgentEnvLoop AgentEnv ToolEnv支持多輪工具調(diào)用。環(huán)境reset/step。trajectory 訓(xùn)練。tool reward。process reward。VLM Agent 擴(kuò)展。它更偏通用 Agent RL 基礎(chǔ)設(shè)施視覺能力不是最專用但適合研究環(huán)境、工具和 credit assignment。8. VerlVerl支持VLM訓(xùn)練DAPOhttps://github.com/verl-project/verl/blob/main/docs/ascend_tutorial/model_support/examples/dapo_multi_model_optimization_practice.md