理解Agent研究進展)
note方案選型做圖片輸入 function call 通用多模態(tài) Agent → 優(yōu)先看DeepSeek?Harness MTA?Agent做圖片多輪檢索求證 → DR?MMSearchAgent做長文檔圖文問答 → MDocAgent做成本優(yōu)化、工具調(diào)用節(jié)流 → ToolGate做GUI 屏幕自動化 Agent → UI?TARS / Agent?TARS。新一代視覺 Agent 不會始終把整張圖片或整段視頻放進上下文而是讓模型主動如下這樣可以降低視覺 token 數(shù)量并提升模型處理高分辨率圖像和長視頻的能力裁剪局部區(qū)域。放大關鍵區(qū)域。選擇視頻關鍵幀。通過工具生成 OCR 或 grounding 結果。按需構建后續(xù)視覺上下文。文章目錄note一、2026多模態(tài)Agent研究熱點1、圖片問答agent進展2、視頻理解二、相關項目1、框架類2、多模態(tài)深搜三、方向確定四、多模態(tài) Agentic RL 框架1. PyVision-RL2. VAGEN3. OpenRLHF4. VerlTool5. VISTA-Gym6. Visual-ARFT7. Agent-R18. Verl一、2026多模態(tài)Agent研究熱點原生視覺工具調(diào)用最核心熱點VLM 不再僅做圖文問答輸入圖片 → Agent 推理 → 調(diào)用檢索 / 截圖放大 / OCR / 搜索 / 計算器等工具像 DeepSeek V4?Flash?Vision?Exp 這條線保留原有 function call 能力新增圖片輸入原生把視覺嵌入 Agent 循環(huán)而不是外掛 OCR 預處理。痛點VLM 容易幻覺、分不清什么時候需要調(diào)用工具、多輪識圖求證不穩(wěn)定。長時序多輪深度搜索 Agent多模態(tài)檢索智能體針對圖片做多輪搜索、反復核驗解決 Agent 提前停止搜索、信息收集不全DR?MMSearchAgent、MTA?Agent 就是這類。Agent 成本與調(diào)用效率優(yōu)化ToolGateCVPR26代表方向增加前置路由模塊過濾不必要工具調(diào)用、減少冗余 step工具緩存、動態(tài)路由、輕量化調(diào)度降低多步 Agent 的 token 開銷。專用場景多模態(tài) Agent文檔 AgentMDocAgent長圖文 PDF、圖表、表格問答、切片解析GUI 視覺 AgentUI?TARS / Agent?TARS截圖識別界面、點擊操作多模態(tài) Agent 訓練范式升級RL 微調(diào)、反射自省、工具軌跡蒸餾用 Agent 軌跡數(shù)據(jù)微調(diào) VLM提升工具決策準確率同時配套多模態(tài) Agent 評測 benchmark 建設。1、圖片問答agent進展工作首次公開時間主要問題工具/動作訓練最值得借鑒當前可復現(xiàn)性IMAgent2025-12多圖推理、后段忽略視覺reflection、confirmation、圖像索引Pure RL 兩級 mask多圖動作空間與視覺注意力再分配論文可讀官方代碼/數(shù)據(jù)未發(fā)布SenseNova-MARS2025-12高分辨率與外部知識問答crop、image search、text search冷啟動 BN-GSPO與搜索型業(yè)務最貼近的完整 pipeline代碼、模型、數(shù)據(jù)、benchmark 已發(fā)布CodeV2025-11工具過程不忠實Python 視覺工具SFT GRPO/TAPO基于工具結果的過程獎勵代碼、模型、RL 數(shù)據(jù)已發(fā)布CodeVision2025-12固定工具難組合Code-as-ToolSFT dense process reward RL工具組合、錯誤恢復、開放動作空間訓練代碼與數(shù)據(jù)已發(fā)布VISTA-Gym/R12025-11缺少統(tǒng)一視覺 Agent RL 環(huán)境grounding、parsing 等多輪采樣 端到端 RL任務/工具/日志/verifier 標準化官方倉庫已公開美團 TAPO2026-06失敗軌跡中正確動作被誤罰crop、圖搜、文搜等batch 內(nèi) credit transfer低成本糾正結構化動作 advantage論文可讀代碼/模型未發(fā)布2、視頻理解待補充二、相關項目1、框架類1框架類可直接搭建多模態(tài) Agent 基座DeepSeek?HarnessDeepSeek 2026定位Agent 運行時框架近期新增 Vision 支持對接 V4?Flash?Vision?Exp實現(xiàn)圖片輸入 原生 function call 閉環(huán)可插拔 Agent 循環(huán)、工具、記憶、上下文管理倉庫https://github.com/deepseek?ai/harnessAgent?TARS / UI?TARS字節(jié) 2026GUI 視覺 Agent定位屏幕截圖理解 GUI 操作 Agent視覺動作智能體倉庫https://github.com/bytedance/ui?tars核心截圖輸入 → 識別界面元素 → 輸出點擊動作典型視覺工具 Agent 范式。2、多模態(tài)深搜2論文向多模態(tài) Agent頂會 /arxiv有開源代碼MTA?AgentSalesforce 2026論文MTA?Agent: An Open Recipe for Multimodal Deep Search Agents方向多模態(tài)深度檢索 Agent自帶數(shù)據(jù)生成流水線、工具緩存訓練arxivhttps://arxiv.org/html/2604.06376v1? 開源https://github.com/salesforce/mta?agentDR?MMSearchAgent2026論文DR?MMSearchAgent: Deepening Reasoning in Multimodal Search Agents解決多模態(tài)搜索 Agent 容易提前終止、搜不全適合圖片多輪識圖 聯(lián)網(wǎng)求證arxivhttps://arxiv.org/html/2604.19264v1? 開源https://github.com/DR?MMSearch/DR?MMSearchAgentMDocAgent2025文檔多模態(tài) Agent論文MDocAgent: A Multi?Modal Multi?Agent Framework for Document Understanding方向圖文混合文檔 DocQA文檔切片、圖表解析、檢索工具鏈arxivhttps://arxiv.org/pdf/2503.13964v1? 開源https://github.com/mdocagent/MDocAgentToolGateCVPR2026工具調(diào)用成本優(yōu)化論文ToolGate定位前置門控模塊不改動主模型預判是否調(diào)用工具減少無效工具請求降低 Agent 成本arxivhttps://arxiv.org/pdf/2606.03054v1? 開源https://github.com/ToolGate2026/ToolGate三、方向確定做圖片輸入 function call 通用多模態(tài) Agent → 優(yōu)先看 DeepSeek?Harness MTA?Agent做圖片多輪檢索求證 → DR?MMSearchAgent做長文檔圖文問答 → MDocAgent做成本優(yōu)化、工具調(diào)用節(jié)流 → ToolGate做GUI 屏幕自動化 Agent → UI?TARS / Agent?TARS。四、多模態(tài) Agentic RL 框架1. PyVision-RL項目https://github.com/agents-x-project/PyVision-RL定位面向圖像和視頻理解的多模態(tài) Agentic RL 框架。主要能力1使用 Python 作為視覺工具。2支持圖像裁剪、旋轉、局部分析等操作。3支持視頻關鍵幀選擇和按需構建視覺上下文。4支持多輪工具交互。5使用 rollout 過采樣、過濾和排序策略。6加入累積工具 reward減少訓練后模型不再調(diào)用工具的問題。適合任務圖像搜索。圖像細節(jié)分析。圖片處理和視覺推理。視頻關鍵幀選擇。多輪視覺問答。2. VAGEN項目https://github.com/mll-lab-nu/VAGEN定位面向多輪 VLM Agent 和視覺環(huán)境交互的 RL 框架。主要環(huán)境FrozenLake。Navigation。Sokoban。ManiSkill。SVG。主要能力1將任務表示為視覺狀態(tài)、Agent 動作和環(huán)境反饋組成的 POMDP。2支持多輪環(huán)境交互。3對狀態(tài)估計和狀態(tài)轉移建模進行獎勵。4支持長軌跡壓縮和 compaction RL。5主線基于 verl agent-loop便于自定義環(huán)境。適合任務GUI 操作。視覺導航。游戲環(huán)境。具身交互。需要連續(xù)觀察環(huán)境變化的 Agent 任務。3. OpenRLHF項目https://github.com/OpenRLHF/OpenRLHF定位通用 Agentic RL 底座近期增強了 VLM 和多輪 VLM Agent RL。主要能力1VLM 單輪 RL。2Multi-Turn VLM RL。3環(huán)境返回圖片或截圖。4自定義 Agent Executor。5PPO、GRPO、DAPO、REINFORCE 等算法。6LoRA/QLoRA 和異步 rollout。適合任務初始圖片 - Agent 行動 - 環(huán)境返回截圖 - Agent 繼續(xù)行動如果已有自定義tool_impl.py、reward 和 rollout 邏輯OpenRLHF 可以作為通用遷移目標。4. VerlTool項目https://github.com/TIGER-AI-Lab/verl-tool定位基于 verl 的工具 Agent RL 框架。主要能力統(tǒng)一工具 API。異步 rollout。多輪 trajectory。代碼執(zhí)行、搜索和 SQL 工具。圖像處理。視頻幀選擇。圖像/視頻 observation。DAPO recipe。適合已有工具和 reward 代碼的團隊。當前agent_my目錄中的工具、reward 和 rollout 邏輯后續(xù)可以重點評估向該框架遷移。5. VISTA-Gym論文https://arxiv.org/html/2511.19773v1定位視覺工具集成的 Agent 訓練環(huán)境。主要工具和任務包括1GroundingDINO、SAM、EasyOCR 等視覺工具。2圖表理解。3文檔解析。4幾何和數(shù)學推理。5區(qū)域定位和結構化視覺反饋。該方向適合OCR。圖表理解。文檔問答。視覺定位。工具選擇。多步視覺推理。6. Visual-ARFT項目https://github.com/Liuziyu77/Visual-RFT需要區(qū)分1Visual-RFT主要是單輪視覺 RLVR例如分類、檢測、grounding 和視覺問答。2Visual-ARFT重點是視覺 Agent支持網(wǎng)頁搜索、圖片裁剪、圖片旋轉和代碼分析圖片。主要基座包括Qwen2-VL、Qwen2.5-VL適合研究視覺搜索和圖像處理工具增強的多模態(tài)推理。7. Agent-R1項目https://github.com/AgentR1/Agent-R1主要抽象包括AgentFlowBase AgentEnvLoop AgentEnv ToolEnv支持多輪工具調(diào)用。環(huán)境reset/step。trajectory 訓練。tool reward。process reward。VLM Agent 擴展。它更偏通用 Agent RL 基礎設施視覺能力不是最專用但適合研究環(huán)境、工具和 credit assignment。8. VerlVerl支持VLM訓練DAPOhttps://github.com/verl-project/verl/blob/main/docs/ascend_tutorial/model_support/examples/dapo_multi_model_optimization_practice.md