资讯详情

【Vid】Thinking With Videos: Multimodal Tool-Augmented Reinforcement Learning for Long Video Reasoning

📅 2026/10/8 8:26:48 | 华诺云谱 👁 阅读
【Vid】Thinking With Videos: Multimodal Tool-Augmented Reinforcement Learning for Long Video Reasoning
note核心结论VITAL 让多模态大模型在回答视频问题前先判断“要不要回看、回看哪一段”再通过视频裁剪工具获取关键时间段的密集帧形成“文本推理 视觉证据”的多模态思维链。该方法主要解决长视频理解中的跨模态交互不足和幻觉在 11 个视频理解基准上取得领先尤其擅长长视频问答和时间定位。VITAL 的本质是教会多模态大模型在视频推理中“不懂就回看”模型先形成时间假设再调用视频裁剪工具密集观察关键片段最后依据真实画面作答通过 SFT 冷启动与 DGRPO 强化学习将时间定位、视频问答和 grounded QA 联合训练从而显著改善长视频理解并抑制幻觉。其最具启发性的设计不是某一个网络模块而是三种机制的闭环工具提供证据 → 时间定位指导工具 → 问答验证定位价值。文章目录note一、研究动机1. 长视频理解难在哪里2. 现有方法的两个缺陷3. 核心洞察二、论文核心1. VITAL 是什么2. 多轮工具调用机制每一轮模型要做什么是“多轮 agent”但实验主要限制为一次调用典型轨迹3. 工具有哪些为什么最终选择视频裁剪4. 多任务训练设计1时间定位Temporal Grounding2视频问答Video QA3基于定位的问答Grounded QA5. 数据集MTVR-CoT-72k 与 MTVR-RL-110k数据筛选策略两个数据集的分工6. 两阶段训练第一阶段SFT 冷启动第二阶段DGRPO 强化学习三、实验结果1. 总体结论最值得关注的趋势2. 工具到底有没有用四、结果分析1. 为什么多模态 CoT 优于文本 CoT文本 CoT 的失败模式多模态 CoT 的修正机制2. 时间定位为什么能帮助视频问答3. DGRPO 解决了什么五、优势、局限与后续方向1. 主要优势2. 主要局限3. 值得继续研究的方向一、研究动机Thinking With Videos: Multimodal Tool-Augmented Reinforcement Learning for Long Video ReasoningCVPR 2026https://github.com/tongjingqi/Thinking-with-Video1. 长视频理解难在哪里视频推理要求模型从动态画面中识别对象、关系、事件及其因果关系典型任务包括视频问答Video QA时间定位Temporal Grounding时空定位Spatial-Temporal Grounding视频字幕生成长视频的难点不只是“帧数多”而是关键信息稀疏答案往往只依赖几秒时间依赖强事件原因可能出现在很久之前视觉计算昂贵不能无差别地把所有帧送入模型容易遗忘与幻觉模型可能凭语言先验“编答案”。2. 现有方法的两个缺陷此前许多视频多模态大模型主要使用基于文本的思维链text-based CoT模型先看少量采样帧然后在文字中逐步推理。这种方法存在两个问题跨模态交互不足后续推理主要操作文字不再主动查看视频幻觉随链条增长而累积推理步骤越多、视频越长越容易偏离画面事实。3. 核心洞察人在不确定视频内容时不会只凭第一眼印象硬猜而会暂停、回放、放大关键片段再下结论。VITAL 要把这种“按需回看”能力教给模型模型先形成初步假设主动调用视觉工具密集观察疑似时间段根据真实画面修正答案。因此论文标题中的“Thinking with Videos”不是简单“看图后推理”而是在推理过程中持续引入新的视频证据。二、论文核心1. VITAL 是什么VITALVideo Intelligence via Tool-Augmented Learning是一个端到端的 agentic 视频推理框架由两部分组成多模态大模型MLLM负责理解、推理、决策和作答视觉工具箱Visual Toolbox按模型要求返回新的视频证据。其推理轨迹可表示为τ T 1 → C 1 → V 1 → T 2 → ⋯ → A n \tau \mathcal{T}_1 \rightarrow \mathcal{C}_1 \rightarrow \mathcal{V}_1 \rightarrow \mathcal{T}_2 \rightarrow \cdots \rightarrow \mathcal{A}_nτT1​→C1​→V1​→T2​→⋯→An​其中T \mathcal{T}T文本思考步骤C \mathcal{C}C工具调用V \mathcal{V}V工具返回的视频证据A \mathcal{A}A最终答案。这形成一条多模态思维链multimodal CoT推理过程不仅出现文字也出现真实视频帧。2. 多轮工具调用机制每一轮模型要做什么在第 (k) 轮模型根据历史信息生成O k f M L L M ( { T i , C i , V i } i 0 k ) \mathcal{O}_kf_{MLLM} \left( \{\mathcal{T}_i,\mathcal{C}_i,\mathcal{V}_i\}_{i0}^{k} \right)Ok​fMLLM​({Ti​,Ci​,Vi​}i0k​)随后解析器从中提取下一步思考T k 1 \mathcal{T}_{k1}Tk1​工具调用请求( C k 1 (\mathcal{C}_{k1}(Ck1​或最终答案A k 1 \mathcal{A}_{k1}Ak1​。若模型选择调用工具则执行V k 1 g t o o l ( C k 1 ) \mathcal{V}_{k1}g_{tool}(\mathcal{C}_{k1})Vk1​gtool​(Ck1​)工具结果重新进入模型上下文开启下一轮推理。是“多轮 agent”但实验主要限制为一次调用需要区分两个层面层面实际设计框架能力支持多轮工具调用允许模型反复观察视频实验配置主要采用视频裁剪工具每个问题最多调用一次生成阶段最多约两个生成阶段初始推理 → 可选工具 → 最终回答因此更准确的表述是架构上是多轮工具调用 agent当前实验是“单轮工具决策 两段生成”的 agentic RL。它并非只能对最终答案做单轮强化学习而是优化完整轨迹问题 → 是否调用工具 → 调用参数 → 观察返回帧 → 修正答案 \text{问题} \rightarrow \text{是否调用工具} \rightarrow \text{调用参数} \rightarrow \text{观察返回帧} \rightarrow \text{修正答案}问题→是否调用工具→调用参数→观察返回帧→修正答案典型轨迹不调用工具问题 → 思考 → 直接回答调用工具问题 → 初步思考 → Get_video_clip_frame(120, 180) → 观察密集帧 → 依据视觉证据推理 → 最终答案3. 工具有哪些论文测试了三类视频工具但最终主要采用视频裁剪取帧。工具输入返回特点采用情况视频片段字幕起止时间文字描述或字幕压缩视觉信息可能丢失细节候选测试片段视觉问答时间段 子问题子问题答案可验证假设但会引入中间模型误差候选测试视频裁剪取帧start_time, end_time该区间的密集采样帧直接提供视觉证据最利于减少幻觉主要采用核心工具为V k 1 g c l i p ( V 0 , t s t a r t , t e n d ) \mathcal{V}_{k1}g_{clip}(\mathcal{V}_0,t_{start},t_{end})Vk1​gclip​(V0​,tstart​,tend​)即Get_video_clip_frame(start_time, end_time)它不是生成一个新视频文件而是接收原始视频解析模型给出的时间区间在该区间密集抽取帧将帧序列返回给模型。为什么最终选择视频裁剪时间定位任务本身要求预测起止时间密集帧能直接显示动作、对象和事件边界字幕工具可能受语音识别错误影响片段 VQA 会把判断权交给另一个模型让原模型亲自观察证据更有利于抑制幻觉。对应论文表格表 6不同视觉工具的消融比较说明视频裁剪效果最好。4. 多任务训练设计VITAL 同时优化三个相互关联的任务1时间定位Temporal Grounding输入“什么时候有人打开冰箱”输出t_start12.5/t_start t_end14.8/t_end它训练模型理解“事件发生在哪一段时间”。2视频问答Video QA输入“视频中的人最后做了什么”输出“他把书放进了背包。”它训练模型综合视频内容进行推理。3基于定位的问答Grounded QA要求同时输出相关时间段对应答案。它把前两个任务结合起来先找到证据所在时间再依据证据作答。论文认为时间定位与视频问答互为因果、互相促进时间定位帮助模型聚焦关键片段视频问答帮助模型理解为什么要定位该片段Grounded QA 强制模型把答案绑定到视频证据。5. 数据集MTVR-CoT-72k 与 MTVR-RL-110k原始数据来自Charades-STAActivityNet-MRVidChapters-7MVideo-R1LongVideo-ReasonReXTimeNExT-GQA数据筛选策略对每个样本生成 (k8) 条高温度 rollout保留“中等难度”样本全部答对PassAllk太简单RL 学不到新东西全部答错PassNonek太难容易产生噪声梯度部分答对难度适中保留。随后使用强推理模型生成所有样本的基于文本 CoT长视频样本的多模态 CoT长视频时间定位的工具参数在真实时间区间上添加约 20% 噪声长视频 QA 的工具参数由推理模型自主决定。两个数据集的分工数据集规模阶段作用MTVR-CoT-72k约 7.2 万监督微调SFT冷启动学习格式、推理和工具调用MTVR-RL-110k约 11 万强化学习RL优化工具决策、时间定位和答案策略对应论文图示图 4数据 rollout、难度过滤与 CoT 生成流程。图 5两个数据集的构成与用途。6. 两阶段训练第一阶段SFT 冷启动学习目标按指定格式输出思考、工具调用和答案学会初步的时间定位学会根据返回帧修正结论在三个任务间建立共同表示。第二阶段DGRPO 强化学习传统 GRPO 对同一问题的多个 rollout 计算相对优势。VITAL 提出DGRPODifficulty-aware GRPO进一步考虑不同任务的难度差异同任务内不同样本的难度差异全对样本的奖励饱和全错样本的信号噪声。DGRPO 会动态调整奖励尺度使简单 VQA 不淹没困难时间定位困难样本不因偶尔答对而获得过高优势过易、过难样本不主导训练。奖励通常包括答案正确性时间区间 IoU输出格式是否合法工具调用是否合理是否避免无效或重复调用。对应论文公式与表格公式3及后续 DGRPO 推导难度感知奖励缩放。表 7DGRPO 相对普通 GRPO 的增益。表 8难度过滤与数据筛选的消融结果。三、实验结果1. 总体结论VITAL 在11 个视频理解基准上进行评测覆盖长视频问答时间定位片段检索通用视频理解。论文所报告的代表性结果包括基准VITAL 结果对比最佳开源基线提升LongVideo-Reason79.3%67.9%11.4VidChapters-7MR0.534.7%27.4%7.3ReXTimemIoU明显提升—工具带来6.7LongVideo-Reason明显提升—工具带来9.1VidChapters-7MR0.5明显提升—工具带来8.9注不同基准的指标口径不同跨任务百分比不能直接比较上表用于说明收益方向精确数值应以论文对应表格为准。最值得关注的趋势视频越长工具收益越大时间定位能力能迁移到视频问答多模态 CoT 比纯文本 CoT 更可靠DGRPO 能缓解多任务训练中的难度失衡合理的数据筛选比单纯扩大数据更重要。2. 工具到底有没有用论文通过“启用工具 / 不启用工具”进行比较主要结论如下任务工具带来的典型增益原因LongVideo-Reason约9.1长视频初始采样容易漏掉关键事件VidChapters-7M R0.5约8.9时间边界需要密集观察才能校准ReXTime mIoU约6.7起止时间预测需要局部视觉证据短视频 QA较小初始帧已包含大部分信息简单计数/属性题可能为负或接近零工具调用增加成本却无信息增益这说明工具不是“越多越好”模型必须学会只在初始证据不足、回看预期收益较高时调用工具。对应论文表格表 1、表 2VITAL 与现有方法在 11 个基准上的主结果。表 3、表 4工具调用、初始帧数、最大轮次等消融。表 6不同视觉工具的效果比较。四、结果分析1. 为什么多模态 CoT 优于文本 CoT文本 CoT 的失败模式看到稀疏帧 → 猜测事件可能发生在中段 → 用语言推理补齐细节 → 错误逐步累积 → 输出一个听起来合理的答案问题在于一旦初始观察不足后续推理只是在重新组合先验知识没有回到视频验证。多模态 CoT 的修正机制初步观察 → 提出假设“关键事件可能在 200–260 秒” → 调用裁剪工具 → 看到密集帧 → 发现真实事件在 238–251 秒 → 根据画面重新作答关键差别是推理链中存在一个可验证的视觉反馈环节。这相当于把“想当然”变成“提出假设—搜集证据—更新结论”。2. 时间定位为什么能帮助视频问答传统做法常把两个任务分开时间定位模型输入描述输出时间段视频 QA 模型输入视频和 question输出答案。VITAL 发现二者共享底层能力回答“最后谁打开了门”需要先定位“最后”和“开门”回答“两个人物何时第一次相遇”需要同时定位事件和时间回答“为什么主角停下来”需要回溯原因事件发生的时间段。因此VITAL 用时间定位作为表示学习任务学会把语言描述映射到视频时间工具调用任务学会为 QA 选择回看区间可验证监督信号IoU 比开放文本答案更容易客观评判。3. DGRPO 解决了什么假设一个 batch 中同时存在一道简单的是非题一道跨越 30 分钟的时间定位题。若直接使用原始奖励简单题奖励波动小、模型容易全对难题奖励信号弱、训练不稳定简单任务可能主导梯度难题反而学不到有效策略。DGRPO 的难度感知机制相当于给“跳一跳够得着”的样本更高学习权重降低全对与全错样本的干扰。这带来三个效果训练更稳定多任务性能更均衡模型更愿意挑战需要工具调用的困难样本。五、优势、局限与后续方向1. 主要优势按需计算不必把所有视频帧都送入模型可解释思考与工具调用暴露了模型的“关注区间”抗幻觉最终结论可回溯到密集帧证据任务协同时间定位、QA 和 grounded QA 相互促进端到端可训练工具决策与语言生成由同一策略学习长视频收益明显越容易漏掉关键信息的场景工具价值越高。2. 主要局限工具种类有限当前主要使用视频裁剪没有音频分析、目标检测、跟踪、OCR 等工具时间定位仍可能出错第一步定位错误后续观察也会跑偏错误会沿轨迹传播早期思考错 → 工具区间错 → 最终答案错推理时延更高工具调用、解码取帧和第二次生成都会增加延迟训练成本较高需要 rollout、工具执行、奖励计算和轨迹优化最大轮次受限当前实验没有充分展现真正多轮、递归调用工具的潜力基准不可完全横向比较不同方法的基础模型、帧数、视频长度和提示方式并不统一。3. 值得继续研究的方向工具组合裁剪 音频 OCR 目标检测 视频搜索自适应取帧根据动作速度、场景变化和信息熵决定密度多轮递归调用允许“粗定位 → 细定位 → 验证 → 再扩展”调用成本控制把时延、帧数和错误风险写入奖励空间能力增强从“何时”扩展到“何地、何人、何物”真实环境评测在噪声、长尾事件和未剪辑视频上测试可验证奖励改进减少规则奖励对格式和字符串匹配的依赖。
📝

华诺云谱内容团队

资深建站顾问 · 行业研究员

10年+企业数字化服务经验,专注智能建站、SEO优化与品牌营销,持续输出建站技巧、行业洞察与营销干货,已帮助5000+企业实现数字化增长。

你可能需要的服务

订阅华诺云谱资讯周报

每周一封,精选建站技巧、SEO与营销干货,直达邮箱。已有 8,000+ 企业主订阅,助你少走弯路。

↑