资讯详情

ExpVG: Investigating the Design Space of Visual Grounding in Multimodal Large Language Model

📅 2026/9/13 20:05:17 | 华诺云谱 👁 阅读
ExpVG: Investigating the Design Space of Visual Grounding in Multimodal Large Language Model
ExpVG论文总结与关键部分翻译一、文章主要内容本文围绕多模态大语言模型(MLLMs)中的视觉接地(VG)问题展开,以广泛使用的LLaVA-1.5为基准模型,系统探究影响MLLMs视觉接地性能的设计选择,最终提出优化方案并显著提升模型性能。研究聚焦两大核心方向:视觉接地范式设计:系统考察边界框(bbox)相关设计,包括预测格式(十进制、整数、位置令牌等五种)、归一化类型(归一化/非归一化)、监督格式(独热编码、等标签平滑等四种)、边界框格式(左上角右下角坐标等三种)。实验发现,整数预测格式(如“[61, 36, 92, 83]”)、基于图像分辨率的归一化、独热标签结合交叉熵损失、左上角右下角坐标的边界框格式,是最优范式组合。视觉接地数据设计:研究多任务训练协同效应、对话数据组织方式(去重/原始/缩放原始)、对话轮次上限(1-10轮)及训练轮次(1-7轮)对性能的影响。结果表明,仅使用视觉接地数据(而非结合VQA数据的多任务训练)、去除对话中重复答案样本、设置3轮对话上限、训练4轮,能实现最佳数据利用效率与模型性能。最终,整合所有最优设计后,模型在RefCOCO/+/g数据集上较LLaVA-1.5分别提升5.6%、6.9%、7.0%,为MLLMs视觉接地能力的后续发展提供明确指导。二、文章创新点系统性设计空间探索:填补现有研究中MLLMs视觉接地设计缺
📝

华诺云谱内容团队

资深建站顾问 · 行业研究员

10年+企业数字化服务经验,专注智能建站、SEO优化与品牌营销,持续输出建站技巧、行业洞察与营销干货,已帮助5000+企业实现数字化增长。

你可能需要的服务

订阅华诺云谱资讯周报

每周一封,精选建站技巧、SEO与营销干货,直达邮箱。已有 8,000+ 企业主订阅,助你少走弯路。