资讯详情

ICCV 2025 | M-SpecGene:面向可见光‑红外多光谱视觉的通用基础模型

📅 2026/10/10 2:45:27 | 华诺云谱 👁 阅读
ICCV 2025 | M-SpecGene:面向可见光‑红外多光谱视觉的通用基础模型
01 论文信息论文题目M-SpecGene: Generalized Foundation Model for RGBT Multispectral Vision论文作者Kailai Zhou, Fuqiang Yang, Shixian Wang, Bihan Wen, Chongde Zi,Linsen Chen, Qiu Shen, Xun Cao发表单位南京大学南洋理工大学发表会议\期刊ICCV 2025代码链接https://github.com/CalayZhou/M-SpecGene.02 论文主要贡献首次构建多光谱基础模型 M‑SpecGene探索全新 RGBT 融合范式摆脱对手工定制模块的依赖。精心构建高质量大规模数据集 RGBT550K用于自监督预训练。针对 RGBT 数据集固有特性提出 GMM‑CMSS 渐进掩码策略缓解信息不均衡带来的负面影响。将过去分散独立的研究整合进统一框架在 11 个数据集、4 类 RGBT 下游任务上展现出强大泛化性能。03 方法M‑SpecGene 首先通过 GMM‑CMSS 渐进掩码策略依据信息密度动态选择需要掩码的图像块经过掩码后的可见光与红外图像块输入权重共享的 ViT 编码器再利用一层交叉注意力在隐空间传播互补信息最后使用两个独立的、带自注意力的模态专属解码器分别重建可见光与红外被掩码的像素。针对每一组图像块特征对(a,b)定义跨模态结构稀疏度mCMSS(a,b)1a∣a∣,b∣b∣2σa2σb2mCMSS(a, b)\frac{1\frac{a}{|a|}, \frac{b}{|b|}}{2 \sigma_{a}^{2} \sigma_{b}^{2}}mCMSS(a,b)2σa2​σb2​1∣a∣a​,∣b∣b​​分子代表可见光、红外图像块嵌入之间的余弦相似度分母由 a、b 的结构方差构成。输出 m 归一化到 0‑1 区间。使用高斯混合模型通过极大似然估计拟合全部 CMSS 分布p(m)∑k1KπkN(m∣μk,∑k)p(m)\sum_{k1}^{K} \pi_{k} \mathcal{N}\left(m | \mu_{k}, \sum_{k}\right)p(m)∑k1K​πk​N(m∣μk​,∑k​)K 代表高斯分量数量默认设置为 3πk\pi_kπk​是第 k 个高斯分量权重N\mathcal{N}N代表高斯分布包含均值μk\mu_kμk​、方差∑k\sum_k∑k​。计算每个样本属于第 k 个高斯分量的后验概率之后利用后验概率更新高斯混合模型参数αikπkN(mi∣μk,∑k)∑i1KπkN(mi∣μk,∑k)\alpha_{i k}\frac{\pi_{k} \mathcal{N}\left(m_{i} |\mu_{k},\sum_{k}\right)}{\sum_{i1}^{K} \pi_{k} \mathcal{N}\left(m_{i} | \mu_{k}, \sum_{k}\right)}αik​∑i1K​πk​N(mi​∣μk​,∑k​)πk​N(mi​∣μk​,∑k​)​{μk∑i1B×p×pαikmi∑i1B×p×pαik∑k∑i1B×p×pαik(mi−μk)(mi−μk)T∑i1B×p×pαikπk∑i1B×p×pαikB×p×p\begin{cases} \mu_{k}\frac{\sum_{i1}^{B × p × p} \alpha_{i k} m_{i}}{\sum_{i1}^{B × p × p} \alpha_{i k}} \\ \sum_{k}\frac{\sum_{i1}^{B × p × p} \alpha_{i k}\left(m_{i}-\mu_{k}\right)\left(m_{i}-\mu_{k}\right)^{T}}{\sum_{i1}^{B × p × p} \alpha_{i k}} \\ \pi_{k}\frac{\sum_{i1}^{B × p × p} \alpha_{i k}}{B × p × p} \end{cases}⎩⎨⎧​μk​∑i1B×p×p​αik​∑i1B×p×p​αik​mi​​∑k​∑i1B×p×p​αik​∑i1B×p×p​αik​(mi​−μk​)(mi​−μk​)T​πk​B×p×p∑i1B×p×p​αik​​​得到高斯混合模型拟合参数后本文提出 GMM‑CMSS 渐进掩码策略采样函数S(x)∑k1KπkN(x∣μ^kμ^bias,∑^k),K1,2,...S(x)\sum_{k1}^{K} \pi_{k} \mathcal{N}\left(x | \hat{\mu}_{k}\hat{\mu}_{bias }, \hat{\sum}_{k}\right), K1,2, ...S(x)∑k1K​πk​N(x∣μ^​k​μ^​bias​,∑^​k​),K1,2,...μ^k\hat{\mu}_kμ^​k​、∑^k\hat{\sum}_k∑^​k​分别代表第 k 个高斯采样模型的均值与方差μ^bias\hat{\mu}_{bias}μ^​bias​为用于模态平衡的均值采样偏置。每一轮迭代中采样函数生成采样点从当前批次 CMSS 样本中挑选距离采样点最近的部分样本作为掩码块。r 为掩码比例rbiasr_{bias}rbias​是根据模态损失差自适应调整的偏置项。04 实验4.1 SOTAFLIR 与 LLVIP 数据集上ViT‑S 版本性能和 UniRGB‑IR 接近ViT‑B 版本充分发挥基础模型能力检测精度超过现有方法。UniRGB‑IR 的 ViT‑B 需要先在 COCO 数据集预训练而本文 M‑SpecGene 不依赖高质量可见光检测数据集做额外增强。4.2 消融(a)从头无预训练 ViT 在 FLIR 数据集 mAP50 较差,可见光分类有监督预训练有所提升可见光普通 MAE 自监督预训练 ViT 相比 ImageNet 监督预训练提升,先初始化再在成对可见光‑红外数据使用 GMM‑CMSS 渐进掩码做自监督预训练进一步提升到 44.7%。(b)Vanilla MAE把 RGB 图像和红外图像简单拼在通道维度当成一张 4 通道图片直接丢进普通原版 MAE 网络。通道拼接两套完全独立 ViT 编码器权重互不共享可见光红外图像在通道维度拼接两套解码器各自重建。辅助分支共享编码器处理互补掩码图像块红外特征作为辅助信息通过交叉注意力帮助可见光解码器重建掩码区域孪生架构两种模态由共享编码器学习一致表示各自配备独立解码器。©对比随机掩码、仅低 CMSS 区域掩码、仅高 CMSS 区域掩码、GMM‑CMSS 渐进掩码。(d)解码器 4 层模块时最优。说明在孪生架构搭配两套独立解码器条件下可以降低 MAE 默认解码器深度。(e)掩码比例 90% 取得最优掩码比例过低降低重建难度性能小幅下降掩码比例过高会削弱 GMM‑CMSS 策略效果。05 个人声明本文为作者对原论文的学习笔记与心得分享受个人学识与理解所限文中对论文内容的解读或有不够周全之处一切以原论文正式表述为准。本文仅用于学术交流与传播内容均由作者独立整理完成不代表本公众号立场。如文中所涉文字、图片等内容存在版权争议请及时与作者联系作者将在第一时间核实并妥善处理。
📝

华诺云谱内容团队

资深建站顾问 · 行业研究员

10年+企业数字化服务经验,专注智能建站、SEO优化与品牌营销,持续输出建站技巧、行业洞察与营销干货,已帮助5000+企业实现数字化增长。

你可能需要的服务

订阅华诺云谱资讯周报

每周一封,精选建站技巧、SEO与营销干货,直达邮箱。已有 8,000+ 企业主订阅,助你少走弯路。

↑