谷歌团队在Nat Med最新发表的医学多模态模型,4B参数的模型性能逼近671B的DeepSeek
小罗碎碎念文献来源Sellergren, A., Kazemzadeh, S., Mahvar, F. et al.An open vision-language model for diverse medical applications.Nature Medicine (2026). 研究团队来自 GoogleMountain View, CA, USA及 Google via Advanced Clinical 等合作机构通讯作者为 Andrew Sellergren、David F. Steiner、Daniel Golden 与 Lin Yang。模型集合包括 MedGemma 4B/27B多模态、MedGemma 27B Text纯文本及配套医学图像编码器 MedSigLIP已开源发布。尽管大规模多模态模型large multimodal models在通用视觉理解上展现出惊人能力但通用模型往往缺乏解读与推理医学数据所需的细致医学理解能力——它们能认出这是一张 X 光片却读不出左侧大量液气胸伴引流管在位。与此同时医学 AI 的落地又面临三重现实约束数据来源极其多元放射、皮肤、病理、眼科各有各的图像规范、任务谱系庞杂从分类到报告生成到智能体问诊、以及严格的隐私与本地部署要求。此前的解法要么是训练一个个彼此孤立的专科小模型要么是依赖闭源的前沿模型数据出不了医院、成本下不来、黑盒无法解释。与其为每一种医学影像单独铸造一把钥匙不如先锻造一枚通用医学底座——它既懂医学影像的视觉语言又保留通用大模型的语言与推理能力还能开源、能本地跑、能被研究者二次微调。这正是 Google 团队推出 MedGemma 的出发点一个建立在 Gemma 3 架构之上、经过医学领域预训练与后训练优化的视觉-语言基础模型集合。一句话概括一下这篇文章——让一个模型同时读懂放射影像、皮肤镜、数字病理与眼底照片并在此基础上衍生出从报告生成到智能体问诊的广泛下游应用。左侧是训练所用的数据来源上半部分是四大医学影像模态——放射科胸片、皮肤科皮肤镜、数字病理切片、眼科眼底照片下半部分是两类文本数据——合成生成的电子健康病历EHR文本以及生物医学文献文本。右侧最上方的 MedSigLIP 是一枚仅 4 亿参数的纯图像编码器它只接收医学影像数据不接触文本专长是把一张医学图片压缩成可供下游使用的视觉向量典型用途是医学图像分类与图像检索——比如从医院影像库里自动找出与当前病例最相似的历史胸片。中间的 MedGemma 主体则是多模态大模型家族包含 40 亿4B和 270 亿27B两个参数量版本它同时吃影像、EHR 文本和生物医学文本三类数据能完成放射报告撰写、多模态临床推理看图读病史综合判断以及 EHR 总结与检索——其中 EHR 总结与检索这项高级能力只有 27B 版本支持。最下方的 MedGemma 27B Text 是纯文本版本不接收任何图像输入只处理生物医学文本和 EHR 文本专攻文本临床推理与医学内容总结适合不需要看图、只需要读懂病历和文献的场景。MedX知识岛看完一篇好论文下一步该做什么找代码、查数据还是尝试复现在MedX知识岛既有医学AI领域最新的顶刊复现也有最全面的公开代码和数据库查询系统注册登录即可免费探索让医工交叉领域的前沿探索不再为代码和数据所困一、MedGemma不是简单的微调MedGemma 真正的创新逻辑不在于把一个通用模型塞进医学数据里重新训练而在于一次视觉端与语言端的分头强化、再在顶层对齐的系统工程。MedSigLIP你可以把MedSigLIP理解成一个 4 亿参数的视觉编码器image encoder它的唯一任务是把一张医学图像压缩成模型能读懂的视觉向量。传统做法是直接沿用通用图像编码器比如 SigLIP但通用编码器在自然图像上学到的纹理、色彩概念到了灰度胸片、染色病理切片上几乎全部失效。Google 的做法是把原版 SigLIP-400M 用数百万对医学图像-文本配对数据做了医学微调fine-tuned让这双眼睛从头学会识别肺纹理、细胞异型性、皮肤皮损形态等医学视觉概念。文献特别强调MedSigLIP 不仅是 MedGemma 的视觉底座单独拿出来作为图像编码器使用时其零样本zero-shot图像分类与检索性能已经可以与许多专门训练的医学图像编码器比肩甚至超越。基于 Gemma 3 的语言模型主干MedGemma 并非只有一个模型而是一个家族MedGemma 4B40 亿参数多模态可同时接收文本、图像或两者输入MedGemma 27B270 亿参数多模态MedGemma 27B Text270 亿参数纯文本优化与那些为了医学任务而牺牲通用能力的专科模型不同MedGemma 在医学后训练中刻意保留了 Gemma 3 的通用语言能力——这意味着它既能写放射报告也能做普通指令跟随、能与患者进行多样化对话而不会像许多医学专用模型那样在非医学任务上失效。MedGemma工作流程第一步是视觉端的医学化用数百万医学图像-文本对微调 SigLIP得到 MedSigLIP让模型第一次看懂医学影像的视觉语言。第二步是语言端的医学化对齐在 Gemma 3 主干上用生物医学文本PubMed、医学考试题、临床指南、合成电子健康记录文本与多模态医学数据做后训练把医学知识与视觉理解拧成一股绳。第三步是家族化交付4B 与 27B 两个多模态版本覆盖从轻量部署到高性能需求的不同场景27B Text 版本则专攻纯文本临床推理与医学总结。每一步设计的巧妙之处在于不推倒重来——没有从零训练一个新的大模型而是在成熟的 Gemma 3 架构上做领域适配这使得 MedGemma 既能快速迭代又天然继承了 Gemma 3 的通用能力与开源生态。二、MedGemma 性能验证医学文本问答研究团队在 MedQA、MedMCQA、PubMedQA、MMLU Med、AfriMed-QA、EHRQA 等一系列公开医学考试题上评测 MedGemma。MedGemma 4B 在 MedQA 上达到 86.2% 的准确率这在当时是开源模型中的最佳成绩——仅次于6710 亿参数的闭源模型 DeepSeek-R191.0%却比体量相近的开源模型 OpenBioLLM-70B78.2%高出一截。更值得细品的是 MedHallu 基准上的表现——这个基准专门测试模型能否区分正确答案与听起来合理但实际错误的答案即医学幻觉。在难度最高的 hard set 上MedGemma 4B 得分 0.50而基础 Gemma 3 4B 只有 0.09。这个 5 倍以上的差距说明医学微调不是让模型多答对几道题而是真正教会了它在医学语境下辨别真伪、减少胡编。医学影像分类与视觉问答研究团队在胸片MIMIC-CXR、CheXpert、CXR14、病理PathMCQA、皮肤镜US-Derm MCQA、眼底EyePACS四大影像领域做了零样本分类测试。以胸片为例在分布外OOD的 CXR14 数据集上MedGemma 4B 的 Macro F1 达到 50.1而基础 Gemma 3 4B 只有 32.0在 MIMIC-CXR 的 MAIRA 测试集上MedGemma 4B 为 40.5Gem… 3 4B 仅 26.7。文献给出的整体结论是在分布外任务上MedGemma 相比基础模型在医学图像问答上提升 2.6%–10%在胸片发现分类上提升 15.5%–18.1%。在视觉问答VQA-RAD、SLAKE与胸片报告生成任务上MedGemma 不仅碾压同规模的基础 Gemma 3甚至表现得与体量远大于它的 Gemini 2.5 Flash、Gemini 2.5 Pro 等 API 模型相当。真实医生与真实报告的对照胸片报告生成是放射科医生最耗时的工作之一研究团队用 RadGraph F1 这一衡量报告结构与事实准确性的指标评测 MedGemma经过强化学习RL微调后的 MedGemma 4B 在 MIMIC-CXR 数据集上达到 RadGraph F1 30.3超过了包括 Med-PaLM M、MAIRA-2、CheXagent、Flamingo-CXR、PaliGemma 2、MedVersa 在内的一大批专门为报告生成设计的模型创下该数据集当时的最佳成绩。由三名美国持证临床医生对 MedGemma 生成的报告逐题评分结果显示 68% 的正常研究报告、49% 的异常研究报告被评为等同于或优于原始放射科报告换算成临床决策层面约 81% 的生成报告被认为会导致与原始报告相同或更优的临床决策。作为参照此前更大的 Med-Gemini 模型这一比例为 73%。此外在模拟临床智能体环境 AgentClinic-MedQA 中MedGemma 27B 在患者问诊、检查解读、诊断推理等多轮任务上超过了人类医生的表现——这是一个 270 亿参数的开源模型首次在这类模拟诊疗环境中达到此高度。文献反复强调这一点——对医院、药企、学术实验室而言能在本地、用有限算力跑起一个接近前沿模型医学能力的开源底座其实际价值往往不亚于性能本身。三、从一个模型到一整片生态MedGemma 的意义不止于又一个医学 AI 模型而在于它改变了医学 AI 的生产关系。在它之前一个放射科想做胸片报告 AI要么买闭源 API数据出域、按月付费、黑箱不可改要么从零训一个专科模型需要标注数据、算力团队、数月周期。MedGemma 提供了第三条路一个开源、可本地部署、已具备强医学基础能力的起点研究者只需用自己的数据做轻量微调就能长出适配本院流程的专科应用。文献中一个关键发现直接支撑了这条路——在仅使用 10% 的可用训练数据时微调 MedGemma 4B 仍然优于微调基础 Gemma 3 4B。这意味着对数据稀缺的基层医院、罕见病研究、专科诊所而言MedGemma 是一个数据高效的起点。从应用版图看MedGemma 已经指向了若干具体场景。在肿瘤病理领域它能对数字病理切片做开放提问式分析——文献给出的案例中MedGemma 4B 对一张乳腺病理切片的回答是高级别浸润性癌伴显著细胞异型性与核仁突出提示恶性肿瘤伴侵袭性生长与病理科医生印象浸润性导管癌乳腺癌高度吻合。在皮肤科它从一张皮肤照片中识别出基底细胞癌BCC的珍珠样丘疹与可见血管并建议转诊皮肤科医生确诊。在电子健康记录EHR领域27B Text 版本能做纵向患者数据的跨记录推理——用强化学习微调后需要跨多条病史记录推理的问题类别获得了最大幅度的性能提升。文献还提到一个有趣的下游生态信号开源发布后第三方社区已经基于 MedGemma 搭建了多模态检索增强生成RAG系统用于临床实践指南检索并在 ReXrank.ai 的胸片报告生成公开排行榜上取得了靠前位置。展望未来文献明确指出了几条延伸方向把放射能力从二维胸片扩展到 CT、MRI 的三维序列接入基因组学等更多模态以及让模型在智能体agentic框架中与其他工具组合形成跨模态的综合诊疗助手。而最根本的长期价值在于解锁存量医学数据——全球医院里沉睡着的百万级胸片、病理切片、皮肤镜图像、眼底照片过去因为缺乏统一的视觉-语言底座而无法被高效利用MedGemma 这样的开源底座让这些数据第一次有了一个可以被普遍接入、本地微调、隐私合规的翻译器。MedX知识岛看完一篇好论文下一步该做什么找代码、查数据还是尝试复现在MedX知识岛既有医学AI领域最新的顶刊复现也有最全面的公开代码和数据库查询系统注册登录即可免费探索让医工交叉领域的前沿探索不再为代码和数据所困