MIU-VL
基于预训练视觉-语言模型实现医学影像零样本/少样本目标检测,ICLR 2023 论文开源实现
加载项目详情…
本应用为开源项目,仅供学习研究,请遵守其开源协议。
基于预训练视觉-语言模型实现医学影像零样本/少样本目标检测,ICLR 2023 论文开源实现
加载项目详情…
本应用为开源项目,仅供学习研究,请遵守其开源协议。
想象一个场景:放射科医生每天要审阅数百张 CT 和 X 光片,在海量影像中找到微小的异常区域是一件耗时且易疲劳的工作。传统的深度学习模型需要大量标注数据才能识别某种疾病,而现实中高质量医疗标注数据极度稀缺。由华东师范大学与微软亚洲研究院联合发布的 MIU-VL(Medical Image Understanding with Pretrained Vision Language Models)项目,正是为解决这一痛点而生——它探索如何借助预训练的视觉-语言大模型(VLM),在零样本或少量数据条件下完成医学影像理解任务。

图1:MIU-VL 方法框架总览
MIU-VL 是 ICLR 2023(International Conference on Learning Representations)接收的论文项目,由华东师范大学 OpenMEDLab 团队发布。OpenMEDLab 是一个专注于医疗健康领域大规模预训练基础模型研究的组织,倡导将通用预训练模型适配到医疗场景中。
传统医疗影像 AI 面临的核心矛盾是:模型泛化能力差 vs 标注数据严重不足。ImageNet 预训练的视觉模型直接迁移到医学影像时,由于影像模态差异大(CT/MRI/X光 vs 自然图片)、病灶区域微小且形态多样,往往表现大幅下降。而 GPT 系列大模型的成功启发了一个新思路:既然语言作为通用知识载体能桥接不同任务,那么预训练的视觉-语言双模态模型(VLM)是否也能成为医学影像的"通用接口"?
MIU-VL 正是对这一假设的系统性验证,研究团队在论文标题中用"Comprehensive Study"强调这是一次全面而彻底的探索,而非局部改进。
MIU-VL 的技术核心围绕 Prompt Engineering(提示工程) 在医学影像中的应用展开,整体流程分为两步:
第一步:自动构建富含表达力的医学 Prompt。
研究团队发现,直接将自然语言提示(如"cat"、"dog")迁移到医学领域效果有限,原因是医学概念需要更丰富的属性描述。例如,识别肠息肉(polyp)时,仅仅输入"polyp"不如"The typical color of polyp is [MASK], typical shape is [MASK], typically located at [MASK]"这样包含颜色、形状、位置等属性的 Prompt。后者能激活 VLM 中更多相关知识,显著提升零样本识别精度。
如何自动生成这些属性 Prompt?团队提出了三种方法:
| 方法 | 知识来源 | 显存需求 | 精度 |
|---|---|---|---|
| MLM(掩码语言模型) | BiomedNLP-PubMedBERT | ≥8GB | 中等 |
| VQA(视觉问答) | OFA-base 模型 | ≥24GB | 最高 |
| Hybrid(混合) | MLM + VQA 融合 | ≥24GB | 最高 |
第二步:将 Prompt 注入 GLIP 进行目标检测。
构建好的 Prompt 被送入 GLIP(Grounded Language-Image Pre-training)模型执行目标检测。GLIP 是微软提出的"视觉-语言接地"模型,能将文本 Prompt 与图像区域进行对齐匹配,在给定文本描述的情况下输出图像中对应目标的位置和类别。MIU-VL 的核心贡献在于证明:精心设计的医学 Prompt 比简单标签词能显著提升 GLIP 在医疗影像上的零样本和少样本性能。
图2:零样本实验结果对比
项目在多个公开医学影像数据集上进行了系统评估:
非放射学数据集:
放射学数据集:
实验表明,在零样本设置下,MLM 方法相比基线(简单标签词)平均提升 5-10 个百分点的 mAP;在少样本微调后,VQA 和 Hybrid 方法可达到接近全监督的效果。微调后的 GLIP 模型权重已通过百度网盘分享(需密码)。

图3:微调实验结果对比
代码仓库结构极为简洁(仅含 README 和图片目录),说明这是一个以论文复现为核心的研究型仓库,而非通用工具库。主要依赖:
git clone https://github.com/openmedlab/MIU-VL.git
pip install -r requirements.txt # 基础依赖(基于 GLIP)
git lfs install
git clone https://huggingface.co/microsoft/BiomedNLP-PubMedBERT-base-uncased-abstract-fulltext
# MLM 模式用 PubMedBERT
# VQA/Hybrid 模式还需:
git clone --single-branch --branch feature/add_transformers https://github.com/OFA-Sys/OFA.git
pip install OFA/transformers/
git clone https://huggingface.co/OFA-Sys/OFA-base
使用流程:
MODEL/ 目录autoprompt_json/*.jsontest_vqa.py 执行推理项目也提供了 HuggingFace Gradio 交互式 Demo,可在线体验基础功能而无需本地部署。
主要部署门槛:
适用人群:
不适用人群:
局限性方面,MIU-VL 作为 2022 年的研究工作,存在若干明显局限:
行业意义方面,MIU-VL 的价值在于系统性验证了"VLM + 领域 Prompt"范式在医疗影像上的可行性,启发了后续大量工作将 GPT-4V、Med-PaLM 等更大模型引入医疗场景。它证明了Prompt 设计本身就是一个值得深入研究的方向,而不仅仅是堆模型参数。
对于想快速体验的开发者,建议从 HuggingFace Gradio Demo 入手(见 README 中的链接),在浏览器中上传一张医疗影像即可看到基于 MLM 方法的零样本检测效果。如果想本地复现论文结果,从 MLM 模式 开始,显存需求最低,调试相对简单。
对于研究用途,建议通读论文的 Prompt 设计章节,理解三种方法的设计动机后再做代码修改。需要注意的是,VQA/Hybrid 模式耗时较长(数小时生成一组 Prompt),且需要 24GB+ 显存的 GPU,请确保硬件条件充足后再尝试。
项目基本信息
| 项目 | 内容 |
|---|---|
| 论文 | ICLR 2023 — arXiv:2209.15517 |
| 机构 | 华东师范大学 OpenMEDLab |
| 核心模型 | GLIP-T + PubMedBERT + OFA-base |
| 许可 | CC-BY-NC 4.0 |
| 托管组织 | OpenMEDLab(医疗预训练模型开源组织) |
| 在线 Demo | HuggingFace Gradio(drdoggo-medical-image-understanding-with-vlms) |