LLaVA-Med
微软开源的生物医学多模态大模型,可同时理解医学影像和文本,实现医学影像问答与文献理解
加载项目详情…
本应用为开源项目,仅供学习研究,请遵守其开源协议。
微软开源的生物医学多模态大模型,可同时理解医学影像和文本,实现医学影像问答与文献理解
加载项目详情…
本应用为开源项目,仅供学习研究,请遵守其开源协议。
想象这样的场景:一位放射科医生拿到一张复杂的 CT 影像,面对患者的病史记录和实验室检查结果,传统上需要花大量时间查阅文献、比对病例,才能做出判断。如果这时候有一位 AI 助手,能像经验丰富的医学专家一样,一边「看」影像,一边「读」病历,还能用流畅的中文解释:「从影像看,右肺下叶有一个 1.2cm 的结节,形态学特征与您提到的家族肺癌史需要关联考虑……」这不是科幻,而是 LLaVA-Med 正在努力实现的目标。
LLaVA-Med(Large Language and Vision Assistant for Biomedicine)是微软研究院开源的多模态大模型,专门针对生物医学领域训练,能够同时理解医学图像和自然语言文本,实现医学影像问答、医学文献理解等任务。2023 年 9 月,该论文发表在 NeurIPS 2023 Datasets and Benchmarks Track 并获得 Spotlight 展示,引发学界和业界广泛关注。截至目前,该项目在 GitHub 上已获得超过 2200 颗星标。

通用大模型如 GPT-4V 虽然能力强大,但在医学等专业门槛极高的垂直领域,往往面临「懂但不精」的困境。医学影像的解读高度依赖领域知识——一个 5mm 的肺结节与一个 15mm 的肿块,在影像科医生眼中的意义天差地别;MRI T1WI 和 T2WI 加权相的信号差异,蕴含着丰富的诊断线索。通用模型缺乏对这些细粒度医学知识的系统性学习,容易给出表面正确但缺乏临床深度的回答。
LLaVA-Med 的出现,正是为了填补这一空白。它由微软研究院的华人团队开发,核心成员包括李春园(Chunyuan Li)、黄志峰(Cliff Wong)、张晟(Sheng Zhang)等,团队利用 GPT-4 生成大规模医学影像指令数据,通过课程学习(Curriculum Learning)策略,先进行医学概念对齐,再进行完整的指令微调,将通用领域的 LLaVA 模型「进修」为医学专家。
LLaVA-Med 基于 LLaVA 架构构建,采用了经典的多模态融合设计:

视觉编码器(Vision Encoder):使用 OpenAI 开发的 CLIP ViT-L/14 作为视觉骨干网络,将医学影像编码为视觉特征向量。CLIP 在大规模图像-文本对上预训练,具备较强的跨模态对齐能力,能够将 X 光片、CT 切片、病理切片等不同模态的图像映射到统一的语义空间。
语言模型(Language Model):v1.5 版本采用 Mistral-7B 作为基座大语言模型,支持长达 32K tokens 的上下文窗口,能够处理包含长篇病史记录、影像报告在内的复杂医学文档。相比 v1.0 版本需要使用 delta weight 差分权重更新,v1.5 支持直接从 HuggingFace Hub 直接加载完整权重,大幅简化了使用流程。
多模态投影器(Multimodal Projector):负责将视觉编码器的输出映射到语言模型的输入空间,实现视觉特征与文本 token 的对齐。LLaVA-Med 采用了两层 MLP 投影结构,并在训练过程中冻结视觉编码器,仅微调投影器和语言模型,降低了训练成本。
LLaVA-Med 的创新之处不仅在于模型架构,更在于训练数据的构建方法。团队设计了一套完整的医学影像指令数据生成流程:
首先,从 PMC(PubMed Central)开放获取的生物医学文献中,大规模提取图像-说明(caption)对,获得约 60K 图像-说明配对数据。然后,利用 GPT-4(基于 API)将这些数据转换为指令-following 格式,生成多种类型的问答对(VQA):包括开放式问答、选择题式问答、以及需要结合图像和文本上下文的复杂推理问题。

最终构建的训练数据集包含:
这种「先用 GPT-4 生成高质量数据,再用数据微调小模型」的范式,为后续的生物医学 AI 研究提供了可复用的数据构建方法论。
LLaVA-Med 的核心应用场景包括:
医学影像问答:输入一张医学影像(如胸部 X 光片),可以用自然语言询问影像中的发现。例如问「请描述这张胸片中肺部的异常」,模型能够识别肺野、纵隔、心影等结构,并指出可能的异常阴影或浸润区域。
临床文档理解:结合患者病史文本和影像,模型能够综合分析。例如输入一份包含血糖值、HbA1c 指标的病历摘要,配合患者的眼底照片,模型可以分析糖尿病视网膜病变的可能性和严重程度。
医学文献摘要:可以用于快速理解生物医学文献中的图表,尤其是 Figure 图片对应的实验结果说明。
从 v1.5 版本开始,LLaVA-Med 还支持 Gradio Web UI,提供了开箱即用的交互界面。只需启动 controller、model worker 和 gradio_web_server 三个服务,即可在浏览器中与模型对话,无需编写代码。


LLaVA-Med 作为一个需要 GPU 才能运行的大模型,对硬件有一定要求。v1.5 版本基于 Mistral-7B,FP16 精度下模型权重约 14GB,完整加载需要至少 24GB 显存。如果显存不足(如 RTX 3090/4090 的 24GB 或更低),可以使用多卡分流策略,将模型分布在多张 GPU 上运行。
安装步骤:克隆仓库、创建 conda 环境并安装(pip install -e .)、从 HuggingFace Hub 下载模型权重、分别运行 controller、model_worker 和 gradio_web_server 三个服务。
核心依赖:transformers、accelerate、peft、bitsandbytes(量化支持)、gradio、fastapi、uvicorn、timm 等。其中 bitsandbytes 支持 4-bit 量化,可在保持模型性能的同时将显存需求降低约 50%。
值得注意的是,LLaVA-Med 不提供 Docker 镜像,也没有 docker-compose.yml 配置,因此无法实现一键容器化部署。对于需要快速体验的用户,需要手动配置 Python 环境。不过项目的依赖管理相对规范,pyproject.toml 中明确列出了所有版本约束,安装过程整体可靠。
LLaVA-Med 的定位是研究工具,开发团队明确声明:数据、代码和模型权重仅供研究使用,禁止用于临床诊疗决策,也禁止商业用途。任何基于该模型训练的衍生模型同样只能用于研究目的。此外,数据受 CC BY-NC 4.0 协议约束,不可商用。
从性能角度看,LLaVA-Med 在标准医学 VQA 基准上表现优异,但与 GPT-4V 等闭源商业模型相比,在复杂推理和长文档理解方面仍有差距。尤其是在面对罕见病种、高度个性化的病例时,模型的可靠性尚未经过充分的临床验证。
另一个值得关注的点是数据隐私。由于模型训练数据来自 PubMed 公开文献,模型本身不直接接触患者数据,但用户在使用过程中上传的医学影像涉及隐私保护,需要在使用时自行评估合规风险。
LLaVA-Med 的开源在生物医学 AI 领域具有里程碑意义。它证明了通过 GPT-4 生成高质量指令数据、结合开源基座模型微调的路线,在医学多模态领域同样可行。这种「小模型+领域微调」的范式,相比动辄千亿参数的超大模型,在部署成本和推理效率上具有明显优势,更适合在资源受限的医院信息化环境中落地。
从行业趋势看,医学影像 AI 正从「单模态辅助诊断」向「多模态综合理解」演进。LLaVA-Med 代表的视觉-语言模型,能够同时处理影像、文本等多种输入,为构建真正「懂医学、能对话」的全科 AI 医生助手奠定了基础。
项目信息