LISA
首个融合大语言模型推理能力与图像分割的多模态模型,支持复杂语义推理分割
加载项目详情…
本应用为开源项目,仅供学习研究,请遵守其开源协议。
首个融合大语言模型推理能力与图像分割的多模态模型,支持复杂语义推理分割
加载项目详情…
本应用为开源项目,仅供学习研究,请遵守其开源协议。
你可能见过这样的场景:给 AI 一张奥巴马的照片,问它「图片里谁是美国总统」,AI 能准确回答「奥巴马」。但如果你追问「请把这个人分割出来」——也就是标出他在图中的像素区域——大多数多模态模型就哑火了。它们能「看懂」图像,却画不出一个轮廓。
LISA(Large Language Instructed Segmentation Assistant) 正是为了解决这个矛盾而诞生的。这是一个由香港中文大学团队开发的开源项目,它让大语言模型拥有了「推理分割」的能力——不仅能理解复杂语义,还能精确定位到图像的每一个像素。2024 年 6 月,这项工作被 CVPR 2024 收录为 Oral Presentation(口头演讲),这是计算机视觉顶会中的最高宣读形式之一,含金量不言而喻。
LISA 的核心论文《LISA: Reasoning Segmentation via Large Language Model》由香港中文大学贾佳亚教授团队完成,初版于 2023 年 8 月在 arXiv 发布。论文第一作者赖欣(Xin Lai)此后持续深耕该方向,于 2024 年 12 月推出了升级版 LISA++,进一步引入视觉链式推理(Visual COT)数据,显著增强了模型的全局理解能力。
团队成员阵容堪称豪华:除了赖欣外,还包括田卓涛(CVPR 最佳学生论文得主)、陈毓康、袁煜熙等多位在计算机视觉领域发表过顶会论文的青年学者。指导教授贾佳亚更是 CV 领域的老牌劲旅,曾在商汤科技担任首席技术官。这样的背景让 LISA 从诞生起就不只是「学术 Demo」,而是带着工程化落地目标去设计的。

图1:LISA 核心架构图
从技术演进脉络来看,LISA 站在了三个「巨人」的肩膀上:基于 LLaVA 的多模态语言模型能力、基于 Segment Anything Model(SAM) 的通用分割能力,以及大量精细标注的推理分割数据集 ReasonSeg。它的核心创新在于:将 LLM 的语言生成能力与 SAM 的图像分割能力通过 LoRA 微调巧妙结合,让模型学会「边推理边分割」。
传统图像分割任务要求模型根据明确的指令定位目标,比如「分割出图片中的猫」。但 LISA 处理的是更复杂的场景——隐式语义 + 推理需求的组合指令。
项目 README 中展示了大量令人印象深刻的案例:

图2:推理分割效果——输入复杂推理指令,模型准确分割目标人物。
这些例子揭示了 LISA 与传统分割模型的根本区别:它不是在做「匹配」,而是在做「推理」。模型需要理解「谁是总统」「什么是让女人站得更高的东西」「什么是不寻常的」这些抽象概念,然后将理解映射到图像的具体像素上。
在基准测试中,LISA 同样表现优异。团队构建的 ReasonSeg 评测集包含 1218 张图片(239 训练、200 验证、779 测试),涵盖复杂推理链和世界知识。结果显示,仅用 239 个推理分割样本进行微调,LISA-13B 就能在 ReasonSeg 上大幅超越基线模型。

图3:LISA 在推理分割基准上相对传统模型的显著优势。
从代码结构来看,LISA 的技术栈非常清晰,核心依赖两个关键组件:
1. LLaVA 多模态语言模型 LISA 基于 LLaVA(Large Language and Vision Assistant)架构,这是一个将视觉编码器(CLIP ViT)与 LLM(Vicuna/Llama2)通过投影层连接的经典多模态方案。LLaVA 赋予 LLM「看图说话」的能力,而 LISA 在此基础上增加了分割输出通道。
2. Segment Anything Model(SAM) SAM 是 Meta 发布的通用分割模型,以 ViT-H 为骨干,能够对任意图像给出高质量的分割掩码。LISA 并没有抛弃 SAM,而是将 SAM 的分割能力接入 LLM 的输出层——LLM 负责决定「分割哪里」和「为什么」,SAM 负责「怎么分割」。两者通过 LoRA 权重微调实现协同。
代码结构印证了这一设计:model/LISA.py 是核心模型类,model/llava/ 是 LLaVA 架构,model/segment_anything/ 是 SAM 组件,train_ds.py 是分布式训练脚本,chat.py 是命令行推理入口,app.py 是 Gradio Web 界面。
在推理精度方面,README 明确标注了显存消耗参考:
| 模型规模 | 精度 | 显存需求 |
|---|---|---|
| LISA-13B | fp16/bf16 | 约 30GB |
| LISA-13B | 8bit 量化 | 约 16GB |
| LISA-13B | 4bit 量化 | 约 9GB |
| LISA-7B | fp16 | 约 16GB |
这种灵活的量化支持让 13B 模型可以在消费级 GPU(如 RTX 3090/4090)上运行,极大降低了使用门槛。
对于普通用户,LISA 提供了一条相对友好的上手路径:
方式一:Gradio 网页 Demo(最简单) 团队在 HuggingFace 和 OpenXLab 上提供了在线 Demo,可以直接上传图片并输入推理指令,实时查看分割结果。团队还自建了一个 Demo 服务器(http://103.170.5.190:7860/),适合国内用户访问。
方式二:本地命令行推理(适合开发者)
pip install -r requirements.txt
pip install flash-attn --no-build-isolation
# 4bit 量化,9GB 显存
python chat.py --version='xinlai/LISA-13B-llama2-v1' --precision='fp16' --load_in_4bit
方式三:本地 Web 界面(适合展示)
python app.py --version='xinlai/LISA-13B-llama2-v1 --load_in_4bit'
不过需要注意的是,LISA 的部署仍然存在一定门槛:需要 NVIDIA GPU、CUDA 11.7+ 环境、50GB+ 磁盘空间(存放模型权重),以及从 HuggingFace 下载约 26GB 的 LLaVA 底座模型。没有 Docker 支持,纯手动安装。

图4:分割「图片中不寻常的部分」——准确找到戴驯鹿角的狗。
尽管 LISA 在推理分割任务上表现出色,但它并非没有局限:
1. 对复杂场景的处理能力有限 当图像中包含多个相似目标,或指令涉及复杂的空间关系时,分割精度会显著下降。LLM 在处理长程依赖时本身存在局限,而像素级分割对位置精度要求极高。
2. 部署依赖较重 尽管支持 4bit 量化,但完整的 LLaVA + SAM + LoRA 模型栈仍然需要较大的显存和磁盘空间。对于没有 GPU 的用户,目前没有云端 API 或服务端方案可用。
3. 缺乏视频支持 当前版本仅支持静态图像分割,不支持视频帧序列推理。这限制了它在视频监控、自动驾驶等实时场景中的应用。
4. 评测基准规模偏小 ReasonSeg 评测集仅有 1218 张图片,与 COCO(33 万张)的规模相比仍有较大差距,可能导致模型在某些细分场景下的泛化能力被高估。
5. 训练数据准备工作量大 LISA 的训练需要整合 ADE20K、COCO-Stuff、refCOCO 等多个公开数据集,构建完整的训练环境需要大量数据准备工作,增加了研究复现的难度。
LISA 的出现对整个多模态 AI 领域具有重要的方向性意义。
它证明了 LLM 不只能「描述」图像,还能「操作」图像。 传统的多模态模型(如 LLaVA、GPT-4V)将图像理解限制在「输出文字描述」的层面,而 LISA 打破了这一天花板——它让模型能够生成像素级的结构化输出,这意味着 AI 可以真正参与图像编辑、视觉推理、工业检测等需要精确定位的下游任务。
推理分割是一个尚未被充分探索的蓝海赛道。 在 LISA 之前,学术界对分割任务的研究主要集中在语义分割、实例分割和全景分割,这些都是「显式指令」驱动的任务。LISA 开创的「推理分割」要求模型在理解语义的基础上进行推理,这一新范式迅速引发了后续研究的跟进。
开源生态的价值同样值得关注。 LISA 完整开源了训练代码、推理代码、Web Demo、ReasonSeg 数据集和多个模型权重(HuggingFace)。这种全面的开源姿态在 CV 领域并不常见,为学术研究和工程落地提供了宝贵的一站式参考。

图5:分割「阿里巴巴创始人」——即便图片中未出现人名,模型也能通过知识推理定位目标人物。
LISA 的快速迭代也值得关注:2023 年 8 月发布 v0 版本,2023 年 12 月即推出 LISA++,2024 年 6 月获得 CVPR Oral。整个项目保持着活跃的更新节奏,GitHub Issues 有 115 条开放讨论,说明社区参与度较高。
对于 AI 开发者而言,LISA 提供了一个极具参考价值的多模态模型微调范式:如何将一个「生成式」的 LLM 与一个「判别式」的 SAM 有机结合,如何设计指令微调数据集来解锁新能力,如何在精度和效率之间通过量化找到平衡点。这些工程经验对于构建自己的多模态应用具有直接的借鉴价值。
总结:LISA 是一款具有真正技术创新的多模态推理分割工具,适合对图像语义理解和像素级定位有复合需求的 AI 研究者和开发者。虽然部署门槛不低,但它提供的推理分割能力是当前开源生态中极为稀缺的能力节点。