SlideChat
首个支持千兆像素全切片病理图像理解的多模态视觉-语言助手,CVPR 2025 接收,在 22 项任务中取得 18 项 SOTA
加载项目详情…
本应用为开源项目,仅供学习研究,请遵守其开源协议。
首个支持千兆像素全切片病理图像理解的多模态视觉-语言助手,CVPR 2025 接收,在 22 项任务中取得 18 项 SOTA
加载项目详情…
本应用为开源项目,仅供学习研究,请遵守其开源协议。
想象你是三甲医院病理科的医生,每天要看上百张病理切片。常规的活检切片还好,但肺癌、乳腺癌等癌症的全切片图像(Whole Slide Image,WSI)——每张都是十亿像素级别的超大图像,文件体积可达数 GB,显微镜下需要反复放大、缩小、切换倍率才能完成诊断。
传统的 AI 辅助诊断模型只能处理切片中的一小块"窗口"(patch-level),医生还是要自己拼凑全局信息。有没有办法让 AI 像真正的读片助手一样,理解整张切片的上下文语境?
2024 年,厦门大学、清华大学及上海人工智能实验室的研究团队发表了 SlideChat,这是全球首个能够理解千兆像素级全切片病理图像的多模态视觉-语言助手。2025 年 2 月,该论文被计算机视觉顶级会议 CVPR 2025 接收。
SlideChat 可对整张病理切片进行整体理解,生成描述性文字或回答医生的问题
全切片图像理解的核心难点在于超大的数据尺寸——一张 WSI 可能包含数十万个图像块(patches),传统方法要么下采样丢失细节,要么只能局部处理忽略上下文。
SlideChat 的设计思路很巧妙,它采用了两级编码器架构:
第一级:Patch-level 编码器(CONCH) 项目采用业界领先的 CONCH(Contrastive learning for Histology) 作为 Patch-level 视觉编码器,将每个小图块转换为 512 维的视觉特征向量。CONCH 在大规模组织病理学图像上进行了预训练,对组织形态学特征有很强的感知能力。
第二级:Slide-level 编码器 SlideChat 创新性地引入了一个 Slide-level 编码器,它能"鸟瞰"所有 Patch 级别的特征,学习它们之间的空间关系和全局上下文,最终生成切片级的特征表示。
多模态投影层 将视觉特征映射到 LLM 的语言空间,与大语言模型的 token 对齐,使其能够"理解"视觉内容并生成自然语言描述。
两阶段训练:跨域对齐(Stage 1)和视觉指令学习(Stage 2)
SlideChat 的训练分为两个阶段:
Stage 1 — 跨域对齐(Cross-Domain Alignment) 使用 4,200 对 WSI-描述文本(来自 SlideInstruction 数据集),只训练 Slide-level 编码器和投影层,LLM 参数冻结。这一步让视觉特征学会"说人话"——将 patch 特征和切片描述对应起来。
Stage 2 — 视觉指令学习(Visual Instruction Learning) 放开 LLM 的全部参数,使用 176,000 个 WSI VQA(视觉问答)对进行指令微调。这一步让 SlideChat 学会回答具体的医学问题,比如"这个区域有没有恶性肿瘤?"、"Ki-67 增殖指数大概是多少?"。
SlideChat 背后的 SlideInstruction 数据集本身就是一项重大贡献:
SlideBench 基准测试显示,SlideChat 在 22 项任务中的 18 项达到了最优性能(SOTA),在 TCGA 扩展数据集上准确率达 74.12%。
训练成本:Stage 1 需要约 3 小时(8x A100 80GB),Stage 2 需要约 24 小时(8x A100 80GB)。对于普通研究团队来说,这是一个非常高的硬件门槛,需要有多卡 A100 的计算集群才能复现。
推理成本则友好得多:
使用 xtuner test 命令进行推理,只需指定配置文件、检查点路径和测试数据 CSV 文件即可。需要从 HuggingFace 下载预训练模型和 TCGA 特征数据集(CSV 格式,512维特征向量)。
SlideChat 没有提供 Web 界面,面向的是有 ML 训练经验的研究人员。需要熟悉:
安装流程(README 官方推荐):
conda create --name xtuner-env python=3.10 -y
conda activate xtuner-env
git clone https://github.com/uni-medical/SlideChat.git
cd SlideChat
pip install -e .
推理示例:
xtuner test configs/slidechat/stage_2.py \
--checkpoint stage2_pth \
--test_slide_csv SlideBench-VQA\(TCGA\).csv \
--test_output_csv output_my_test.csv \
--local_rank 0
SlideChat 的价值不仅在于论文本身的 SOTA 性能,更在于它首次证明了"全切片级别的视觉-语言理解"是可行的。在此之前,学界普遍认为 WSI 的巨大尺寸是 VLM 无法逾越的障碍。
该项目配套开源了完整的数据集(SlideInstruction)和基准测试(SlideBench),为后续研究者提供了标准化的评测环境和大规模训练数据。CVPR 2025 的接收也意味着这个方向得到了国际顶级学术界的认可,预计将引发一轮 WSI 视觉-语言模型的研究热潮。