InternVL
开源多模态大模型家族,2410亿参数逼近GPT-4o,支持图文对话、视频理解与Agent任务
加载项目详情…
本应用为开源项目,仅供学习研究,请遵守其开源协议。
开源多模态大模型家族,2410亿参数逼近GPT-4o,支持图文对话、视频理解与Agent任务
加载项目详情…
本应用为开源项目,仅供学习研究,请遵守其开源协议。

InternVL Family —— 开源多模态大模型家族
想象一下,你上传一张复杂的医学影像,AI 不仅能识别出病变区域,还能结合病历文本给出诊断建议;你拍一张产品设计图,模型就能生成对应的代码实现。这种[视觉+语言+推理]的多维智能,正是 InternVL 家族在做的事情。
InternVL(Intern Vision Language)由上海人工智能实验室(Shanghai AI Lab)的 OpenGVLab 团队开发,是一个开源的大规模多模态模型系列。项目于 2023 年底正式开源,至今已迭代至 InternVL3.5 版本,共斩获超过 10000 颗 GitHub 星标,论文被 CVPR 2024 接收并选为 Oral(口头报告)论文。
如果说 GPT-4V 是多模态领域的闭源旗舰,那么 InternVL 就是开源世界里最接近它的存在。它的目标不是简单复刻,而是用开源的方式,在多个维度逼近甚至在某些任务上超越商业模型的表现。
InternVL 的核心设计哲学是「视觉与语言的深度融合」。与早期将视觉编码器和大语言模型简单拼接的做法不同,InternVL 从架构层面就追求两者的协同优化。项目包含多个子模块:图像分类(classification)、语义分割(segmentation)、图文检索(clip_benchmark)、视频检索(video_retrieval)以及核心的对话系统(internvl_chat)。
InternVL3.5 系列是该项目的最新里程碑。InternVL3.5-241B-A28B 是目前系列中最大的模型,拥有 2410 亿参数、256K 上下文窗口,在多模态感知、推理、语言和 Agent 能力四个维度均达到开源第一。该模型还支持端到端的工具调用和多轮对话,可在网页截图中准确定位 UI 元素并完成操作。
项目还开源了完整的训练数据构建管线(reasoning_data_pipeline)和训练脚本,支持研究者复现和二次开发。特别值得关注的是 MPO(Mixed Preference Optimization)算法和 VisualPRM(多模态过程奖励模型),这些技术已在 InternVL3 的训练中发挥关键作用。
InternVL 的训练数据构建高度工程化。项目开源了两套关键数据管线——MPO 偏好优化数据构建管线和 VisualPRM 过程奖励数据管线,以及对应的训练脚本。这意味着 InternVL 不仅是一个「用模型」的入口,更是一个「改模型」的研究平台。开发者可以在已有管线基础上引入新的数据源、微调自己的偏好数据,或使用 MPO 算法在下游任务上做进一步优化。
InternVL 的部署对硬件要求较高,推荐使用 NVIDIA A100 或更高规格的 GPU,显存需求 24GB 以上(78B 模型需多卡)。好在项目支持 HuggingFace transformers 格式,可以通过 AutoModel 直接加载,配合 Streamlit Demo 可以快速体验 Web 对话界面。flash-attn 加速库是必需依赖,需单独编译安装。
InternVL 提供了相对友好的使用入口。通过 HuggingFace Hub 分发的模型权重,配合 transformers 库只需几行代码即可完成加载和推理。项目内置的 Streamlit Demo 提供了完整的 Web 交互界面,降低了体验门槛。如果只是做 API 调用而非训练验证,个人开发者完全可以在合理配置的 GPU 服务器上运行 7B/8B 等较小规模模型。
InternVL 的出现让开源多模态社区有了真正能与 GPT-4o/Claude Vision 掰手腕的选项。虽然部署门槛不低,但它提供的丰富预训练权重、从 2B 到 241B 的多规格选择、以及完整的训练代码,让从爱好者到专业研究者的不同层次用户都能找到适合自己的切入点。
部署层面,241B 参数的 InternVL3.5-241B 即使是 4-bit 量化也需要多卡并行,入门门槛较高。此外,flash-attn 等加速库在非 NVIDIA 生态或其他特殊硬件环境下安装复杂,可能会让不熟悉 CUDA 环境配置的开发者望而却步。
从行业角度看,InternVL 代表着中国团队在多模态大模型领域已经从「追赶者」成长为「并跑者」。它的持续迭代速度和开源完整性,在全球开源多模态模型中都是头部水准。对于想部署多模态 AI 能力的团队,InternVL 是目前最值得评估的开源选项之一。
从技术演进角度看,InternVL 家族的发展轨迹也映射了整个多模态 AI 领域的快速迭代:从 2023 年底的 InternVL 1.0 到 2025 年的 3.5 版本,仅用不到两年时间就完成了从「追赶 GPT-4V」到「全面对标 GPT-4o」的跨越。这对于推动开源多模态生态的整体水位,具有重要的标杆意义。
图1:InternVL 模型架构概览(图片展示了 InternVL3.5 的整体架构,包括视觉编码器、MLP 适配层与大语言模型的协同设计)