internlm-xcomposer
上海 AI 实验室开源多模态大模型,支持 4K 超高清图像理解、96K 长上下文图文记忆及实时音视频
加载项目详情…
本应用为开源项目,仅供学习研究,请遵守其开源协议。
上海 AI 实验室开源多模态大模型,支持 4K 超高清图像理解、96K 长上下文图文记忆及实时音视频
加载项目详情…
本应用为开源项目,仅供学习研究,请遵守其开源协议。
想象这样一个场景:你在办公室忙碌,突然想起昨天在咖啡馆工作时,把一瓶矿泉水落在了桌上。你希望AI助手能帮你回忆起这个细节。上海人工智能实验室推出的 InternLM-XComposer-2.5-OmniLive(书生·浦语灵笔2.5-OmniLive),正在将这种多模态实时记忆的能力变为现实。
图1:cars1.jpg 多车对比示例
图2:dubai.png 城市景观理解

InternLM-XComposer 是上海人工智能实验室书生大模型体系中的视觉语言旗舰项目,从最初的 1.0 版本发展到如今的 2.5 系列,经历了从静态图文理解到实时多模态交互的重大跨越。整个书生大模型体系覆盖了从 1.8B 到 102B 的多种参数规模,包含语言模型 InternLM2.5、多模态模型 InternVL、强推理模型 InternThinker 等,形成了通专融合的完整生态。InternLM-XComposer 系列自开源以来累计下载量已超过 200 万次,在开源社区拥有广泛影响力。
项目的核心团队来自上海人工智能实验室,该实验室是国内AI领域的重要研究机构,发布的书生系列模型在国际评测中多次取得领先成绩。InternLM-XComposer-2.5 的技术论文发表于 arXiv,并在 MMMU 等权威多模态评测基准上达到了 GPT-4V 级别的能力水平。
InternLM-XComposer-2.5-OmniLive 的最大突破在于实现了看得见、听得懂、记得住的三合一能力:
视觉感知:模型能够实时处理视频流中的视觉信息,从复杂的室内场景中准确识别出矿泉水瓶、盆栽等细节物体。在演示中,研究人员展示了模型如何记住办公桌上的物品位置,展现了超越传统多模态模型的细粒度视觉理解能力。
音频理解:基于轻量级音频多模态大模型,InternLM-XComposer-2.5-OmniLive 能够同时进行语音识别(STT)和音频分类,判断用户指令的背景环境,避免误触发,使得对话更加自然和精准。
长期记忆:这是 OmniLive 版本最具创新性的功能。通过快系统(感知与记忆编码)和慢系统(复杂推理大模型)的协作,模型能够在长时间交互中维持对环境的记忆,在需要时准确检索和调用。
除了 OmniLive,InternLM-XComposer-2.5 还具备强大的图文创作能力。用户可以上传网页截图让模型生成对应的 HTML 代码,或输入作文要求让模型生成高质量的图文文章。该项目还发布了 InternLM-XComposer-2.5-Reward(ACL 2025 Findings),这是一个多模态奖励模型,能够评估图文内容的质量。
InternLM-XComposer-2.5-OmniLive 采用了多模块通专融合的创新架构:
前端通过 Gradio 提供用户交互界面,后端支持 HuggingFace Transformers 和 LMDeploy 推理引擎。在线推理版本还支持 4-bit 量化部署,可在消费级 GPU 上运行(虽然显存需求仍较高)。
Gradio Web UI:项目提供了多个 Gradio 示例(gradio_demo/),包括聊天界面和图文创作界面,适合快速体验。启动方式为运行 gradio_demo_chat.py,通过浏览器访问本地服务即可使用。这是爱好者体验模型最友好的方式。
本地部署:需要准备 conda 环境、安装 PyTorch、transformers、flash-attention2 等依赖包,配置 NVIDIA GPU(推荐 24GB+ 显存)。文档建议使用 CUDA 11.4+,PyTorch 2.0+。如果你有 LMDeploy 经验,可以通过 pip install lmdeploy 快速搭建量化推理服务。
Docker 方式:OmniLive 子模块提供了 Docker 镜像(yhcao6/ixc2.5-ol:latest),适合追求环境隔离的用户,但主项目的 Gradio UI 仍需手动配置。
需要理性看待这个项目的一些局限:首先,硬件门槛高。7B 参数模型在 FP16 精度下需要约 24GB 显存,在 BF16 或更低位量化下仍需 16GB+,普通消费级显卡(如 RTX 4060 Ti 16GB)可以勉强运行但性能受限。其次,依赖管理复杂。安装文档中指定了特定版本的 transformers(4.33.2)、timm(0.4.12)等,版本兼容性可能带来调试成本。此外,OmniLive 的实时视频流处理对网络和算力有较高要求,在生产环境中部署需要专业的工程化改造。
InternLM-XComposer-2.5-OmniLive 代表了多模态大模型发展的重要方向,从静态图文理解到动态实时感知。这一能力对具身机器人、可穿戴智能设备、移动端 AI 助手等场景具有重要价值。ACL 2025 Findings 论文 InternLM-XComposer-2.5-Reward 也表明该项目在多模态 reward modeling 领域做出了实质性贡献。
上海人工智能实验室通过书生大模型体系构建了从数据、训练、部署到评测的完整开源生态,InternLM-XComposer 作为其中的视觉语言旗舰项目,在 HuggingFace 多模态榜单上持续保持高排名,体现了国产开源大模型在全球竞争中的实力。