EVE
首个无编码器视觉-语言大模型,用极简 Patch Embedding 替代重型视觉编码器,简化 VLM 架构并接近主流编码器方案性能
加载项目详情…
本应用为开源项目,仅供学习研究,请遵守其开源协议。
首个无编码器视觉-语言大模型,用极简 Patch Embedding 替代重型视觉编码器,简化 VLM 架构并接近主流编码器方案性能
加载项目详情…
本应用为开源项目,仅供学习研究,请遵守其开源协议。
想象一个场景:科研团队想要构建一个能同时理解图片和文字的 AI 助手。传统的做法需要两个模块——一个专门的"视觉编码器"把图片转成数字向量,一个"语言模型"处理文字,两者之间还要精心设计连接层。这套架构已经被 LLaVA、InstructBLIP 等项目验证有效,但结构复杂、训练成本高昂。
北京智源人工智能研究院(BAAI)和大连理工大学的研究团队提出了一个更激进的思路:能不能把视觉编码器彻底去掉,让语言模型直接"看"图片? 这就是 EVE(Encoder-Free Vision-language model)系列诞生的起点。

图1:EVE 在多项基准测试中的性能表现
过去几年,视觉-语言大模型(VLM)的标准范式是"编码器-解码器"架构:视觉编码器(通常是 CLIP ViT)负责从图像中提取特征,这些特征随后通过一个投影层映射到语言模型的输入空间,LLaVA 正是这一路线的代表作。这套方案虽然有效,但存在几个痛点:
EVE 团队的核心洞察是:与其在编码器端修修补补,不如从零开始探索纯解码器架构——直接用轻量级的 Patch Embedding 层替代重型视觉编码器,让 LLM 自己学会从像素中建立视觉表征。这条路早在 Fuyu-8B 上有人尝试过,但 EVE 首次将性能提升到可以与主流编码器架构正面 PK 的水准。
传统 VLM 的视觉编码器(如 CLIP ViT-L/14)参数规模通常在 300M 以上。EVE v1 采用了极简的 Patch Embedding 层,将图片切成 16×16 像素的小块(patch),每个 patch 通过一个线性投影直接映射为 token 序列。这个投影层参数量很小(约 6M),但足以保留足够的视觉信息供 LLM 学习。
值得注意的是,EVE 的架构支持任意分辨率和宽高比的图像输入,这是传统固定分辨率 ViT 做不到的。v2 版本进一步升级为 EVA-CLIP 作为 patch tokenizer,在保持轻量的同时提升了视觉 tokenizer 的表征能力。
EVE 的训练分为三个阶段:

图2:EVE 想要回答的三个核心问题
v2 版本特别针对 LLM 在视觉训练过程中容易出现的灾难性遗忘问题进行了优化。通过改进的训练策略和 EVA-CLIP tokenizer,v2 在保持语言能力的同时显著提升了视觉理解水平。
EVE 仓库包含两个主要版本:EVEv1(NeurIPS 2024 Spotlight)和 EVEv2(ICCV 2025 Highlight)。核心代码在 eve/ 包中:
eve/model/eve_arch.py — 主模型架构,定义了 Patch Embedding + LLM 的组合方式。eve/model/multimodal_encoder/ — EVA-CLIP encoder(v1)和 vision tokenizer(v2)。eve/model/language_model/ — 支持 Llama-2(v1)和 Llama-3 / Qwen2(v2)作为基础语言模型。eve/train/ — 训练代码,支持 DeepSpeed ZeRO 分布式训练。eve/eval/ — 丰富的评测代码,覆盖 VQA、GPT-Review 等多种评估协议。安装依赖通过 pyproject.toml 管理,核心依赖包括 PyTorch、Transformers、Accelerate、PEFT、FlashAttention 等。评测代码还接入了 GPT-4 辅助评测(eval_gpt_review.py),用于生成更细致的视觉问答评估报告。
研究者和开发者可以通过 Gradio Web UI 快速体验 EVE 的能力。EVEv1 自带 tools/app.py,启动方式为:
conda create -n eve python=3.10
conda activate eve
pip install -e .
python EVEv1/tools/app.py
运行后会自动从 HuggingFace 下载模型权重(EVE-7B-HD-v1.0 或 v2.0),即可在浏览器中上传图片并与模型对话。

图3:EVE 的核心动机——移除编码器,直接用 LLM 处理图像
在多项标准视觉-语言基准测试中,EVE 的表现值得关注:
v2 版本在 v1 基础上进一步优化,在大多数任务上缩小了与模块化编码器架构(如 LLaVA)的差距,同时享有更简单的架构和更低的推理成本。
尽管 EVE 开辟了一条有前景的技术路线,它也存在明显的局限:
EVE 系列的发布在 VLM 领域引发了对"是否真的需要视觉编码器"的深入讨论。它证明了用极简的 patch embedding 替代重型视觉编码器是一条可行的路径,虽然尚未完全超越主流方案,但为未来更高效的视觉-语言模型提供了重要的参考。
从趋势来看,这条路线的意义更多在于探索模型架构的边界:究竟什么是最小化的视觉感知能力?语言模型能否真正"原生"理解视觉信息?这些问题 EVE 给出了阶段性答案,也启发了后续工作(如更强大的 tokenizer 设计、更高效率的训练策略)。
目前 EVE-7B-HD-v2.0 已在 HuggingFace 开源,代码基于 Apache/MIT 许可证,权重遵循 Llama 2 许可(v1)和 Llama 3 许可(v2)。
