PersonaVLM
基于 Qwen2.5-VL 的长期个性化多模态 AI 助手,通过 R3 范式实现跨会话记忆与性格对齐
加载项目详情…
本应用为开源项目,仅供学习研究,请遵守其开源协议。
基于 Qwen2.5-VL 的长期个性化多模态 AI 助手,通过 R3 范式实现跨会话记忆与性格对齐
加载项目详情…
本应用为开源项目,仅供学习研究,请遵守其开源协议。
想象这样一个场景:半年前,你曾和 AI 聊过一次关于你养猫的事——你家那只英短叫「年糕」,它喜欢在你工作的时候趴在键盘上捣乱。半年后,当你再次打开对话窗口,有没有可能 AI 不仅记得这件事,还能记得年糕的习性、记得你当时的情绪状态,甚至能根据你们一贯的互动风格来生成回复?
这就是 PersonaVLM 试图解决的核心问题——长期个性化多模态大模型。
大型多模态模型(MLLM)在单轮对话中已经表现出令人惊叹的能力,但它们普遍存在一个致命缺陷:无法建立长期记忆。每次对话结束后,所有上下文都被清空。下一次相遇,AI 重新变成一个对你一无所知的陌生人。
在真实的应用场景中——医疗助理、教育陪伴、情感陪伴、个人管家——「认识你」本身就是核心价值。一个记不住用户偏好、情绪状态和历史行为的 AI,永远无法成为真正的「助手」。
PersonaVLM 由南京大学媒体与智能实验室(MiG-NJU)提出,是 CVPR 2026 会议 Highlight 论文。团队认为,要实现真正的长期个性化,AI 需要解决三个核心挑战:
团队将这个过程称为 「R³」范式——主动记忆检索、多步推理、基于人格的回应对齐。

图:PersonaVLM 核心架构,通过多类型记忆库与 PEM 个性化进化机制实现长期个性化
PersonaVLM 将用户历史对话分解为四种类型的记忆,分别存储在不同的 FAISS 索引中:
| 记忆类型 | 内容 | 特点 |
|---|---|---|
| Core Memory | 用户核心信息(姓名、职业、长期目标) | 高频检索,最稳定 |
| Semantic Memory | 语义知识(用户对某事物的观点、偏好) | 中频,需要理解上下文 |
| Episodic Memory | 具体事件记忆(某年某月发生的事) | 低频,但精准匹配 |
| Procedural Memory | 行为模式(用户习惯的操作方式) | 跨场景泛化 |
这种分层设计借鉴了认知科学中经典的记忆理论,但在多模态场景下做了大量适配——记忆不仅要存储文本,还要能处理图像、视频等多模态信息,检索层使用 CLIP 和 Sentence-Transformer 对多模态内容进行统一向量化。
传统个性化方法假设用户特征是静态的,但真实用户的兴趣、偏好和性格会随时间演变。PersonaVLM 引入了一个动量驱动的个性进化机制:
在 Persona-MME 基准测试中,使用 PEM 的模型在个性化任务上比基线方法提升了 22.4%。
PersonaVLM 基于 Qwen2.5-VL 构建,通过两阶段训练(SFT + GRPO)将通用 MLLM 转化为个性化助手。有一个值得关注的工程细节:Qwen2.5-VL 原生不支持在同一个 batch 中混合纯文本和图文样本,团队通过为纯文本样本追加「虚拟对话」并在损失计算时 mask 掉最后一步来解决这个问题。

图:Persona-MME 基准测试概览,包含 2000+ 评估案例,覆盖 14 个细分个性化任务
PersonaVLM 的核心评测在团队自建的 Persona-MME 基准上进行,这是目前首个专门评估多模态大模型长期个性化能力的 benchmark。
关键结果(128k 上下文设置):
这意味着在需要理解用户长期偏好和历史行为的任务中,PersonaVLM 已经可以与最先进的闭源商业模型一较高下——而且是完全开源的。

图:PersonaVLM 与主流模型的性能对比

图:Persona-MME 排行榜
git clone https://github.com/MiG-NJU/PersonaVLM.git
cd PersonaVLM
conda create -n PersonaVLM python=3.10 -y && conda activate PersonaVLM
pip install -r requirements.txt
# 下载模型权重到 ./checkpoints/rl(HuggingFace)
# 下载 CLIP 和 Sentence-Transformer 到 ./checkpoints/
python inference.py
推理脚本支持两个关键参数:--force-retrieve(强制每次检索记忆)和 --reasoning-mode(是否启用多步推理)。
最直观的体验方式是启动 Gradio 可视化界面,可以实时观察 AI 的「R³」认知过程:
python gradio_demo.py

图:Gradio 交互界面,可视化展示 R³ 认知过程
python eval.py --model_path ./checkpoints/rl --bench_context 32k --save_dir ./output/results
完整的 SFT + GRPO 两阶段训练需要 8 张 A100 80GB GPU。训练依赖 ms-swift 框架和 vLLM 部署的奖励模型(Qwen3-30B-A3B-Instruct)。
1. 硬件门槛高:推理至少需要 16GB 显存 GPU,完整训练需要 8 卡 A100,量化版本尚未发布。
2. 记忆存储简陋:当前以本地 FAISS 索引存储在 ./output/{username}/ 目录,多用户场景需额外工程工作。
3. 评测基准单一:Persona-MME 由团队自建,可能存在评估偏差。
PersonaVLM 提出了一个可复用的个性化框架。「R³」范式 + 多类型记忆 + PEM 进化机制,构成了一套可以嫁接到其他 MLLM 上的方法论。随着 Agent 概念的火热,能够在多次会话中积累用户理解的 AI 助手,将成为下一代人机交互的核心形态。
相关信息: