Anomaly-OneVision
Honda 研究院开源的多模态大模型异常检测框架,基于 Qwen2 + LLaVA-OneVisio
加载项目详情…
本应用为开源项目,仅供学习研究,请遵守其开源协议。
Honda 研究院开源的多模态大模型异常检测框架,基于 Qwen2 + LLaVA-OneVisio
加载项目详情…
本应用为开源项目,仅供学习研究,请遵守其开源协议。

图1:Anomaly-OV 项目官方 Logo
想象一下这样的场景:工厂流水线上,质检员每天要盯着成千上万张零件照片寻找微小的裂纹和划痕。传统方法依赖人工或特定规则,漏检率高且效率低下。而 Honda 研究院带来的这项技术,让 AI 能够像经验丰富的工程师一样,仅凭少量正常样本的记忆,就能精准识别从未见过的异常情况——这就是 Anomaly-OV(Anomaly-OneVision),CVPR 2025 收录并获得 Highlight 认可的多模态异常检测与推理框架。
这篇论文的全称是《Towards Zero-Shot Anomaly Detection and Reasoning with Multimodal Large Language Models》,由 Honda Research Institute 团队(Xu Jiacong、Lo Shao-Yuan、Safaei Bardia 等)提出并开源。与传统工业缺陷检测系统需要大量异常样本训练不同,Anomaly-OV 依托多模态大语言模型的理解与推理能力,实现了真正的零样本异常检测——只需正常样本作为参考,模型即可泛化识别未知缺陷类型,并给出可解释的推理说明。
从项目命名就能看出,这是一个围绕 OneVision 统一架构打造的异常检测平台。它源自 LLaVA-OneVision 家族(LLaVA 是多模态 LLM 领域的里程碑工作),在此基础上针对工业缺陷、医疗影像等场景进行了专门的视觉指令微调,贡献了 125k 规模的 Anomaly-Instruct 数据集和 VisA-D&R 评测基准。
Anomaly-OV 提供两个规模的模型:7B 参数的 Anomaly-OV-7B 和 0.5B 参数的 Anomaly-OV-0.5B。前者精度更高,适合生产环境部署;后者轻量化,适合边缘设备和快速验证。两个模型权重文件均在仓库中直接提供(每个约 27GB),Apache-2.0 许可证允许商业使用。
在实际应用中,Anomaly-OV 展现了令人印象深刻的推理能力。当输入一张包含轻微划痕的刹车盘照片时,模型不仅能准确标记出缺陷区域,还能解释这里有一道细长划痕,可能由加工过程中的硬质颗粒引起——这种可解释性对于工业质检场景至关重要。相比之下,传统异常检测方法通常只输出热力图或置信度分数,缺少对缺陷成因的语义理解。
需要注意的是,虽然 Cog 配置文件(cog.yaml)引用了 predict.py 作为推理入口,但该文件在仓库中暂未提供(README 中标注为 TBD,即待实现)。这意味着当前版本更偏向研究用途,而非开箱即用的生产工具。对于想快速体验的开发者,可以直接使用 scripts/eval/test_chat_single.py 进行单图对话,或通过 scripts/eval/test_detection.py / test_reasoning.py 运行批量评测脚本。
从技术架构来看,Anomaly-OV 延续了 LLaVA 系列的标准 Pipeline:Qwen2 系列(Qwen2-7B / Qwen2-0.5B)作为语言基座,SigLIP / EVA-CLIP / OpenCLIP 组成的视觉编码器负责图像理解,Q-Former 和 MLP 投影器将视觉特征对齐到语言空间。训练环节使用 LoRA 高效微调,融合了 DPO(Direct Preference Optimization)偏好对齐策略。预训练阶段引入了 Real3D-AD、Anomaly-ShapeNet 等 3D 异常数据集,以及 MVTec AD、VisA 等 2D 工业缺陷数据。
项目仓库的代码组织非常清晰,llava/model/ 下包含多模态编码器(multimodal_encoder)、投影器(multimodal_projector)、重采样器(multimodal_resampler)和语言模型接口(language_model)的完整实现。llava/train/ 提供了 SFT、DPO 等多种训练流程。scripts/eval/ 下则集中了检测、推理、聊天三种评测入口,scripts/train/ 包含 0.5B 和 7B 模型的微调脚本。
依赖方面,requirements.txt 包含 324 个包,核心依赖包括 PyTorch 2.x、Transformers(HuggingFace 定制版)、accelerate、deepspeed、bitsandbytes 量化库等。值得注意的是,项目依赖特定的 Transformers commit(commit hash 1c39974a),而非 PyPI 最新版,这要求使用 pyproject.toml 安装以确保依赖一致性。

图2:Anomaly-OV 单图异常检测示例——输入包含轻微缺陷的 STOP 标志图片,模型识别异常区域并给出推理说明
生产级推理脚本缺失:cog.yaml 中定义的 predict.py 尚未实现,当前只能通过命令行脚本评测,缺少真正的 Web API 或服务化入口,降低了工业集成的便利性。
超大批量模型权重:两个预训练专家模型各约 27GB,需要特殊存储配置(推荐 NVMe SSD),对存储和 I/O 带宽要求较高。
数据下载门槛:训练和评测数据集需要通过外部链接下载,部分数据依赖 LLaVA-OneVision 的开放数据,完整复现需要额外的数据准备工作。
多视图 3D 检测未完成:README 中多视图聊天功能标注为 TBD,Anomaly-OV 的 3D 异常推理能力目前尚不可直接使用。
Anomaly-OV 的发布代表了工业 AI 检测的一个重要趋势:从单点模型走向统一多模态框架。传统工业视觉需要缺陷分类、定位、分割等多个专用模型协同,而 Anomaly-OV 借助 LLM 的通用推理能力,用单一架构同时完成检测、分割和推理三项任务。这不仅降低了系统复杂度,也为后续与机械臂控制、质量报告自动生成等下游系统的端到端集成铺平了道路。
从 CVPR 2025 Highlight 的认可来看,Anomaly-OV 代表了多模态大模型与工业视觉交叉领域的最新突破。相比此前 Meta 的 SAM(Segment Anything Model)在异常分割上的尝试,Anomaly-OV 进一步加入了语义推理能力,让 AI 不仅能「看到」异常,还能「解释」异常。这种从感知到认知的跨越,是工业 AI 质检从工具走向助手的关键一步。
对于 AI 研究者和工程师而言,Anomaly-OV 的开源提供了从预训练模型到微调数据的完整流程参考,可直接用于探索多模态大模型在工业、医疗、安防等垂直领域的应用潜力。