DeepCamera
让普通摄像头拥有AI大脑——本地VLM场景理解+多渠道智能告警,隐私优先
加载项目详情…
本应用为开源项目,仅供学习研究,请遵守其开源协议。
让普通摄像头拥有AI大脑——本地VLM场景理解+多渠道智能告警,隐私优先
加载项目详情…
本应用为开源项目,仅供学习研究,请遵守其开源协议。
想象一下这个场景:深夜,你收到一条 Telegram 告警——不是冰冷的"检测到运动",而是"一名快递员在您家门廊放下了包裹,已识别为已知访客,无异常"。这就是 DeepCamera 想要实现的目标:让监控摄像头从被动录像工具,变成真正理解场景的智能守卫。
DeepCamera 是 SharpAI 团队开源的 AI 摄像头技能平台(2790 Stars),它将视觉语言模型(VLM)和传统计算机视觉技术结合,让摄像头不仅"看见",更能"看懂"——在本地运行,保护隐私,不依赖云端。

SharpAI Aegis 是 DeepCamera 的桌面伴侣应用,提供 LLM 驱动的自动化配置、AI 技能管理和智能告警。用户无需手动编写 Docker 配置或敲命令,通过对话即可完成整个 AI 管道的搭建和管理。
DeepCamera 的历史可以追溯到 2018 年,最初项目定位为本地化人脸识别 + ReID(人员再识别)监控系统。当时的版本基于 YOLOv7 做人员检测、FastReID 做特征提取、Milvus 做向量数据库,可以识别摄像头视野中的陌生人和已知访客。
随着 2023-2024 年大语言模型和视觉语言模型的爆发,SharpAI 团队快速跟进,将本地 VLM(Qwen、DeepSeek、SmolVLM、LLaVA)整合进技能体系。2025 年推出的 Aegis 桌面伴侣,通过 LLM Agent 自动配置摄像头参数、选择 AI 技能组合,成为项目的重大升级节点。
该项目的维护者同时运营 SharpAI-hub 云平台,为没有技术背景的用户提供一键部署服务。这种"开源核心能力 + 云端降低门槛"的双轨模式,是项目能够在嵌入式 Linux、Mac Mini、AI PC 等多种硬件上落地的关键。
DeepCamera 的技能系统(Skills Platform)是其最具特色的设计。skills.json 定义了技能目录,开发者可以为摄像头编写独立的功能模块,通过 SKILL.md manifest 声明依赖和参数,由 Aegis Agent 自动解析并部署。
技能按功能分为多个类别:

从架构图可以看出,DeepCamera 支持多种摄像头输入源(IP Camera、USB Webcam、RTSP 流),经过 AI 分析后,结果通过多个渠道推送给用户,同时支持存储到 MinIO 对象存储和 Milvus 向量数据库。
传统监控系统只能在检测到运动时告警,DeepCamera 借助 VLM 实现了语义级理解。比如,摄像头捕捉到一个人形,但如果 VLM 判断为"小孩在自家院子里玩耍",系统可以选择静默;如果是"深夜陌生人在门前徘徊",则立即通过 Telegram/Discord 推送详细告警。这种基于语义而非像素级变化触发告警的方式,大大降低了误报率。

DeepCamera 的代码结构清晰体现了模块化设计思路:
src/
├── camera/ # 摄像头驱动抽象层
├── embedding/ # 向量嵌入相关
├── face_detection/ # 人脸检测
├── fall_detection/ # 跌倒检测
├── yolov7_person_detector/ # 人员检测
├── yolov7_reid/ # 人员 ReID
├── home-assistant-py/ # HA Python 集成
├── home-assistant-nodejs/ # HA Node.js 集成
├── milvus/ # 向量数据库
└── minio/ # 对象存储
项目主要使用 JavaScript/TypeScript(前端和 Agent 层)和 Python(AI 推理层)混合开发。AI 推理端支持 llama.cpp 本地加速,允许在 Mac Mini(M 系列芯片)或普通 x86 Linux 机器上运行 7B~14B 参数的 VLM 模型,无需 NVIDIA GPU。
技能系统采用 SKILL.md manifest 声明式配置,参数定义支持类型(select、string、number)、分组(group)和默认值。Aegis Agent 读取 manifest 后,通过 LLM 自动推导安装步骤并执行,降低了用户配置门槛。

DeepCamera 提供了 docker-compose 一键部署脚本,解决了大部分依赖问题。但实际部署中仍有几个需要手动处理的环节:
优点:
需要手动处理的:
总体来说,部署难度中等,有 Docker 经验的用户可以在 30 分钟内完成基础配置。

SharpAI 团队在 GitHub 上公开了 HomeSec Benchmark 测试结果,在 Apple Silicon(M3 Max)上对多款本地 VLM 进行了安全性评估:

从测试结果可以看出,SmolVLM 和 Qwen2-VL 系列在保持较低内存占用的同时,场景理解准确率表现良好,适合边缘设备部署。而 LLaVA 系列则在复杂场景描述上表现更优,但资源消耗也相应更高。
尽管 DeepCamera 功能丰富,但仍有不可回避的问题:
1. AI 模型获取的灰色地带 VLM 能力的发挥依赖模型文件,但项目 README 中对模型下载的引导较为模糊。部分模型需要用户自行从 HuggingFace 下载,并手动配置路径。这对非技术用户来说仍然是障碍。
2. 人脸识别 vs 隐私法规 人脸识别在部分地区受到严格监管(欧盟 GDPR、中国个人信息保护法)。DeepCamera 的这一核心能力在不同法域下的合规性需要用户自行评估。
3. 实时性 vs 准确性的取舍 本地 VLM 推理在无 GPU 的情况下,帧率可能只有 0.5-2 FPS,无法满足高频监控场景的需求。SmolVLM 等轻量模型虽然速度快,但场景理解深度有限。
4. 社区活跃度 项目最近更新偏向 Skills 扩展层面,核心代码更新频率不高,需要关注后续维护状态。
DeepCamera 代表了一种将本地 AI 能力注入传统 IoT 设备的务实路径。它不是要替代商业 NVR 系统,而是为有技术能力的用户提供了完全可控、数据不上云的替代方案。
适合场景:
不太适合: