WearableIntelligenceSystem
为智能眼镜设计的AI增强框架,集成语音识别、实时翻译、人脸记忆与HUD显示,MIT开源
加载项目详情…
本应用为开源项目,仅供学习研究,请遵守其开源协议。
为智能眼镜设计的AI增强框架,集成语音识别、实时翻译、人脸记忆与HUD显示,MIT开源
加载项目详情…
本应用为开源项目,仅供学习研究,请遵守其开源协议。
当你戴着智能眼镜走在街上,有人向你走来——眼镜屏幕上自动弹出这个人的名字、你们上次见面的地点、聊过的话题。不用掏手机,不用手动查询,一切就在你眼前即时呈现。 这不是科幻电影里的桥段,而是一个真实开源项目正在努力实现的目标:把 AI 变成你视野里永远在线的"外脑"。
Wearable Intelligence System(WIS,可穿戴智能系统)是一个面向智能眼镜应用开发的软件框架,由独立开发者 emexlabs 于 2019 年前后创建。该项目 2021 年公开代码,2023 年 8 月后停止活跃更新,已归档并升级为 SmartGlassesManager(212 ★)。项目采用 MIT 许可证,截至 2023 年末积累了约 171 颗 GitHub Stars,在可穿戴计算与 AI 交叉领域算得上最早的完整开源方案之一。
![]()
图1:WIS Beta 版功能演示,眼镜 HUD 实时显示语音转文字与功能菜单
WIS 不是一款手机 APP,而是一套分布式多设备协同系统,核心依赖三部分硬件:
这三者之间通过 JSON IPC(进程间通信)和 Socket 网络协议协同工作,形成一个完整的感知→理解→执行闭环。
WIS 内置了多个可直接使用的 AI 应用,这些功能全部通过语音指令触发,唤醒词默认为"hey computer":
实时语音转字幕(Live Captions):在会议、讲座或日常对话中,眼镜屏幕实时显示对方的语音内容,帮助听力障碍者或在嘈杂环境中提升理解力。这不是简单的语音识别,而是结合了 MediaPipe 移动端 AI 推理能力的低延迟管线。
视觉搜索(Visual Search):用眼镜的第一人称视角拍照,将图像发送给 AI,搜索网上相似内容。比如在街头看到一辆车、一种植物、一件衣服,眼镜告诉你"这是什么+哪里买+多少钱"。
人脸识别+记忆提醒(Name Memorizer):这是 WIS 最具未来感的功能之一。眼镜检测到人脸后,自动从本地数据库中检索关于此人的记忆记录——你们的共同朋友、最近一次见面的地点、聊过的话题——并在对方出现在视野中时主动弹出提示。
实时语音翻译(Live Translation):将外语实时翻译成母语,静默显示在眼镜屏幕上,对方说话的同时你就看到了中文翻译,适合旅行、商务场景。
网络搜索 + 问答:结合 WolframAlpha 知识引擎和 Bing 搜索 API,可以用语音向眼镜提问任何问题,答案即时呈现在 HUD 上。
记忆流工具(Memory Tools):用语音记录笔记,并打上标签分类,随时通过语音检索。配合语义搜索(基于 txtai),可以用自然语言找到很久以前记过的碎片信息。
从代码结构看,WIS 的技术栈分为三个子系统:
Android 智能手机端(Java + Gradle):主 APP 使用标准 Android 开发框架,通过 MediaPipe 的 Android 定制版(AAR)提供 AI 推理能力。MediaPipe 在手机端运行人脸检测、手势识别等视觉模型,避免了将图像发送给云端带来的延迟和隐私问题。手机端还负责维护本地数据库(MongoDB)、管理 WiFi 热点、与眼镜和服务器双向通信。
Android 智能眼镜端(Java):Vuzix Blade 运行独立的 Android 应用,通过 Socket 与手机通信。眼镜端负责显示 HUD、处理触摸/语音输入、接收来自手机的实时数据推送。Vuzix Blade 是早期商业智能眼镜中开发者生态相对开放的一款,但硬件性能有限(单核 ARM + 640×360 显示屏),因此核心推理卸载到手机端。
GNU/Linux Box 后端(Python 3):这是系统中最"重"的 AI 引擎部分。基于 Flask 提供 HTTP API,依赖 txtai 做语义搜索、spaCy 做 NLP 处理、Google Cloud Speech 做语音转文字、Google Cloud Translate 做翻译、WolframAlpha 做知识问答。后端通过 WebSocket 与眼镜端通信,将 AI 处理结果实时推送显示。
值得注意的是,txtai(neuml/txtai,约 7k ★)是这套系统的语义搜索核心,它基于 sentence-transformers 构建向量索引,使得"找到几个月前记过的那条笔记"这样的模糊查询成为可能。
| 维度 | 评估 |
|---|---|
| 架构设计 | 模块化分三层(眼镜/手机/服务器),各司其职,但层间耦合较紧 |
| 代码规模 | Android 端约数万行 Java,Python 后端数千行,代码量中等 |
| AI 集成 | 深度集成 MediaPipe、txtai、WolframAlpha、云端语音/翻译 API |
| 构建难度 | Android 端需要 Bazel 构建系统(Google 官方推荐的 MediaPipe 构建方式),门槛不低 |
| 文档质量 | README 详细,包含完整安装步骤,但缺乏 API 文档 |
| 活跃状态 | 已归档(2023年8月),后续在 SmartGlassesManager 继续开发 |
WIS 的设计理念超前,但实际落地面临三重挑战:
硬件碎片化:Vuzix Blade 只是 2021 年前后的选择,如今 Meta Ray-Ban Smart Glasses、Apple Vision Pro、小米 AI 眼镜等新品不断涌现,每款设备的 Android 定制化程度不同,WIS 难以开箱即用。项目也已意识到这一点——升级版 SmartGlassesManager 的核心目标就是"写一次 APP,跑在任何智能眼镜上"。
依赖复杂:整套系统需要 GCP/Azure/WolframAlpha 三个商业 API KEY,涉及 Bazel 编译环境,普通人难以完整复现。项目虽提供了 setup.sh,但环境配置仍是最大门槛。
隐私争议:人脸识别+本地记忆库意味着持续的面部数据采集和存储,在 GDPR 和各地区数据保护法规日趋严格的环境下,这类"增强记忆"应用面临法律和伦理双重审视。项目本身对此着墨不多。
WIS 的核心价值不在于商业化落地,而在于证明了一种可能性:用开源方式构建一套完整的"AI 增强现实"技术栈,从感知(语音/视觉)到理解(NLP/语义搜索)到呈现(HUD),全链路均可定制和研究。
作者 2023 年后将项目升级为 SmartGlassesManager,专注解决"一款 APP 跑在所有眼镜上"的跨设备兼容问题——这正是该领域最核心的工程难题。从 171 ★ 到 212 ★ 的增长说明社区对这类工具仍有强烈需求,尽管目前更多是研究者和小众极客在关注。
对于 AI 开发者而言,WIS 的代码结构是一个移动端 AI 推理 + 云端大模型协同的实战参考;对于 HCI(人机交互)研究者,它提供了丰富的交互模式设计素材;对于智能眼镜爱好者,它是目前少有的完整开源解决方案。
如果你对可穿戴 AI 增强(Intelligence Augmentation)这一方向感兴趣,与其从零构建,不如先研究 WIS 和 SmartGlassesManager 的架构演进——这里藏着这个行业最初几年探索者的集体踩坑记录。