IRIS-AI
语音优先桌面AI助手,语音命令+记忆系统+工具编排,双手忙碌也能高效办公
加载项目详情…
本应用为开源项目,仅供学习研究,请遵守其开源协议。
语音优先桌面AI助手,语音命令+记忆系统+工具编排,双手忙碌也能高效办公
加载项目详情…
本应用为开源项目,仅供学习研究,请遵守其开源协议。
想象一下这样的场景:你在厨房做饭,双手沾满面粉,突然想起需要给客户发一封邮件确认报价。以往你只能把手擦干净再坐到电脑前,但现在你只需说一句"帮我发邮件给张总确认Q3报价",IRIS就能自动完成这一切——这就是IRIS AI想要重新定义的交互方式。
IRIS AI(Intelligent Reasoning & Interactive System)由独立开发者 Harsh Pandey 开发,是一个运行在本地桌面上的语音优先AI助手。不同于Siri、Alexa等纯云端助手,IRIS强调离线优先和本地执行,你的对话内容不会经过第三方服务器中转。
图1:项目作者 Harsh Pandey
这个项目的诞生源于一个朴素的需求:现有AI助手大多是"聊天机器人"——你打字,它回复,仅此而已。但当用户真正想要让AI帮自己做事(发邮件、管理文件、截屏、搜索网页、执行自动化流程)时,传统助手就显得力不从心。IRIS正是为了填补这个Gap而设计:它不只是一个会说话的应用,而是一个能真正操控你电脑的智能代理。
IRIS的功能矩阵非常丰富,可以分为以下几个层次:
语音交互层 — 基于 WebRTC 实现实时双向音频流,配合 Gemini 3.1 Live API 实现低延迟语音对话。支持唤醒词(Wake Word)免手动激活,还支持手机摄像头远程控制。
代理执行层 — 采用 LangGraph 架构驱动状态机,根据用户意图动态选择工具并编排执行流程。支持的工具涵盖:剪贴板监控(自动记录复制内容并建立知识索引)、文件操作(读写、搜索)、截图与OCR、网页搜索与内容提取、邮件/日历集成等。
记忆系统 — 内置向量数据库(LanceDB),支持对话历史的语义检索。这意味着IRIS能记住你上个月说过的某个偏好,下次调用时自动应用,而不只是单次会话内的上下文。
安全保护 — 代码层面采用 V8 字节码编译 + ASAR 包完整性校验 + 窗口隔离,防止源码被轻易反编译查看。核心代理逻辑(Advanced Tool Execution Logic)为闭源私有模块,通过 GitHub Sponsors 分级获取文档和参考实现,但不开放完整源代码。
IRIS 基于 Electron-vite 脚手架构建,采用典型的前后端分离架构:
渲染层(src/renderer/):React 18 + TypeScript,前端路由使用 react-router-dom,UI 动画借助 framer-motion 和 gsap,3D 效果使用 @react-three/fiber + three.js,样式用 TailwindCSS v4。整体界面风格偏现代化、动画丰富。
主进程层(src/main/):Electron 主进程逻辑,负责窗口管理、系统交互、Koffi 实现的本地 native bindings(支持麦克风访问等系统级能力)。采用 electron-store 做配置持久化,electron-updater 做自动更新。
预加载层(src/preload/):安全的 IPC 桥接层,通过 contextBridge 暴露安全 API 给渲染进程。
AI 推理 — 调用 Google Gemini 3.1 Live API(实时语音推理),本地不跑模型,依赖云端API。
从许可证角度看,这是一个自定义源可用许可证(Source-Available License),而非传统开源许可证(如 MIT、Apache)。许可证明确规定:禁止商业使用、禁止企业付费部署,违者承担法律责任。这意味着 IRIS 并不算真正意义上的开源项目,但其前端框架层和工具集成代码可供个人学习研究。
对于开发者而言,可按以下步骤本地运行:
git clone https://github.com/IRISX-AI/IRIS-AI.git
cd IRIS-AI
npm install
npm run dev
构建发布版:
npm run build:win # Windows
npm run build:mac # macOS
npm run build:linux # Linux
依赖要求不高:Node.js ≥ 18,无需 GPU,不需要特殊硬件(语音功能需要麦克风)。安装后通过 Ctrl + Shift + I 呼出快速覆盖面板。
IRIS 并非没有短板。在部署层面,它是一款桌面应用,并非面向服务器的部署产品,不支持 Docker,意味着无法在云服务器上以容器方式运行,主要面向个人Windows/macOS/Linux桌面用户。
在商业模式上,采用 Open Core + 闭源核心 策略。公开代码部分(Electron 框架、React UI)质量不错,但真正的核心——语音编排引擎和高级执行逻辑——并不开源,付费才能获得文档。这种模式在商业上合理,但对于想要深度定制的开发者来说存在明显壁垒。
在数据安全层面,虽然本地运行减少了数据外泄风险,但 Gemini 3.1 Live API 是云端调用,语音数据会发送到 Google 服务器处理,敏感场景需注意。
IRIS 在 GitHub 获得 155 颗星,虽然体量不大,但它代表了一种有价值的探索方向:将大语言模型的对话能力与本地桌面的工具调用能力结合起来。相比纯 API 调用类项目,IRIS 展现了"AI作为操作系统层"的愿景雏形。
从技术趋势看,语音优先(Voice-First)正在成为 AI 应用的新战场。OpenAI 的 Realtime API、Google 的 Gemini Live、苹果的 Apple Intelligence 都瞄准了这个方向。IRIS 的实践表明,在消费级桌面场景中,结合 WebRTC 实时音频 + LLM 意图理解 + 本地工具执行的技术路径是可行的。
对于 AI 爱好者和开发者而言,IRIS 是一个值得研究的参考实现:它展示了如何用 Electron 构建现代化的跨平台 AI 应用,如何用 LangGraph 组织多工具代理的执行流程,以及如何通过 ASAR + 字节码保护核心代码。即使你不会直接使用它,其架构思路和技术选型也具备一定的参考价值。