Prisma
Gemini驱动的可视化多智能体推理引擎,让AI思考过程透明可见
加载项目详情…
本应用为开源项目,仅供学习研究,请遵守其开源协议。
Gemini驱动的可视化多智能体推理引擎,让AI思考过程透明可见
加载项目详情…
本应用为开源项目,仅供学习研究,请遵守其开源协议。
Prisma 是由独立开发者 yeahhe365 构建的可视化多智能体深度推理引擎,GitHub 现有 335 Stars、32 Forks、3 个 Open Issues。项目以 MIT 许可证开源,核心定位是让 AI 的"思考过程"变得透明可见——用户不仅能得到最终答案,还能亲眼目睹 AI 如何将复杂问题分解、分配给不同专家角色、反复审查修正,最终综合出最优解。
这个项目与市面上常见的"聊天机器人"本质不同:它不是简单的一问一答,而是一套完整的深度推理工作流,引入了 Manager-Expert-Synthesis 三层架构,并在每个阶段提供可视化的思维流(Process Flow)展示。用户可以点开每个"专家卡片",看到其内部的思考独白(Internal Monologue)和草稿输出(Draft Output)。
大语言模型(LLM)在复杂推理任务上的能力近年来大幅提升,但模型"思考过程"的不可解释性始终是应用落地的一道坎。尤其在需要多步骤逻辑推导、多领域知识整合的场景下,单次生成往往难以保证质量——模型可能在某个中间步骤出现逻辑跳跃或事实错误,但用户无从得知,只能被动接受最终答案。
Prisma 的出现正是为了解决这一痛点。它的设计灵感借鉴了 AI 领域的"Chain-of-Thought"(思维链)研究,并将其工程化、产品化。项目作者在 README 中直言不讳地表示:Prisma 是"探索多模型推理极限的实验性应用",它不仅仅是一个聊天机器人,更是一个可视化的思维实验室。
从技术选型来看,项目选择 Gemini SDK 作为主要 AI 能力来源,同时兼容 OpenAI 兼容 API 接口,这体现了作者对生态开放性的追求——不绑定单一厂商,用户可以自由切换底层模型。前端采用 React 19 + TypeScript + Vite 6 的现代化技术栈,配合 Tailwind CSS 实现样式,整体工程化水平相当成熟。
Prisma 的核心是它独创的"深度多智能体推理"架构,整个推理流程分为三个阶段:
第一阶段:Manager(规划)。当用户输入一个问题后,系统不会立即回答,而是先由 Manager Agent 进行问题分析。Manager 会根据问题的复杂度和涉及的知识领域,动态决定需要调用哪些"专家"角色参与处理。比如用户问"量子计算对加密算法的影响",Manager 可能会判断需要"量子物理学家"、"密码学专家"和"数学家"三类专家。
第二阶段:Expert Pool(并行专家池)。Manager 决策完成后,系统会自动生成专门的 AI 专家角色并行工作。这些专家各自独立思考,相互之间不干扰。以"逻辑学家"为例,它会专注于问题中的逻辑结构,检查是否存在推理漏洞;以"代码架构师"为例,它会关注问题中涉及的代码实现细节。每个专家都会生成自己的"内部独白"和"草稿输出",这些内容对用户完全透明可见。
第三阶段:Synthesis(综合)。所有专家输出完成后,Manager 会再次审查专家意见。如果发现逻辑漏洞或信息缺失,会启动递归修正循环——当前实现最多进行 2 轮专家执行(初始轮 + 1 轮复审修正)。通过多轮迭代确保最终答案的准确性和完整性。最后由 Synthesis 模块将分散的专家意见汇聚成一篇逻辑严密、内容详实的最终回复。
Prisma 的另一个核心亮点是"全链路可视化"设计。在推理过程中,界面会动态展示一个节点图,实时反映当前推理状态:Analyzing(分析中)→ Working(工作中)→ Reviewing(审查中)→ Synthesizing(综合中)。每个节点的状态变化用户都能清晰看到,包括每个阶段耗费的时间。
更重要的是,用户可以点开任意专家卡片,查看其私有的内部独白和草稿输出。这意味着整个 AI 推理过程不再是黑盒,用户能够审视 AI 的思考路径,理解它为什么会得出某个结论,或者为什么在某个环节推倒重来。这种透明性对于需要 AI 辅助进行复杂决策的用户(研究者、开发者、知识工作者)来说极具价值。
Prisma 提供了"思考预算"(Thinking Budget)功能,用户可以为规划、执行、综合三个阶段分别设置思考深度:Minimal(最小)、Low(低)、Medium(中)、High(高)。这个设计反映了作者对 AI 推理能力的深度理解——不同任务需要不同程度的"深度思考",并非所有问题都需要模型"绞尽脑汁"。简单的事实查询可以设置 Minimal 以节省 token 消耗,而复杂的数学证明则可以使用 High 级别获得更深入的推理。
Prisma 在启动时不预置任何模型配置,完全由用户自行添加 Gemini API 或 OpenAI 兼容 API 模型。项目内置了一个自定义 API 网关功能,支持配置 Custom Base URL,方便国内用户通过反向代理连接 Google Gemini API。项目还特别提到可以追加允许的 API 域名,对于接入本地模型服务或自定义网关场景也能很好支持。
附件能力方面,Google 模型和 OpenAI 兼容模型的处理策略有所不同:Google 模型支持图片、PDF、音视频、文本/代码附件以内联数据方式发送;OpenAI 兼容模型则支持图片和文本/代码附件,PDF、音频、视频附件会在发送前被拦截,避免静默丢失。
Prisma 采用"本地优先"架构,聊天会话数据存储在浏览器 IndexedDB 中,偏好设置存储在 localStorage,数据完全留在用户本地设备,不需要任何服务端存储。这种设计对于关注隐私的用户来说是一个重要卖点。
项目提供一键 Docker 部署方案,这是其最大的工程亮点之一。Dockerfile 采用多阶段构建(Multi-stage Build):构建阶段使用 node:22-alpine 安装依赖并执行 vite build 生成静态资源;运行阶段使用另一个 node:22-alpine 镜像,仅复制构建产物,并通过一个轻量的 Node.js 运行时(server.mjs)提供页面服务和本地 API 代理。
这个 API 代理设计非常巧妙——由于浏览器的 CORS 限制,前端直接请求 Gemini/OpenAI API 会被拦截。通过容器内的 Node 服务转发请求,浏览器只请求同源的 /custom-api,真正的外部 API 请求由容器内 Node 服务发出,从而绕过 CORS。Cloudflare Pages 部署则走纯前端模式,不需要这个代理服务。
部署命令极为简单:docker compose up --build,默认映射到 http://localhost:8081。如果端口被占用,通过 PRISMA_DOCKER_PORT 环境变量可以轻松调整。
硬件需求方面,纯前端应用不需要 GPU,仅需 1GB RAM 和 500MB 磁盘空间,门槛极低。
从项目结构来看,Prisma 展现了相当高的工程化水准。代码采用模块化组织,components/ 目录按功能拆分为 sidebar、settings 子目录;services/deepThink/ 目录承载核心 AI 推理逻辑,进一步细分为 manager、expert、synthesis、orchestrator 等模块;hooks/ 目录管理 React 状态和业务逻辑编排。这种分层架构使得各部分职责清晰,便于维护和扩展。
测试方面,项目使用 Vitest + Testing Library,测试覆盖率配置完善,npm test 可直接运行全套测试。代码风格检查使用 ESLint + Prettier,GitHub Actions CI 流程覆盖测试和类型检查。package.json 中定义了 lint、format、build 等标准化脚本,工程规范与业界最佳实践对齐。
依赖管理方面,项目使用 npm workspaces 的简化模式(monorepo 的单包版本),@google/genai 和 openai 双 SDK 并存以支持多模型接入,React 19 的使用体现了作者对前沿技术的积极跟进。
Prisma 是一款实验性大于实用性的项目,它的价值主要体现在以下几个方面:对于 AI 研究者和开发者来说,它是一个理解 Chain-of-Thought 可视化的优秀案例;对于需要在复杂任务中获得更可靠 AI 推理结果的用户来说,它通过多专家协作和多轮审查提升了输出质量;对于学习 AI 推理机制的学生来说,它的透明化设计让思考过程可观测、可分析。
局限性同样存在:多专家多轮审查意味着 token 消耗显著高于普通对话,使用成本较高;Gemini API 在部分地区访问不稳定;纯前端应用无法保存对话历史到云端,多设备使用不便;作为实验性项目,生产环境稳定性未经验证。
Prisma 代表了 AI 应用层的一个有趣方向——从追求"更快更强"的大模型本身,转向探索"如何更好地使用大模型"的工作流创新。随着模型能力持续提升,如何设计有效的人机协作流程、如何让 AI 的思考过程更透明可解释,将成为越来越重要的课题。Prisma 在这个方向上做出了有价值的探索,其开源实现也为社区提供了一个可参考的技术样本。