onyx
开源 AI 平台,支持私有知识库 RAG 问答、Deep Research 深度研究与自定义 Agent 构建
加载项目详情…
本应用为开源项目,仅供学习研究,请遵守其开源协议。
开源 AI 平台,支持私有知识库 RAG 问答、Deep Research 深度研究与自定义 Agent 构建
加载项目详情…
本应用为开源项目,仅供学习研究,请遵守其开源协议。
想象这样的场景:某科技公司的研发团队积累了大量内部文档——API 手册、架构设计、会议纪要、客服话术库——这些数据散落在 Confluence、Notion、Slack、GitHub 等十多个系统中。当工程师想查「去年Q3某模块的性能优化方案」时,要么在海量文档中逐个搜索碰运气,要么依赖同事的记忆。传统关键词搜索返回的结果要么太泛、要么太碎,AI 助手又因为数据不在公开互联网上而「爱莫能助」。
Onyx 正是为解决这一痛点而生:它将企业的私有知识库变成一个可以对话的 AI 专家,不仅能理解自然语言提问,还能结合最新的网络信息、深度的代码执行能力,生成真正有价值的回答。
Onyx(曾用名 Danswer)由美国初创公司 OnyxDotApp 开发和维护,项目采用 MIT 开源许可证,GitHub 星标数已突破 29,000,是目前开源 AI 平台领域最受关注的项目之一。
从技术演进路径看,Onyx 的发展经历了三个阶段:
截至 2026 年初,Onyx 在 Deep Research 基准测试中名列前茅,其 Agentic RAG 方案在多个公开评测中展现出领先的质量指标。
Onyx 采用前后端分离的现代微服务架构,由以下核心组件构成:
后端采用 Python 3.11 + FastAPI 框架构建,代码仓库位于 backend/ 目录,核心模块包括:
connectors/:数据连接器层,支持 50+ 数据源,包括 Confluence、Slack、Google Drive、Notion、GitHub、Salesforce、Wiki.js 等主流企业工具,以及 MCP(Model Context Protocol)协议扩展。每个连接器负责从特定数据源抓取、解析和索引文档。chat/:对话处理引擎,对用户提问进行意图识别、查询改写、上下文组装,并调用 LLM API 生成最终答案。document_index/:文档索引模块,基于 OpenSearch 构建混合向量索引,支持语义检索和关键词检索的融合排序。deep_research/:深度研究模块,实现多步骤递进式研究流程,能够自主规划查询计划、收集证据、交叉验证,最终输出结构化报告。coding_agent/:代码执行代理,在沙箱环境中安全运行 Python/JS 代码,实现数据分析和图表渲染。agents/:自定义 Agent 构建框架,允许用户定义专属 AI 助手,设置系统提示词、知识库、工具集和 MCP Actions。前端代码位于 web/ 目录,采用 Next.js 14 + TypeScript + Tailwind CSS 构建现代化的响应式界面。技术栈亮点包括:
内置 model_server/ 使用本地嵌入模型(如 sentence-transformers)和重排序模型(如 Cohere),无需依赖外部 API 即可完成语义检索,降低使用成本并提升数据隐私保护能力。
Onyx 的 RAG 不只是简单的「检索+拼接」,而是引入了 AI Agent 进行查询规划。具体来说:
这是 Onyx 最引以为傲的能力之一。用户提出一个复杂问题(如「分析开源大模型生态 2025 年的发展趋势」),Deep Research 模块会:
在官方 Deep Research 基准测试排行榜上,Onyx 长期位居前列。
用户可以创建专属的 AI Agent,配置项包括:
覆盖主流企业工具的原生集成:
docker-compose.multitenant-dev.yml 支持 SaaS 多租户部署。官方提供 一键安装脚本,在 Linux/macOS 上执行:
curl -fsSL https://onyx.app/install_onyx.sh | bash
该脚本自动检测 Docker 环境、拉取镜像、生成配置、启动所有服务。
对于生产环境,建议使用 docker-compose.prod.yml,步骤如下:
env.template 为 .env,填入 LLM API Key(OpenAI/Anthropic 等)docker compose -f docker-compose.yml -f docker-compose.prod.yml up -dhttp://localhost 即可使用| 组件 | 最低要求 | 推荐配置 |
|---|---|---|
| CPU | 4核 | 8核+ |
| 内存 | 8GB | 16GB+ |
| GPU | 可选(用于本地推理) | NVIDIA T4/A10G/A100 |
| 磁盘 | 20GB | 100GB+ |
对于没有本地 GPU 的用户,Onyx 支持接入 OpenAI、Anthropic、Azure OpenAI 等云端 LLM API,纯 CPU 环境下也能运行(使用外部嵌入服务)。
生产部署支持多种认证方式:Basic Auth、Google OAuth、OIDC、SAML,企业用户可对接现有身份提供商。
Onyx 同样存在一些值得关注的局限:
资源占用较高:完整部署包含 OpenSearch + PostgreSQL + Redis + 模型推理服务,对内存和磁盘要求较高,小型团队可能需要精打细算资源配额。
LLM API 成本:默认使用云端 LLM API(OpenAI/Anthropic),Deep Research 等深度功能调用量大,生产环境需关注 Token 消耗。官方正持续优化本地推理支持,但目前本地模型效果与顶级商业模型仍有差距。
数据连接器的维护成本:50+ 连接器意味着需要持续跟进各平台的 API 变更,部分企业内网的特殊系统可能需要自行开发定制连接器。
学习曲线:尽管 UI 友好,但深度定制(自定义 Agent、MCP Actions、多租户配置)需要一定的技术背景,普通用户需要时间熟悉。
Onyx 的出现填补了开源领域「企业级 AI 平台」的空白。传统上,企业若想构建私有知识库 + AI 问答能力,要么选择昂贵的商业产品(如 Glean、Moveworks),要么自研但面临巨大工程量。Onyx 以开源方式提供了第三条路:功能完整、部署灵活、社区活跃。
从竞争格局看,同类开源项目包括:
相比之下,Onyx 的差异化优势在于:Agent 级别的智能检索 + Deep Research 深度研究 + MCP Actions 外部集成三位一体,是目前功能最全面的开源 AI 平台。
Onyx 不是一个简单的聊天机器人,也不是一个单纯的文档搜索引擎。它是一个完整的企业级 AI 平台,将 RAG、Deep Research、自定义 Agent、代码执行、50+ 数据集成等能力整合在一起,并通过 Docker Compose 和一键安装脚本大幅降低了部署门槛。对于希望构建私有 AI 知识库、提升团队信息获取效率的企业而言,Onyx 是目前开源生态中综合实力最强的选择之一。29,000+ 的 GitHub 星标和持续活跃的社区开发,也印证了它在行业中的认可度。
一句话评价:如果你的团队还在为「找文档」这件事浪费大量时间,Onyx 值得一试。