ChatRTX
NVIDIA官方出品的本地RAG chatbot示例,在Windows RTX显卡上运行私有化大模型
加载项目详情…
本应用为开源项目,仅供学习研究,请遵守其开源协议。
NVIDIA官方出品的本地RAG chatbot示例,在Windows RTX显卡上运行私有化大模型
加载项目详情…
本应用为开源项目,仅供学习研究,请遵守其开源协议。
2024年2月,NVIDIA 发布了一款让无数 AI 爱好者眼前一亮的 Demo 产品——Chat with RTX。它可以将你的 Windows 电脑(只要配备了 RTX 显卡)瞬间变成一台本地运行的智能问答机器。你可以扔进去一堆文档、笔记、图片,它就能像一位熟悉你所有资料的老同事一样,回答你提出的各种问题。不需要联网,不需要订阅付费 API,数据永远留在你自己的硬盘里。 这对于注重隐私、不想让敏感文档上传云端的用户来说,堪称完美方案。
大语言模型(LLM)的强大能力已经毋庸置疑,但在实际使用中,通用模型往往"什么都知道,就是不知道你的事"。你的公司内部文档、个人笔记、项目代码——这些私有知识,通用模型根本无法触及。RAG(检索增强生成)技术正是为解决这一痛点而生:先从你的私有数据中检索相关片段,再把这些内容注入到模型的提示词里,让模型"看到"你的资料后作答。
NVIDIA 坐拥全球最强大的消费级 GPU 产品线,自然不会放过将 AI 能力下沉到本地 PC 的机会。ChatRTX 正是这个思路的产物——它面向的是有 RTX 显卡(30系列及以上)的 Windows 用户,让他们不用折腾云端、不用懂深度学习,自己就能搭建一个完全私有的 RAG 问答系统。
2026年1月21日,NVIDIA 正式宣布 ChatRTX 项目停止维护(deprecated)。虽然官方不再更新代码,但该项目依然是一个极具参考价值的 RAG 工程范例,特别是其与 TensorRT-LLM 的深度集成方案,对开发者学习如何在本地高效部署大模型具有重要价值。
ChatRTX 的整体架构分为前后端两部分,组织清晰:
后端(ChatRTX_APIs) 基于 Python Flask,提供推理和 RAG 能力。核心依赖包括:
前端(ChatRTX_App) 基于 Electron + Node.js 构建桌面客户端,用户界面友好,安装 NVIDIA 官方 ChatRTX 安装包后一键启动。
支持的文件格式覆盖了日常办公的常见类型:文本、PDF、Word、XML、图片(PNG/JPG/BMP),几乎涵盖了大多数知识管理场景。
支持的模型阵容:
| 模型 | 最低显存需求 | 说明 |
|---|---|---|
| Llama 3.1 8B NIM | RTX 4080+ | NVIDIA 云端托管的 Llama 3.1 |
| Mistral 7B | 8GB VRAM | 主流开源模型 |
| ChatGLM3 6B | 8GB VRAM | 国产开源模型 |
| LLaMa 2 13B | 16GB VRAM | 较大参数模型 |
| Gemma 7B | 16GB VRAM | Google 开源模型 |
| Whisper Medium | 8GB VRAM | 语音识别 |
| CLIP | 8GB VRAM | 图片理解 |
想象你有一个私人图书管理员,他记忆力超群,能在几秒钟内从你家藏书(成千上万本书籍和照片)中找到所有与"去年Q3营收"相关的内容,并结合这些资料给你一个完整的回答。ChatRTX 就是这个图书管理员的数字版本,只不过:
整个过程完全在你的 PC 本地完成:没有数据离开你的电脑,响应速度快(得益于 TensorRT 加速),而且不花一分钱 API 费用。
1. TensorRT-LLM 集成是最大亮点 TensorRT-LLM 是 NVIDIA 官方出品的大模型推理优化框架,相比 naive 推理能带来数倍的吞吐量和延迟改善。ChatRTX 展示了如何将 TensorRT-LLM 作为 LlamaIndex 的推理后端,这是其他 RAG 教程很少涉及的实践。
2. 多模态 RAG 同时支持文本、语音、图片 大多数 RAG 教程只处理纯文本,而 ChatRTX 实现了语音输入(Whisper)、图片理解(CLIP)和文本检索的完整多模态链路。
3. 本地优先的隐私保护设计 所有推理和数据存储都在本地,满足金融、医疗、法律等敏感行业的合规要求。
4. 模块化 API 设计 ChatRTX_APIs 独立于前端 UI,提供 REST API 接口,开发者可以将其作为后端 RAG 引擎,集成到自己开发的任何应用中。
适合人群:
不适合人群:
部署难度:较高 项目没有提供 Dockerfile 或一键安装脚本,用户需要:
这不是一个"克隆仓库、运行脚本"就能搞定项目,需要对 NVIDIA 生态有一定了解。
最大局限:平台锁定严重 ChatRTX 严格绑定 Windows + RTX 生态,不支持 Linux、不支持 AMD/Intel 显卡,这在开源社区几乎是"孤例"。缺乏容器化支持意味着开发者无法在服务器环境复现,限制了它在企业级场景的应用。
项目已停止维护 2026年1月官方宣布废弃,不再更新。这意味着:已知的 bug 不会修复,未来新模型的支持无法保证,TensorRT-LLM 新版本的兼容性也存疑。如果要基于此项目二次开发,需要自行承担维护成本。
硬件门槛不低 虽然官方说"RTX 4080 及以上",但实测下来,8GB 显存在运行某些量化模型时尚可,但 13B 参数模型需要 16GB+,对于只想轻度体验 RAG 的用户来说,投入成本偏高。
API 文档相对简略 ChatRTX_APIs 虽然提供了后端接口,但 API 文档和错误处理不够完善,对想要深度集成的开发者不够友好。
尽管 ChatRTX 已停止维护,但它在 AI 本地化部署领域留下了重要一笔:
证明了本地 RAG 的可行性:它向业界展示,通过 TensorRT-LLM 优化,RTX 消费级显卡完全能跑动 7B-13B 参数的 RAG 系统,且响应速度和吞吐量足以支持日常交互。
推动了 LlamaIndex + TensorRT 集成实践:在此之前,将 TensorRT-LLM 作为 LlamaIndex 后端的资料极少,ChatRTX 提供了珍贵的参考实现。
探索了隐私优先的 AI 问答范式:在各大厂商都在推动 AI 云端化的背景下,ChatRTX 代表了一种"数据主权"思路——你的数据永远不需要离开你的电脑。
对于 AI 开发者而言,ChatRTX 仍然是学习 RAG 工程实践的优质参考项目,尤其推荐关注其 ChatRTX_APIs 目录下的推理和向量检索实现。对于最终用户,如果手头有合适的 RTX 硬件,官方安装包仍然是目前最完整的本地 RAG 体验方案。
项目基本信息
| 项目 | NVIDIA/ChatRTX |
|---|---|
| GitHub | https://github.com/NVIDIA/ChatRTX |
| Stars | 3,125 |
| 语言 | Python |
| 许可证 | NOASSERTION |
| 当前状态 | 已停止维护(2026年1月废弃) |
| 最低显存 | 8GB VRAM(部分模型需16GB) |
| 核心依赖 | TensorRT-LLM, LlamaIndex, FAISS, Whisper, CLIP |