qvac
端侧离线AI SDK,无云端无追踪
加载项目详情…
本应用为开源项目,仅供学习研究,请遵守其开源协议。
端侧离线AI SDK,无云端无追踪
加载项目详情…
本应用为开源项目,仅供学习研究,请遵守其开源协议。
想象一个场景:你在火车上写一份涉及商业机密的报告,需要 AI 帮忙润色。打开 ChatGPT,数据就要穿过层层服务器才能回来——万一网络不稳定,万一敏感数据被缓存,万一哪天这些数据成了训练语料……
QVAC 给了另一种可能:把 AI 模型直接加载到你自己的电脑上运行,推理过程完全不依赖任何云端 API,数据从头到尾都在你的设备里。甚至,当你的手机算力不够时,还能通过 P2P 网络借用邻居电脑的算力来完成推理——就像 BitTorrent 下载文件一样自然,只是这次传输的是"智能"。
你不需要信任任何服务器。QVAC 的设计哲学是:数据不出设备,智能不靠云端。

Tether(USDT 稳定币的发行方)近年来持续扩张其技术版图。2025 年初,Tether 宣布推出 QVAC(Quantum Versatile AI Compute)——一个开源的跨平台本地 AI SDK,目标直指当前 AI 行业对云端 API 的过度依赖。
传统的本地 LLM 运行方案(如 llama.cpp、Ollama)虽然解决了"本地运行"的问题,但缺乏统一的多模态抽象、缺乏良好的开发者 SDK、缺乏 P2P 能力。QVAC 的核心创新在于:
QVAC 的野心相当大——用一个 SDK 满足几乎所有主流 AI 场景。以下是它的能力矩阵:
QVAC 的文本生成能力基于 Fabric LLM(即 qvac-fabric-llm.cpp),底层调用 llama.cpp 引擎,支持 GGUF 格式模型。这意味着你可以用 QAC 加载任何主流开源 LLM——Llama、Qwen、Mistral、Gemma——全部本地运行,数据不离开设备。支持 Llama.cpp 的全部量化方案(Q4_K_M、Q5_K_S 等),在内存受限的设备上也能跑大模型。
基于同一套 Fabric LLM 引擎生成向量嵌入,可用于语义搜索、聚类分析等场景,无需调用 OpenAI 或 Cohere 的嵌入 API。
内置 RAG 工作流,支持对本地文档进行语义检索后,将检索结果注入 LLM 上下文。相比纯云端 RAG,QVAC 的优势在于原始文档数据完全保留在本地,适合企业内部知识库、医疗记录、法律文档等高敏感场景。
支持通过 LoRA 对 LLM 进行领域适配。已有用户用 QVAC 微调模型用于智能家居控制、医疗记录分析等垂直场景。
支持在一次对话中同时处理文本、图片和其他媒体。QVAC 近期推出了 VisionPsy-Nano(460M 视觉模型),官方称其在多项基准测试中优于两倍大小的模型。配合 LLM,可实现看图问答、文档扫描理解、摄像头画面分析等功能。
基于定制的 Diffusion 后端,支持文生图(Text-to-Image)和图生图(Image-to-Image)。虽然不像 Stable Diffusion 那样有大量社区生态,但作为本地一体化方案,内置于 SDK 中的图像生成能力降低了多工具切换的复杂度。
同样基于定制 Diffusion 后端,支持文生视频和图生视频。这项能力目前处于早期阶段,但方向与当前热门的 Sora、Runway 等对标,区别在于完全本地运行。
通过 @qvac/audiogen-ggml 包实现,可根据文本歌词和音乐控制参数生成音乐。与语音生成(TTS)和语音识别(ASR)一起,构成完整的音频 AI 能力矩阵。
基于 Whisper.cpp 实现,QVAC 封装了 @qvac/asr-ggml 和 @qvac/bci-whispercpp,支持多语言离线语音转文字。
通过 @qvac/tts-ggml 实现本地文字转语音,无需联网。
基于 NMT(神经机器翻译)cpp 后端(translation-nmtcpp),支持离线翻译。
这是 QVAC 最具差异化的能力。底层基于 Hyperswarm(Holepunch P2P 技术栈)和 Hypercore 协议,构建了分布式模型注册和推理分发网络。用户可以将本地算力共享给网络中的其他节点,也可以从其他节点借用算力进行推理——不需要中心化的 API 服务器。
QVAC 是一个** Monorepo**,主仓库下包含约 40 个子包,分为两大类:
| 包名 | 功能 |
|---|---|
sdk | 核心 SDK,TypeScript,实现统一 API 抽象 |
sdk-python | Python SDK,asyncio 原生,与 JS SDK 调用相同底层 |
fabric | C++ llama.cpp 封装层,CMake 构建,vcpkg 依赖管理 |
llm-llamacpp | llama.cpp 的 Node.js C++ Addon,支持批量处理和 benchmarks |
diffusion-cpp | Diffusion 模型推理的 C++ 后端 |
embed-llamacpp | 向量嵌入生成的 C++ 实现 |
asr-ggml / bci-whispercpp | Whisper 语音识别封装 |
tts-ggml | 本地 TTS 封装 |
audiogen-ggml | 音乐生成后端 |
rag | RAG 工作流(依赖 React、Web SDK) |
ocr-ggml | 离线 OCR 能力 |
registry-server | 模型注册中心服务端 |
| 包名 | 功能 |
|---|---|
openclaw | OpenClaw 插件 |
opencode | OpenCode 插件 |
核心推理引擎(llama.cpp、Difusion、Whisper 等)均以 C++ Addon 形式封装,通过 Node.js N-API 与 TypeScript 层对接。构建系统使用 CMake + vcpkg,跨平台编译通过 vcpkg-overlays 配置层管理。
QVAC 的开发者体验设计得相当用心。核心 SDK(@qvac/sdk)是 TypeScript 编写的,类型安全,API 简洁:
import { loadModel, completion, unloadModel } from "@qvac/sdk";
// 加载模型(本地文件、P2P 链接或 URL)
const modelId = await loadModel({
modelType: "llm",
});
// 对话生成
const response = await completion({
modelId,
history: [
{ role: "system", content: "你是 QVAC 助手" },
{ role: "user", content: "成都周末去哪里玩?" }
],
stream: false
});
const text = await response.text();
console.log(text);
await unloadModel(modelId);
Python 开发者使用同一套底层,tetherto-qvac-sdk 包提供完全对称的 asyncio 接口:
import asyncio
from qvac import load_model, completion, unload_model
async def main():
model_id = await load_model({"modelType": "llm"})
response = await completion(model_id, history=[...])
print(await response.text())
await unload_model(model_id)
asyncio.run(main())
没有 Web UI——这决定了 QVAC 的目标用户是开发者,而非普通消费者。如果你需要的是一行命令就能跑起来的 LLM 聊天界面,Ollama 是更合适的选择。但如果你想在应用中深度集成多模态 AI 能力,同时要求数据完全本地化,QVAC 提供了目前最完整的 SDK 抽象。
QVAC 的 C++ 原生层构建依赖 clang-22、vcpkg、CMake、libc++,文档中的"Quick Start"实际上是针对 SDK 使用的快速上手,而本地编译开发环境的门槛相当高。如果你想修改 llama.cpp 的实现或添加新的 C++ 插件,准备好折腾编译链。
本地运行意味着你受限于本地硬件。RTX 4090(24GB 显存)可以流畅跑 7B Q4 模型,但想跑 70B 大模型?要么量化到 GGUF Q2 精度损失明显,要么就得上专业 GPU 集群——这时候云端 API 的性价比反而更高。
去中心化推理听起来美好,但"借用邻居的算力"涉及隐私和信任问题:你的请求数据会流经对方节点,这在企业场景中可能是合规红线。QVAC 的 P2P 推理更适合家庭/团队内部场景,而非跨陌生人的生产环境。
这两个模态的官方描述较为简略,没有具体的模型名称或基准对比数据。相比于 Stable Diffusion 和 Suno 等成熟方案,QVAC 的生成质量还有待社区验证。
QVAC 的出现代表了 AI 行业一个重要趋势:去中心化 AI正在从概念走向可用的工程实现。
当前 AI 生态高度中心化:OpenAI、Anthropic、Google 三家占据了绝大多数 LLM API 市场。这种集中化带来了隐私风险、单点故障风险、价格锁定风险。QVAC 的本地优先 + P2P 架构是应对这些风险的一种技术解法。
更重要的是,Tether 作为稳定币发行方下场做开源 AI 基础设施,其战略意图耐人寻味。QVAC 的"稳定智能(Stable Intelligence)"概念暗示,未来可能与 Tether 的支付生态产生深度整合——用 USDT 支付 AI 推理算力的想象空间已经打开。
| 维度 | 内容 |
|---|---|
| 编程语言 | TypeScript(SDK)+ C++(推理引擎)+ Python(独立 SDK) |
| AI 框架 | llama.cpp(LLM/嵌入)、Whisper.cpp(ASR)、定制 Diffusion(图像/视频/音乐) |
| 许可协议 | Apache 2.0 |
| 架构类型 | Monorepo(40+ TypeScript/C++ 包)+ P2P 网络层 |
| 模型格式 | GGUF(llama.cpp 原生格式) |
| P2P 协议 | Hyperswarm(节点发现)+ Hypercore(模型分发注册) |
| 跨平台 | Linux、macOS、Windows、Android、iOS |
| 代码质量 | ESLint + Prettier 静态检查,测试框架覆盖核心路径 |
| 文档质量 | 官方文档(docs.qvac.tether.io)+ README + CLAUDE.md 开发者指南 |
| 隐私保护 | 完全本地推理,无云端依赖,数据不离开设备 |
| 最新版本 | @qvac/sdk v0.17.1 |