USB-Uncensored-LLM
U盘即 AI 电脑:插上任何设备即可运行 Gemma/Qwen 等大模型,完全离线、隐私优先、跨平台
加载项目详情…
本应用为开源项目,仅供学习研究,请遵守其开源协议。
U盘即 AI 电脑:插上任何设备即可运行 Gemma/Qwen 等大模型,完全离线、隐私优先、跨平台
加载项目详情…
本应用为开源项目,仅供学习研究,请遵守其开源协议。
想象一个场景:你是一位隐私敏感的研究者,或者身处网络受限的环境,想在自己电脑上跑一个完全离线、无审查的 AI 助手。传统的方案是什么?安装 Ollama、下载模型、配环境——至少折腾半小时,还容易踩坑。USB-Uncensored-LLM 改变了这一切:它把整个 AI 运行环境打包进一个 U 盘,插上任何一台电脑,5 分钟内就能跑起 Gemma 2B、Qwen 3.5 9B 等高质量大模型,全程无需联网,完全离线的「空气间隙」(Air-Gapped)环境。
这个项目由独立开发者 techjarves 创建,GitHub 仓库截至分析时已收获约 1507 颗星,话题标签为 local-llm、portable-ai、uncensored-ai。项目名中的「Uncensored」直接点明了核心定位:内置的模型经过特殊的 Abliterated / Heretic 微调,专门移除了主流大模型内置的安全对齐机制,让模型对用户的任何问题都「有问必答」——无论内容或法律性质如何。这个项目填补了一个真实痛点:当你需要研究某些被主流 AI 平台过滤的内容时,往往无路可走。
项目底层采用 Ollama 作为推理引擎的「发动机」:各平台目录下只存放一个约 50MB 的 Ollama 可执行文件,所有模型权重统一存放在 Shared/models/ 目录,以 GGUF 格式存储。这意味着你下载一次 Gemma 2B(约 1.6GB),就能在 Windows PC、MacBook、Linux 主机、Android 手机上无缝切换使用,模型权重零重复拷贝。
Windows/start-fast-chat.bat 的实现逻辑非常聪明:启动时优先查找 Shared/python/python.exe(便携 Python),若不存在则自动从 python.org 下载嵌入版压缩包(约 11MB)并解压到 U 盘。整个过程无需管理员权限,不修改系统注册表,不污染主机环境。
Shared/chat_server.py 是整个项目体验的核心——一个纯 Python 标准库实现的 HTTP 服务器(基于 http.server),零第三方依赖。它承担三个职责:UI 服务(将 FastChatUI.html 推送给浏览器)、API 代理(转发给 Ollama 规避 CORS)、对话持久化(JSON 格式存储聊天记录)。一大亮点是硬件监控的零依赖实现:Windows 上用 ctypes 调用 GetSystemTimes + GlobalMemoryStatusEx,Linux 上读取 /proc/meminfo——全程无任何外部库依赖。
项目内置经过精心筛选的模型列表,每个模型都有明确的定位标签:Gemma 2 2B Abliterated(1.6GB,首选推荐,安全对齐向量数学清除)、Gemma 4 E4B Ultra Heretic(5.34GB,高质量无过滤)、Qwen 3.5 9B Uncensored(5.2GB,强推理能力)、NemoMix Unleashed 12B(7.0GB,最大参数)。安装脚本内置交互式菜单,支持直接下载 GGUF 文件或手动放入 HuggingFace 上的任意 .gguf 权重文件。
Ollama 引擎自动检测并利用宿主机的硬件加速:NVIDIA GPU 使用 CUDA,Apple Silicon 使用 Metal,x86 CPU 利用 AVX 指令集——同一套 USB 环境在不同硬件上都能达到最佳性能。
由于项目刻意不做容器化(这是设计选择——Docker 无法满足「跨平台即插即用」的核心需求),部署属于部分支持级别:Windows 双击 install.bat 选择模型 → 双击 start-fast-chat.bat 启动 → 浏览器打开 http://localhost:3333。硬件需求:USB 3.0+ 驱动器 + 8GB RAM(2B 模型)或 16GB RAM(9B+ 模型)。Android 支持 Termux 独立运行。局域网移动端可通过 http://<PC_IP>:3333 直接访问。
必须坦诚地说,这个项目的定位存在不可回避的争议性。「无审查」模型可以被用于绕过主流平台内容政策。README 中有免责声明,用户需自行承担本地使用的后果。技术层面也存在局限:纯 CPU 推理速度较慢(Android 端 2B 模型约 3-10 tokens/s),USB 3.0 带宽限制了大模型加载速度,无容器化也意味着难以在服务器环境中批量部署。
USB-Uncensored-LLM 代表了一个值得关注的方向:AI 的物理可移植性。当大模型权重可以像文档一样装进口袋,在任意设备上即插即用,这意味着:隐私主权回归个人(对话数据永远不会离开自己的存储设备)、离线 AI 成为可能(野外作业、网络受限地区均可使用)、AI 民主化深入推进(不需要云订阅,不需要高性能主机)。项目目前 1500+ 星的增长曲线表明,开发者社区对「隐私优先、无审查」本地 AI 工具的需求真实存在。尽管争议不断,它的工程实现质量(零依赖设计、跨平台脚本、优雅的错误处理)是值得学习的范本。