mold
utensils/mold加载项目详情…
本应用为开源项目,仅供学习研究,请遵守其开源协议。
加载项目详情…
本应用为开源项目,仅供学习研究,请遵守其开源协议。
凌晨两点,你刚刚完成一组产品图的设计迭代。第三版、第七版、第十五版……每生成一次就烧掉几美分的 GPU 算力,月底账单悄悄爬上了三位数。你开始想:如果这些 GPU 就在自己的机器上,24 小时免费调用,不用排队,不用看云服务商的脸色,那该多好?
Mold 正是为这个念头而生。它是一个完全本地运行的 AI 图像和视频生成引擎——不是某个 Web 服务的包装器,而是真正跑在你自己的 NVIDIA 显卡或 Apple Silicon Mac 上的推理引擎。36 颗 GitHub stars 背后,是一个野心勃勃的多端合一方案:从命令行脚本到桌面 GUI,从 REST API 到 iPhone 远程伴侣,全部共享同一套 Rust 后端。
Mold 的核心推理引擎选择了一个相对小众但极具潜力的路线——用 Rust 语言配合 candle 框架(来自 HuggingFace 的纯 Rust ML 库)。这与主流的 PyTorch/C++ 方案形成了鲜明对比。candle 的优势在于:零 Python 依赖、无 GIL 限制、编译时保证内存安全,且能直接编译为单个二进制分发。
项目采用 Monorepo 架构,后端拆分为十余个专用 crate:mold-core 定义核心数据模型,mold-inference 处理图像生成 pipeline,mold-scheduler 负责 GPU 任务调度和 ETA 预测,mold-server 暴露 REST/SSE 接口,mold-candle 封装底层 ML 推理逻辑,mold-db 管理本地 SQLite 记录,mold-tui 构建终端交互界面。前端则使用 Bun + Vue 3 + Tauri 构建跨平台桌面应用,配合 TailwindCSS v4 实现 UI。
这套架构的核心理念在 PRODUCT.md 中写得很清楚:"CLI-Native"——命令行是地基,其他界面(桌面、Web、TUI、iPhone)都是地表上的建筑。这意味着你可以在 shell 脚本里写 pipeline,在 CI 作业里调用生成,交给 AI agent 自动执行——不需要任何图形界面。
Mold 支持的模型生态覆盖了当前 AI 生图的主流选择:FLUX.1 Schnell/Dev(快速/高质量)、Stable Diffusion 1.5、SDXL,并通过 GGUF 量化格式支持低显存部署。视频生成(Text2Video、Image2Video、Video2Video)也已集成,配合 LoRA 和 ControlNet 实现风格定制和结构控制。
GPU 调度是 Mold 的技术亮点。Scheduler V2 会分别学习冷启动加载、热重载和实际执行的时间,生成准确的 ETA 预测。调度器基于设备实测空闲 VRAM(而非总容量)做 admission control,并支持精确的 GPU UUID 指定(cuda:<uuid>)避免 ordinal 重排带来的调度混乱。
Mold Studio 桌面应用将生成、素材库、模型管理和机器状态四大功能集成在一个原生 GUI 中。素材库支持跨设备同步(局域网/Tailscale/RunPod),自动汇聚各机器的生成结果并提供原生媒体操作。模型发现功能从 Mold、HuggingFace 和 Civitai 自动拉取 checkpoint,并显示实时下载进度。
NVIDIA GPU 用户(Linux/Docker):
# 构建镜像(指定 GPU 架构,90=Hopper/H100)
docker build -t mold-server .
docker build --build-arg CUDA_COMPUTE_CAP=90 -t mold-server-h100 .
# 启动服务
docker run --gpus all -p 7680:7680 mold-server
# 或直接安装 mold CLI(需 Rust 1.93+)
cargo install mold-cli
macOS Apple Silicon 用户可以直接下载 dmg 安装包,无需配置 CUDA 环境。Web 端在任意平台上通过 mold serve 一键启动,浏览器访问即可使用。GPU 显存需求取决于模型——FLUX.1 Q8 量化版约需 12GB VRAM,原生 FP16 完整 FLUX 模型(23GB)需要超过 24GB(含 activation memory)。
candle 框架是理解 Mold 技术价值的关键。它由 HuggingFace 开发,是 Rust 生态中目前最完整的深度学习框架。相比 PyTorch,candle 的核心优势在于:无运行时依赖(编译为单一可执行文件)、内存安全保证(杜绝 segment fault)、并发友好(无 GIL)。对于 Mold 这样的本地部署工具,这意味着:分发简单(一个二进制)、运行时稳定(不会因为显存泄漏 OOM)、可嵌入其他 Rust 项目作为库使用。
不过 candle 的生态成熟度仍落后于 PyTorch——FP8 格式尚未支持,部分自定义算子需要等待上游更新。config.example.toml 中明确标注了已知不支持的格式,建议用户使用 GGUF 量化模型以获得最佳兼容性。
Mold 目前最明显的局限在于生态成熟度。项目 stars 尚少(36),社区规模有限,模型生态依赖手动配置(需从 HuggingFace/Civitai 下载权重放置到指定路径)。Dockerfile 仅针对 RunPod 和 NVIDIA 主机优化,未提供 docker-compose 一键编排,AMD ROCm 支持缺失(Windows NVIDIA 用户需要原生安装而非容器化)。
此外,candle 框架的版本仍在快速迭代,某些新模型格式(如 FP8)需要等待上游支持。当前视频生成功能的详细效果和稳定性数据披露较少,实际表现需要用户自行验证。
Mold 的出现填补了一个长期空缺:AI 生图领域的"本地优先"选项长期被闭源云服务(如 Midjourney)和资源占用高的开源方案(如 ComfyUI)两端占据。Mold 用 Rust + candle 证明了第三条路的可行性——既非云端托管,也不是重型 Python 依赖,而是轻量、安全、可脚本化的本地推理引擎。
随着 LLMOps 工具链向本地化演进(Ollama 已是很好的先例),Mold 代表了一个趋势:推理引擎不应该只能通过 API 调用。CLI-native + REST + MCP 的三层接口设计,让 Mold 天然适配 AI Agent 工作流——这也是项目明确标注 "Agent ready" 的原因。可以预见,随着项目 stars 增长和社区贡献的积累,Mold 有潜力成为本地 AI Agent 的标配图像生成后端。
技术栈速览: Rust + candle + Vue 3 + Tauri + TailwindCSS v4 · MIT License · Monorepo (Rust crates + TypeScript workspaces) · 支持 NVIDIA CUDA / Apple Silicon Metal · 模型:FLUX / SD1.5 / SDXL · 接口:CLI / REST-SSE / MCP / TUI / Desktop / iPhone