llm-server

自动探测多卡硬件拓扑,为 GGUF 模型智能计算最优张量分片和 MoE 放置,一键启动 llama.

Stars272
Forks16
主语言Shell
分类模型部署与推理
作者raketenkater
LicenseMIT

加载项目详情…