Yi-1.5
国产开源大模型,9B版本对标Llama 3 70B性能,Apache 2.0可商用,支持Transformers/vLLM/Ollama多端部署
加载项目详情…
本应用为开源项目,仅供学习研究,请遵守其开源协议。
国产开源大模型,9B版本对标Llama 3 70B性能,Apache 2.0可商用,支持Transformers/vLLM/Ollama多端部署
加载项目详情…
本应用为开源项目,仅供学习研究,请遵守其开源协议。
三年前,如果有人说「我要在自己电脑上跑一个 GPT-3.5 水平的对话模型」,大概率会被当作天方夜谭。彼时 GPT-3.5 闭源托管在 OpenAI 的服务器上,API 调用按 token 收费,中文支持也远不如英文。而今天,只需一块显存足够的中高端 NVIDIA 显卡,就能在本地部署一个中文能力接近 GPT-3.5 的开源大模型——这就是零一万物(01.AI)推出的 Yi-1.5 系列。
Yi-1.5 并非凭空出现。它的前身 Yi-1.0 在 2024 年初发布时就已经震惊了开源社区:34B 参数的模型在多项基准测试中直接对标 Llama 2-70B,参数少了一半、效果却旗鼓相当,一时间「国产开源模型崛起」的讨论刷遍了技术社区。而 Yi-1.5 是对 Yi-1.0 的全面升级,在编程、数学、推理和指令遵循四项核心能力上显著提升,同时保持了对语言理解、常识推理、阅读理解等基础能力的稳定发挥。
零一万物成立于 2023 年,由前谷歌中国区总裁、知名 AI 科学家李开复博士创立。作为深度参与过 Google Brain、Sina 等项目的 AI 老将,李开复在 2010 年代就预判了深度学习的爆发,并在 2023 年选择躬身入局大模型赛道。他的目标很明确:打造世界级的大模型,让尽可能多的人用得上、用得起。
零一万物的技术路线与 Meta 的 Llama 不同。Llama 走的是「全面开源、人人可用」的路线,而零一万物在开源的同时,也通过 Yi Platform(灵犀平台)提供商业 API 服务,形成开源引流+商业变现的双轮驱动。目前 Yi 系列模型的 API 已在 OpenRouter、Replicate 等第三方平台上线,全球开发者均可按需调用。
从技术实现来看,Yi-1.5 的模型架构基于 Meta 的 LlamaForCausalLM 代码库,这意味着它与主流开源生态高度兼容——LLaMA-Factory、Axolotl、Swift、XTuner 等主流微调框架均已支持 Yi 系列。这种「站在巨人肩膀上」的策略极大降低了开发者的适配成本。
Yi-1.5 的核心竞争力在于数据质量。团队构建了 3.1 万亿 tokens 的英中双语预训练语料库,采用级联式数据去重和质量过滤管道,严格把关数据源头。在 500B tokens 的高质量续训数据上做了进一步的持续预训练,并使用 300 万条多样化微调样本进行指令对齐。正是这套数据工程体系,让 Yi-1.5 在同等规模下实现了对 Llama 3 70B 的性能超越。
模型提供三种参数规格:
此外,Yi-1.5 还提供 16K/32K 上下文版本,支持长文档分析和长对话场景。
Yi-1.5 在 HumanEval(代码生成)和 MBPP 基准上表现出色,尤其是 9B 版本——官方宣称其为「同规模开源模型中编程能力最强」。这意味着它可以承担中等复杂度的代码补全、代码审查、简单函数生成等任务,在 Copilot 类工具场景中有实际可用性。对于个人开发者或小型团队而言,用 Yi-1.5-9B 替代部分 GPT-4 API 调用,在成本控制上有显著优势。
数学是检验大模型「真智能」的试金石。Yi-1.5 在 GSM8K(小学数学)、MATH(竞赛数学)基准上达到或超过 Llama 3 70B 水平,证明了其在多步推理和符号运算上的能力。不过需要注意的是,与 GPT-4o 和 Claude 3.5 相比,34B 参数模型在极复杂数学证明上仍有差距,这一点对于从事前沿数学研究的研究者而言值得关注。
3M 条多样化微调样本覆盖了客服、教育、内容创作、信息抽取等多种场景,Yi-1.5 的指令遵循能力(Instruction Following)在 Chatbot Arena 中排名靠前。实际使用中,它的对话连贯性和角色扮演稳定性表现良好,但偶尔会出现「过度礼貌」和「过于冗长」的问题,在需要简洁输出的场景(如 API 响应)中可能需要通过 prompt engineering 加以控制。
对于希望在本地运行的开发者,Yi-1.5 提供了标准的 Hugging Face Transformers 接口:
from transformers import AutoModelForCausalLM, AutoTokenizer
model = AutoModelForCausalLM.from_pretrained('01-ai/Yi-1.5-9B-Chat', device_map='auto')
tokenizer = AutoTokenizer.from_pretrained('01-ai/Yi-1.5-9B-Chat', use_fast=False)
# 配合 transformers>=4.36.2 和 torch>=2.0.1
这种方式的优点是灵活可控,缺点是需要手动管理显存和批处理。对于 34B 模型,建议使用量化(GPT-Q/AWQ)来降低显存需求。
vLLM 是目前开源社区最流行的高效推理框架,Yi-1.5 官方文档提供了完整的 vLLM 部署指南:
python -m vllm.entrypoints.openai.api_server \
--model 01-ai/Yi-1.5-9B-Chat \
--served-model-name Yi-1.5-9B-Chat
vLLM 支持 PagedAttention 显存管理和连续批处理,吞吐量比原生 Transformers 高出数倍,适合需要并发服务的生产环境。
Yi-1.5 仓库自带 Gradio web demo,通过 python demo/web_demo.py -c <model-path> 即可在本地启动一个类似 ChatGPT 的网页界面。依赖项在 requirements.txt 中清晰列出:gradio、torch、transformers、sentencepiece、accelerate,安装后开箱即用。
Ollama 是 macOS/Windows 用户最友好的本地大模型运行工具,Yi-1.5 已在 Ollama 官方模型库上架:
ollama run yi:v1.5 # 傻瓜式下载+运行
Ollama 同时暴露 OpenAI 兼容 API,可以无缝替换现有代码中的 OpenAI base_url。
Yi-1.5 官方推荐使用以下微调框架:
这种「不重复造轮子」的生态策略,使得 Yi-1.5 的用户可以零成本复用整个 Llama 生态的微调资产,大幅降低了企业定制化的门槛。
Yi-1.5 并非没有槽点。首先是中文预训练数据比例问题:虽然团队强调了中英双语训练,但实际测试中,部分中文成语和俚语的理解仍有提升空间,在需要高度本土化表达的创作场景中偶有偏差。其次是上下文长度:虽然有 16K/32K 版本,但与 Claude 的 200K 上下文相比仍有差距,长文档分析场景受限于此。
另外,Yi-1.5 的开源许可证虽然宽松(Apache 2.0),但商业使用仍需关注零一万物的附加条款,尤其是涉及模型输出内容的合规性要求,企业用户应咨询法务。
Yi-1.5 的发布在开源大模型社区具有标志性意义。在其发布之前,开源社区普遍认为「小模型不可能追上大模型」,但 9B 版本对标 Llama 3 70B 的表现打破了这一认知。更重要的是,Yi-1.5 的 Apache 2.0 许可证意味着它可以自由商用,这为中小企业和研究机构提供了用较低成本获得顶尖语言模型能力的机会。
从趋势上看,Yi-1.5 代表了「高质量开源中文大模型」的一个重要节点。随着零一万物持续迭代和开源社区的共建,国产开源大模型的能力边界正在快速收窄与国际顶尖闭源模型的差距。对于开发者而言,这既是机遇(低成本获取强大模型能力)也是挑战(需要持续跟进快速迭代的模型生态)。
总结:Yi-1.5 是目前开源中文大模型中性能最强的候选者之一,三种规格覆盖了从个人开发者到企业的不同需求场景。以 9B 版本为例,仅需约 18GB 显存即可获得接近 GPT-3.5 的对话体验,性价比极高。如需更强的推理能力,可以上到 34B 版本,但需要准备足够的 GPU 资源。