llama3
Meta开源大模型Llama 3,8B/70B参数,支持8192上下文窗口,纯本地推理
加载项目详情…
本应用为开源项目,仅供学习研究,请遵守其开源协议。
Meta开源大模型Llama 3,8B/70B参数,支持8192上下文窗口,纯本地推理
加载项目详情…
本应用为开源项目,仅供学习研究,请遵守其开源协议。
2024年4月18日,Meta 正式发布 Llama 3 系列开源大语言模型,8B 和 70B 两种规格、预训练+指令微调双版本,一时间震动了整个 AI 圈。这个项目的 GitHub 仓库迅速积累了超过29000颗星,至今仍是开源 LLM 领域的标杆项目。
Meta 的 Llama 系列走了一条独特的开源路线。第一代 Llama 于2023年2月发布时,仅限研究机构申请使用,并非真正意义的对公众开源。直到2023年7月,Llama 2 的发布才真正打开了开源的大门——允许商业使用(只要月活不超过7亿),这才让 Llama 真正走进了千家万户的实验室和创业公司。
Llama 3 是第三代产品。相比前代,核心进化在于三点:更大的词表(128K token)、更长的上下文(8192 tokens)、以及全面引入 Grouped-Query Attention(GQA)——这是 Llama 系列首次在推理效率上做出系统性优化。
Llama 3 的架构并不神秘,它基于标准 Transformer decoder,但做了几处关键优化。使用 128K 的大词表 tokenizer,意味着模型对中文、代码等多元语言的理解能力大幅提升——这个规模与 GPT-4 持平。GQA 的引入则解决了大模型推理速度慢的老大难问题:通过将 Key-Value 头分组,减少了推理时的计算量,让 70B 这样的巨无霸在消费级硬件上也有了可行的部署路径。
8B 模型训练用了 15T+ tokens,70B 模型同等规模数据量——这意味着模型见过的「世界」足够丰富。从 MODEL_CARD 披露的信息看,Llama 3 训练数据截止到 2023年12月,知识覆盖面相当新。
Llama 3 的指令微调版本经过了严格的对齐训练。Supervised Fine-Tuning(SFT)让模型学会遵循指令格式;Reinforcement Learning with Human Feedback(RLHF)则让模型在「有帮助」和「安全无害」之间找到平衡。从评测结果看,Llama 3 8B 在多个基准测试中已经能打平甚至超越上一代 70B 模型,性价比极高。
这个仓库是一个「极简推理示例」,不提供 Web 界面,核心入口是两个 Python 脚本:example_chat_completion.py 和 example_text_completion.py。用户只需提供模型权重目录和 tokenizer 路径,配置几个超参数(temperature、top_p、max_seq_len 等),即可跑起来。
部署流程说起来不复杂:先到 Meta 官网申请下载权限,收到带签名 URL 的邮件后运行 download.sh 拉取模型权重,然后用 pip 安装依赖即可。requirements.txt 依赖非常轻量:torch、fairscale、tiktoken、blobfile ——没有过于重型的框架。
虽然代码本身不复杂,但 Llama 3 的胃口不小。8B 模型需要至少 16GB 显存(建议 24GB 以上),70B 模型则需要 140GB+ 显存——这显然不是普通 CPU 机器能驾驭的。仓库依赖 fairscale 做模型并行,代码中使用了 initialize_model_parallel 等接口,意味着它为多卡场景预留了空间。
这个仓库是「最小化推理示例」而非完整应用框架。想做 Agent、RAG、工具调用?需要去 llama-agentic-system 或 llama-cookbook 寻找更丰富的脚本。另外需要注意许可证:Llama 3 采用 Meta 自己的社区许可,月活超过 7 亿的商业产品需要与 Meta 另行协商。
Llama 3 的发布是开源 AI 历史上的标志性事件。它让中小企业、研究者个人也能用上接近 GPT-4 水平的语言模型,无需依赖闭源 API 的配额和费用。从 GitHub 的星标增长曲线可以看出,开发者社区对它的热情持续高涨——这不仅是对 Meta 的认可,更是对开源 AI 生态投下的信任票。