open-llms
收录60+可商用开源LLM许可证信息的结构化清单,帮助工程师快速完成技术选型
加载项目详情…
本应用为开源项目,仅供学习研究,请遵守其开源协议。
收录60+可商用开源LLM许可证信息的结构化清单,帮助工程师快速完成技术选型
加载项目详情…
本应用为开源项目,仅供学习研究,请遵守其开源协议。
图1:项目维护者 Eugene Yan 的 GitHub 头像
想象你是一家初创公司的 CTO,老板说:「我们要做 AI 产品,但 OpenAI 的 token 价格太高了,能不能找个开源模型自己部署?」你打开 GitHub 一搜,出来的名字比电影明星还多:Llama、Mistral、ChatGLM、Qwen、BLOOM……每个都号称 SOTA,但当团队真正开始评估时,问题来了:这些模型能商用吗?要付授权费吗?有哪些限制条款?
你去翻各个模型的 LICENSE 文档——有的说 Apache 2.0,随便用;有的说需要申请;有的写着一大堆你看不太懂的法律术语。最后光是搞清楚「哪些能免费商用」,团队就花了一周时间。
eugeneyan/open-llms 解决的就是这个问题——它把 60+ 个开源大语言模型的商业授权信息整理成一张结构化清单,让选型工程师用 5 分钟就能搞清楚所有关键问题。
这个仓库由新加坡机器学习工程师 Eugene Yan 创建并维护。Eugene 在 AWS 从事推荐系统和 LLM 相关工作多年,是机器学习领域的高产技术作者,他的技术博客在业内广泛传播。2023年5月,他将自己在工作中整理的「可商用开源 LLM 清单」公开发布到 GitHub。
项目上线后迅速获得关注——截至分析时已累计 12,775 颗 stars 和 969 个 forks,成为该领域最受欢迎的信息聚合类仓库之一。项目持续活跃维护,截至 2025年2月仍有 push 记录,跟踪收录了 Llama 3、Mistral 系列、Qwen 系列、Phi-3 等最新模型。
如果说开源 LLM 是公路上各种各样的汽车,那么许可证(License)就是每辆车的「驾照」。Apache 2.0 像 C 照,随便开、不收费;Llama 2 Community License 像运营驾照,允许商业运营但有地区或用途限制;某些自定义 License 则像特种驾照,要求申请、审批、付费。
这份清单就像一本「开源 LLM 商业驾照手册」,把所有车型的驾照信息集中到一张表里。你不用去翻每个模型的 LICENSE 文件,只需要看这一张表,商用可行性一目了然——这是真正的信息聚合价值。
项目收录了从 2019 年的 T5 到 2024 年的 Gemma,共 60+ 个可商用的开源大语言模型,覆盖全主流开源模型家族:
| 维度 | 收录内容 |
|---|---|
| 时间跨度 | 2019(T5) → 2024(Gemma),涵盖 LLMs 爆发期 |
| 参数规模 | 从 60M 的 T5-Small 到 176B 的 BLOOM |
| 许可证类型 | Apache 2.0、MIT、OpenRAIL-M、Llama 2 License、Gemma Terms 等 |
| 上下文长度 | 从 512 tokens 的 T5 到 32768 tokens 的 Mixtral |
| 代表模型 | BLOOM (176B)、Llama 2、Mistral、Qwen、DeepSeek、Gemma、Phi 等 |
每个条目都包含:模型名称、发布日期、官方链接、参数规模、上下文长度、许可证类型、可体验地址。这种结构化设计让跨维度对比成为可能——你想找「支持 32K 上下文 + 可免费商用」的条件组合?看这一张表就够了。
代表收录模型包括:T5、RWKV 4 系列、BLOOM (176B)、ChatGLM、Llama 2、Mistral、Mixtral、Phi-2/3、Qwen 系列、DeepSeek 系列、Gemma 等,基本覆盖了 2019-2024 年间所有主流开源 LLM。
这是零门槛项目。 这是一个纯 Markdown 文档仓库,不需要安装任何软件,不需要配置环境,不需要运行代码。你只需要打开 GitHub 页面(https://github.com/eugeneyan/open-llms),在线浏览或 Fork 下来作为内部参考资料即可。
对于 AI 开发者:这个项目是技术选型阶段的高效参考工具,适合团队在做 POC 时快速缩小候选范围。
对于 AI 爱好者:这份清单也是了解开源 LLM 生态演进史的好材料——从 T5 到 Mistral,每一代模型的参数量、上下文长度、许可证都清晰可查。
仅提供信息,不提供模型本身:项目只收录链接指向 HuggingFace 等平台下载模型权重,不托管任何模型文件。
许可证信息可能存在时效性:开源许可证可能随模型版本更新而变化,建议在正式商用前直接查阅原始 LICENSE 文件确认最新条款。
不评判模型质量:清单只告诉你「能不能商用」,不评判「哪个更好」。模型性能对比需要参考 LM-evaluation-harness 等 benchmark 项目。
纯 Markdown 缺乏交互:随着收录模型增多(目前已 60+),纯表格的浏览效率会下降,没有搜索和过滤的交互功能。
开源 LLM 在 2023-2024 年迎来爆发,但商业化落地面临一个实际障碍:许可证合规是企业部署前的必修课。开发团队往往要翻遍各个模型的 GitHub 才能确认商用可行性,这种重复劳动既低效又容易出错。
eugeneyan/open-llms 的意义在于:用信息聚合的方式,把许可证合规这个「前置工作」做到了极致。它让技术选型从「大海捞针」变成了「按图索骥」,为开源 AI 生态的商业化落地扫清了信息障碍。
这个项目也反映了一个趋势:随着开源模型越来越多,围绕模型的「元信息」——许可证、评测结果、集成方式——正在成为独立的价值锚点。
数据来源:GitHub(截至 2025年2月),收录模型 60+,stars 12,775