qlib
微软开源的 AI 量化投资全栈平台,覆盖数据获取、因子挖掘、模型训练、回测评估全流程
加载项目详情…
本应用为开源项目,仅供学习研究,请遵守其开源协议。
微软开源的 AI 量化投资全栈平台,覆盖数据获取、因子挖掘、模型训练、回测评估全流程
加载项目详情…
本应用为开源项目,仅供学习研究,请遵守其开源协议。
想象你是一位基金经理,手中掌握着数十年的股市数据,想用 AI 模型从海量历史走势中寻找盈利规律。传统方式下,你需要分别处理数据清洗、特征工程、模型训练、回测验证、实盘对接等多个环节,每个环节都可能涉及完全不同的工具链——光是环境搭建和数据对接就足以让人焦头烂额。微软推出的 Qlib,正是为解决这一痛点而生的一站式 AI 量化投资平台。
Qlib 由微软研究院(Microsoft Research)主导研发,最初于 2020 年以论文形式发布在 arXiv 上,目标是填补 AI 技术与量化投资之间的基础设施鸿沟。量化投资领域长期以来依赖传统统计方法,而 AI 技术的引入带来了新的学习范式——监督学习、市场动态建模、强化学习等——但这些新范式需要配套的数据管理、模型训练和回测基础设施才能真正落地。Qlib 的出现正是为了提供这套基础设施,让研究者能够专注于策略本身的创新,而非被工程细节拖累。
经过多年迭代,Qlib 已从最初的学术研究工具演变为功能完整的工业级平台。2025 年,项目引入了 RD-Agent,将大语言模型驱动的自主 Agent 引入量化 R&D 流程,进一步拓宽了平台的能力边界。
如果把量化研究比作烹饪,Qlib 就是一套配备了所有厨具的开放式厨房。它不是某个单一功能的工具,而是一条覆盖数据获取、特征工程、模型训练、回测评估全流程的端到端流水线。
具体来说,Qlib 的核心模块包括:
数据层(qlib.data):内置数据下载器和处理器,支持从多个数据源(包括 JoinQuant、Wind 等)获取历史行情数据,并通过高效二进制格式(dump_bin)存储,支持高速回放。数据清洗、因子计算等常见操作都有现成接口,无需重复造轮子。
模型层(qlib.model):内置大量前沿模型实现,涵盖监督学习(GAT、Transformer、LightGBM 等)、时间序列预测、强化学习等多个方向。研究者可以直接调用预置模型快速验证想法,也可以基于平台接口自定义模型。
策略层(qlib.strategy):提供基于 TopKDrop 的交易策略实现,支持自定义仓位管理和下单逻辑。策略层与回测层无缝对接,形成从信号生成到交易执行的完整闭环。
回测层(qlib.backtest):高性能离散事件回测引擎,支持订单簿(OrderBook)级别的高频数据回测,具备完整的滑点、手续费、流动性约束等真实交易场景模拟能力。
工作流层(qlib.workflow):统一的实验管理与记录系统,基于 MLflow 追踪训练过程,支持超参数搜索和模型版本管理。
强化学习层(qlib.rl):支持基于 Tianshou 的强化学习训练框架,专门针对订单执行和策略优化场景设计,这是 Qlib 在前沿探索方向上的重要布局。
完整的量化研究闭环:Qlib 最核心的价值在于它提供了从想法到回测结果的完整闭环。研究者不需要东拼西凑组合 DataFrame 处理、sklearn 训练、Backtrader 回测等多个工具,Qlib 统一了这一切。这大大降低了量化研究的技术门槛,让更多研究者能够快速验证 AI 驱动的投资策略。
RD-Agent 自动化 R&D:2025 年新引入的 RD-Agent 模块代表了量化研究自动化的前沿方向。它利用大语言模型自动完成因子挖掘和模型优化,据论文显示已在多个数据集上验证了有效性。这意味着 Qlib 不再只是一个工具库,而是开始具备「AI 替你做研究」的能力。
高频交易支持:qlib.rl_order_execution 和 orderbook_data 示例展示了 Qlib 在高频量化方向的能力储备。通过集成 gym 环境接口,策略开发者可以像训练游戏 AI 一样训练订单执行策略。
工业级代码质量:项目采用了 pyproject.toml 标准化打包,依赖管理清晰,支持 Python 3.8~3.12 全版本。内置了 mypy 类型检查、pylint 代码规范、pre-commit 钩子等工程化实践,代码质量在开源量化项目中属于较高水平。
Qlib 目前没有 Web UI,完全基于 Python API 和命令行操作。安装方式非常简单:通过 pip 直接安装 pyqlib 包即可,官方镜像站提供了预装环境的 Docker 镜像供不想折腾依赖的开发者使用。数据获取则需要通过 scripts/get_data.py 脚本连接数据源(部分数据源需要额外权限)。
官方文档(ReadTheDocs)提供了从快速入门到高级用法的完整教程,examples 目录中包含了大量可直接运行的示例,涵盖因子挖掘、模型训练、强化学习、高频交易等多个场景。
需要客观指出的是,Qlib 并非没有短板。首先,数据依赖是最大的门槛——高质量的 A 股/美股历史数据通常需要付费获取,免费用户难以体验到完整功能。其次,强化学习模块的依赖(tianshou + torch + numpy<2.0)与其他部分存在版本约束,部署时可能遇到依赖冲突。再者,作为一个纯研究导向的平台,它不提供实盘交易接口(仅支持回测模拟),生产环境落地需要自行对接券商 API。
此外,Dockerfile 采用的是单阶段构建而非多阶段构建,镜像体积相对较大;没有提供 docker-compose 一键部署方案,对于希望快速尝鲜的用户来说环境配置仍有一定成本。
从行业视角看,Qlib 的出现代表着 AI 量化投资从「手工时代」向「平台时代」的过渡。它证明了微软这样的大厂愿意投入工程资源来降低 AI 量化的研究门槛,也为学术界提供了一个可复现的基准平台。随着 RD-Agent 的引入,Qlib 正在探索「AI 辅助量化研究」的下一个范式。
如果你是一名对量化投资感兴趣的 AI 研究者或机器学习工程师,Qlib 值得作为第一个系统性了解的对象——它的设计理念、代码架构和持续迭代的路线图,都在告诉我们:AI 赋能金融投资这件事,才刚刚开始。
项目信息