Qlib 量化模型选型完整指南20 AI 模型在 CSI300 上的实测对照【免费下载链接】qlibQlib is an AI-oriented Quant investment platform that aims to use AI tech to empower Quant Research, from exploring ideas to implementing productions. Qlib supports diverse ML modeling paradigms, including supervised learning, market dynamics modeling, and RL, and is now equipped with https://github.com/microsoft/RD-Agent to automate RD process.项目地址: https://gitcode.com/GitHub_Trending/qli/qlib选 A 股日频策略模型时一个很现实的困境是LightGBM 稳妥但上限不高想换 Transformer、GRU 又不知道谁真的能跑出正收益自己跑一轮结果好坏还说不清是模型问题还是口径问题。Qlib 是一个面向 AI 的量化投资平台把数据、因子、模型、回测装在同一条流水线里。本文是一篇 Qlib 模型选型实测直接采用仓库自带的 CSI300 基准数据examples/benchmarks/README.md同一套口径对比 20 个模型帮你跳过试错、直接落到结论。本文地图「基准口径」这一组数字到底怎么跑出来的只讲口径不堆代码「实测发现」先给核心判断再按树模型 / 序列深度 / 注意力三类展开「最短复现路径」4 步命令级清单每步不超过 5 行「避坑与选型对照」数据版本、口径不一致等常见坑 一张场景对照表基准是怎么跑出来的所有对比都锚定在同一份配置上以 workflow_config_lightgbm_Alpha158.yaml 为准项目口径股票池 / 基准沪深300CSI300对比基准 SH000300数据频率A 股日频因子体系Alpha158人工设计的表格型因子与 Alpha360原始价量数据两套时间切分训练 2008–2014验证 2015–2016测试 2017-01-01 至 2020-08-01回测策略TopkDropoutStrategy持有评分最高的 50 只每日淘汰末位 5 只并补入新晋 5 只交易成本买入 0.05%、卖出 0.15%、最低 5 元统计方式每个模型 20 次不同随机种子表中为均值 ± 标准差Qlib 的流水线结构数据 → 模型 → 回测 → 报告如下图这也是后面改一个配置就能换模型的原因评估看两组数信号质量IC、Rank IC——预测值与未来收益的相关性越大越好和组合收益年化收益、信息比率 IR、最大回撤。只盯年化不看回撤或者只盯 IC 不组合实盘都会产生误判。实测发现结论先行先给核心判断树模型是性价比之王序列深度学习在原始价量数据上更能打注意力架构则严重依赖因子体系。分三类看数字数据取自 examples/benchmarks/README.mdCSI300 口径树模型跨两套因子都站得住模型因子年化收益IR最大回撤DoubleEnsembleAlpha15811.58% ± 1%1.34-9.2%LightGBMAlpha1589.01%1.02-10.4%XGBoostAlpha1587.80%0.91-11.7%LightGBMAlpha3605.58%0.76-6.6%DoubleEnsemble基座是 LightGBM 的两层集成在 Alpha158 上是全场第一。更值得注意的是 LightGBM 换到 Alpha360 后收益降到 5.58%但最大回撤只有 -6.6%——它是全表回撤最浅的模型适合作为一切对比的基线。序列深度学习原始价量数据才是主场Alpha360 不做特征工程、保留时序结构序列模型的相对优势在这里才显现模型因子年化收益IR最大回撤HISTAlpha3609.87%1.37-6.8%IGMTFAlpha3609.46%1.35-7.2%TCTSAlpha3608.93%1.23-8.6%GRUAlpha3607.20%0.97-8.2%HIST、IGMTF、TCTS 的 IR 全部超过 1.2回撤控制在 -9% 以内。反过来LSTM/GRU 在 Alpha158 上配 20 个精选特征也有 3%–4.7% 年化说明**模型 × 因子体系是组合关系不存在万能模型**。注意力与 Transformer 类看搭配TRA 在两套因子下都进了前列Alpha360 年化 9.20%、IR 1.28Localformer 在 Alpha158 上年化 4.38%。但同样是注意力架构裸 Transformer 在 Alpha360 上年化为-2.70%TabNet 为 -3.69%——架构本身不保证收益训练细节如是否配特征筛选影响很大。从 0 到 1最短复现路径最短路径是拉数据 → 跑配置两步全程命令级1. 装环境并克隆仓库官方示例最低要求 16G 内存、5G 磁盘git clone https://gitcode.com/GitHub_Trending/qli/qlib cd qlib pip install -e .2. 拉取 A 股日线数据python scripts/get_data.py qlib_data --target_dir ~/.qlib/qlib_data/cn_data --region cn3. 一键跑通 LightGBM 基准配置即流程数据切分、模型参数、回测策略都在一个 yaml 里cd examples/benchmarks/LightGBM pip install -r requirements.txt qrun workflow_config_lightgbm_Alpha158.yaml跑完后 Recorder 会自动记录 IC、Rank IC、年化收益、IR、最大回撤并能生成 HTML 回测报告报告模块见 qlib/contrib/report/。4. 要多跑几次求均值榜单口径是 20 次随机种子python run_all_model.py run 20 lightgbm Alpha158 csi300换模型只是换 yamlexamples/benchmarks/ 下每个模型一个目录把qrun指向对应配置即可。想自动搜参可参考 examples/hyperparameter/LightGBM/。避坑与选型对照先说四个最容易翻车的点数据版本不一致数字对不上。README 榜单基于 v1 数据集复现时需加--version v1默认 v2 来自另一采集渠道结果会有差异。口径不一致的模型没法横比。部分深度模型LSTM、GATs 等配的是按 LightGBM 特征重要性筛选出的 20 个特征读表时留意 Dataset 列的备注。单跑一次就下结论。榜单是 20 次随机种子的均值 ± 标准差有随机性的模型跑 1 次方差会很大。旧版本数字不能比。0.8.0 起回测引擎有较大改动网上流传的旧结果与现版本不可直接对比。按场景选起点的对照表按先保下限、再博上限排序场景建议起点因子体系硬件调参成本先建基线验证数据与流程LightGBMAlpha158CPU16G 内存低树模型冲上限DoubleEnsembleLGBM 基座Alpha158CPU16G 内存中序列深度学习研究HIST / TCTS / GRUAlpha360GPU高注意力架构实验TRAAlpha158 / Alpha360GPU高下一步完整模型榜单与贡献规范在 examples/benchmarks/README.md数据接口用法见 docs/start/getdata.rst想做特征重要性分析可以看 examples/model_interpreter/。现在就做一件事把上面的 4 步命令跑完 LightGBM 基准记下它的 IC 和最大回撤——那是你后续换任何模型时该对齐的标尺。【免费下载链接】qlibQlib is an AI-oriented Quant investment platform that aims to use AI tech to empower Quant Research, from exploring ideas to implementing productions. Qlib supports diverse ML modeling paradigms, including supervised learning, market dynamics modeling, and RL, and is now equipped with https://github.com/microsoft/RD-Agent to automate RD process.项目地址: https://gitcode.com/GitHub_Trending/qli/qlib创作声明:本文部分内容由AI辅助生成(AIGC),仅供参考