MVO 基线
均值方差优化是经典组合方法,作为被动基线之一。
官方 2026 教程提供三个 example 脚本,按顺序执行。
python examples/FinRL_StockTrading_2026_1_data.py —— 从 Yahoo Finance 下载道指 30 股票数据,加 MACD/RSI 等技术指标、VIX 与 turbulence index,切分为训练集(2014–2025)与交易集(2026-01-01 至 2026-03-20),存为 train_data.csv 与 trade_data.csv。
python examples/FinRL_StockTrading_2026_2_train.py —— 用 Stable Baselines 3 训练 5 个智能体(A2C、DDPG、PPO、TD3、SAC),模型存到 trained_models/。
python examples/FinRL_StockTrading_2026_3_Backtest.py —— 加载训练好的智能体在交易集上运行,与均值方差优化(MVO)和 DJIA 指数两个基线对比,控制台打印结果并保存 backtest_result.png。
回测脚本会输出关键指标与图表,帮助你判断不同算法表现。
| 输出 | 说明 |
|---|---|
| 累计收益 | 各智能体在交易集上的累计收益率 |
| 对比基线 | MVO(均值方差优化)与 DJIA 指数 |
| backtest_result.png | 收益曲线对比图 |
强化学习策略必须和简单基线比才有意义,否则容易把随机波动当优势。
均值方差优化是经典组合方法,作为被动基线之一。
道指指数作为「买入持有」的市场基准。
5 个 DRL 算法互相对比,看哪个在样本外更稳。
跑通不等于能赚钱,几个关键点要认清。
取决于硬件(有无 GPU)、数据量、算法与训练步数。官方示例用道指 30 只股票,训练 5 个智能体在 CPU 上也可跑,但 GPU 会明显更快。
Yahoo Finance 接口可能限流或变动,检查网络、按需重试;必要时换其他数据源(如 Alpaca、WRDS 等)。
默认保存到 trained_models/ 目录,回测脚本从该目录加载。
不代表。回测存在过拟合风险,需样本外验证、考虑交易成本与滑点,并和基线长期对比。