机器学习如何利用日内共性预测波动率?¶
一句话结论:Zhang、Zhang、Cucuringu 与 Qian 发现,把多只股票共同训练并加入市场波动率特征,通常能改善样本外波动率预测;神经网络的优势主要出现在日内周期,而不是在所有期限上全面胜过线性模型。
来源¶
- Chao Zhang、Yihuang Zhang、Mihai Cucuringu、Zhongmin Qian
- Volatility Forecasting with Machine Learning and Intraday Commonality
- 版本:Journal of Financial Econometrics 22(2),2024,492–530;2023-03-20 advance access
- 期刊页面与 DOI
- arXiv 公开版本
- 本站状态:
evidence_status: read,未独立复现 - 内容有效性:
current;下次复核不晚于 2027-01-20
研究问题¶
传统波动率模型常为每只股票单独估计。若不同股票的日内波动率存在共同成分,能否通过跨股票训练、市场波动率特征和非线性模型,得到更好的样本外预测?
论文也追问两个更严格的问题:
- 训练好的关系能否迁移到未参与训练的股票?
- 过去的日内波动率是否比只使用过去日度波动率更有助于预测下一日?
数据与设计¶
作者使用 LOBSTER 的 Nasdaq ITCH 数据,以盘口中间价计算高频收益。初始样本为 S&P 500 中规模较大的 100 只股票,要求完整覆盖 2011-07-01 至 2021-06-30 后剩余 93 只。
预测对象包括 10 分钟、30 分钟、65 分钟和一日实现波动率。模型覆盖:
- SARIMA、HAR-D;
- OLS、LASSO;
- XGBoost;
- MLP 与 LSTM。
每类模型比较三种训练方式:
- Single:每只股票单独训练;
- Universal:把多只股票的数据合并训练;
- Augmented:在合并训练基础上加入市场实现波动率特征。
测试按时间滚动向前,最终样本外区间覆盖 2015 年 7 月至 2021 年 6 月。评价指标包括 MSE、QLIKE、模型置信集合与带风险厌恶假设的 realized utility。
作者报告的发现¶
- 对多数模型,加入市场波动率的 Augmented 设定比单只股票训练更稳健;
- 仅仅合并股票数据并不保证改善,Universal 对部分线性模型的收益很小;
- MLP 与 LSTM 在 10、30 和 65 分钟周期的统计误差与 realized utility 上表现突出;
- 在一日预测上,线性模型在主结果表中略优于神经网络,作者认为日频训练样本更少可能限制复杂模型;
- 把模型应用到未参与训练的股票后,神经网络在多个日内周期仍有竞争力;
- 使用过去日内 RV 预测下一日 RV 的 Intraday2Daily 设计优于多项只依赖过去日度 RV 的传统基准;
- 临近收盘的半小时波动率在下一日预测中获得较高权重。
如何解读¶
论文最有价值的结论不是“深度学习替代传统模型”,而是:
- 股票之间共享的波动率状态可以成为预测特征;
- 市场层特征和资产自身历史需要同时建模;
- 模型排名会随预测期限改变;
- 样本外时间切分、未见股票测试和经济评价缺一不可。
这也解释了为什么波动率预测应先定义标的、采样频率和期限,再讨论模型。一个模型在 30 分钟周期占优,不代表它在一日期权或事件窗口中同样占优。
局限与待核验¶
- 样本集中于美国大型、持续存在的股票,完整覆盖筛选可能带来选择偏差;
- LOBSTER 数据、盘口清洗和实现波动率定义会影响结果;
- 2011–2021 包含特殊市场制度,但仍不能代表所有资产和未来制度;
- 未见股票测试缓解了横截面过拟合担忧,却不等于跨市场或跨时代稳定;
- realized utility 建立在指定风险厌恶和仓位规则上,不是可直接交易的 P&L;
- 模型训练、数据采购、延迟和交易成本尚未进入实际部署比较;
- 本站尚未重建数据集、训练模型或复现表格。
与知识库的连接¶
研究边界
本文讨论的是指定数据和损失函数下的样本外预测结果。模型排名不是未来保证,也不构成投资建议。