数据与特征(17)
数据获取 7 + 特征工程 10:取数、造 bar、数据校验、triple-barrier 标签、特征选择。
Machine Learning for Trading / Architecture
第 3 版不再按「技术逐个讲」,而是围绕一条端到端工作流:研究想法 → 数据 → 特征 → 模型 → 策略 → 部署,并划出一条「证据边界」把调参与评估分开,配一个重训/暂停/退役的反馈环。
以下章节标题与范围来自官方 README(2026-08 核验)。
| 部分 | 章节范围 | 主题 | 关键内容 |
|---|---|---|---|
| 引言 | Ch1 | The Process Is Your Edge | 流程纪律胜过模型复杂度;证据边界 |
| Part I 金融数据 | Ch2-5 | 市场微观结构 / 基本面与另类 / 合成数据 | ITCH 解析、点内时间基本面、TimeGAN/Tail-GAN 合成数据 |
| Part II 研究设计 | Ch6-10 | 策略框架 / 学习任务 / 特征工程 / 文本特征 | 标签工程、triple-barrier、信息系数、FinBERT 情感 |
| Part III 模型开发 | Ch11-15 | ML Pipeline / 提升 / 深度时序 / 潜因子 / 因果 | Ridge 基线、XGBoost/LightGBM、PatchTST、Double ML |
| Part IV 策略实现 | Ch16-20 | 回测 / 组合 / 成本 / 风险 / 综合 | 回测即证伪、HRP、Almgren-Chriss、VaR/CVaR、kill switch |
| Part V 高级 AI | Ch21-24 | 强化学习 / RAG / 知识图谱 / 自主 Agent | DQN/PPO/SAC 执行与对冲、Graph RAG、多智能体研究 |
| Part VI 生产 | Ch25-26 | 实盘交易 / MLOps 治理 | IB/Alpaca/QuantConnect、漂移检测、特征存储 |
| 结语 | Ch27 | The Systematic Edge | 系统化哲学与职业路径 |
每章 notebook 构建在这 6 个库之上,每个库对应工作流的一个阶段,可单独使用。
| 库 | 阶段 | 作用 |
|---|---|---|
| ml4t-data | Data | 19+ 数据源统一接口的市场数据获取 |
| ml4t-engineer | Signal | 特征、标签、替代 bar 与防泄漏数据集准备 |
| ml4t-models | Models | 金融原生潜因子、SDF、直接预测与组合学习 |
| ml4t-diagnostic | Evaluation | 特征验证、策略诊断、Deflated Sharpe Ratio |
| ml4t-backtest | Strategy | 带真实执行的 event-driven 回测 |
| ml4t-live | Deployment | 带券商集成的生产交易 |
把上面的部分串起来,就是一条从想法到实盘的研究-生产管线。
明确 universe、决策频率、成本模型、评估协议与运行日志(Ch6)。
用 ml4t-data 取数,ml4t-engineer 做特征与标签,走 Polars 列式处理(Ch2-10)。
从线性基线到 GBDT/深度时序/因果,用 ml4t-models 与 walk-forward CV(Ch11-15)。
ml4t-backtest 回测,加组合、成本、风险 overlay 与 ml4t-diagnostic 诊断(Ch16-20)。
ml4t-live 接券商,配合 MLOps 漂移检测、安全上线与熔断(Ch25-26)。
官网还提供免费的概念解释(primer)与可复用编码任务(agent skills),按工作流阶段分类——这些是「具体有多少、各是什么」的清单,不是泛泛的介绍。
| Primer 分类 | 数量 | 代表主题 |
|---|---|---|
| Foundations | 8 | 限价订单簿、双时态数据模型、仿真器需复现的 stylized facts |
| 研究与特征工程 | 21 | 因子多重检验、分数差分、金融序列 path signature |
| 模型开发 | 22 | 正则化几何、金融共形预测、Double ML 机制 |
| 策略实现 | 27 | Deflated Sharpe Ratio、分层风险平价、Almgren-Chriss |
| 高级 AI | 8 | 马尔可夫决策过程、策略梯度定理、事件预测评分 |
| 生产 | 2 | champion-challenger、特征存储训练-服务偏移 |
| 跨领域概念 | 24 | 动量与均值回归、偏差-方差权衡、walk-forward |
每个 skill 内置防未来函数(lookahead bias)、防数据泄漏与防多重检验的护栏,供编码 agent 直接复用。
数据获取 7 + 特征工程 10:取数、造 bar、数据校验、triple-barrier 标签、特征选择。
评估验证 8 + 回测 5:walk-forward CV、purging-and-embargo、Deflated Sharpe、成本模型、tear sheet。
组合 5 + 基础设施 4 + 工作流 5 + 生产 2 + 高级 AI 5 + 概念 10:仓位、风险指标、kill switch、实盘与监控。
官方把「探索(调参)」与「确认(评估)」用一条证据边界分开,配合 walk-forward 交叉验证,避免用同一份数据既调参又评估导致的过拟合。
官方建议先读 docs/what-this-is.md、installation.md、running-notebooks.md 三个入门文档,再按六大部分推进;每个案例贯穿 Ch6-Ch20,可按案例主题跳读。
能。每个库文档独立、可单独 pip 使用,对应工作流一个阶段,例如 ml4t-backtest 可单独做事件驱动回测。
第 3 版从 Pandas 迁到 Polars 以获得快速、基于表达式的操作;存储基准覆盖 Parquet、DuckDB、kdb+、TimescaleDB。
它是新增内容,跨越整个工作流:强化学习用于执行/对冲、RAG 与知识图谱用于研究、自主 Agent 用于多智能体研究,是传统模型的延伸而非替代。