Machine Learning for Trading / Architecture

Machine Learning for Trading 架构:27 章 6 部分的完整工作流

第 3 版不再按「技术逐个讲」,而是围绕一条端到端工作流:研究想法 → 数据 → 特征 → 模型 → 策略 → 部署,并划出一条「证据边界」把调参与评估分开,配一个重训/暂停/退役的反馈环。

结构:27 章 / 6 部分配套:6 个生产库数据层:Polars
Ch2-5 数据金融数据宇宙
Ch6-10 特征研究与特征工程
Ch11-15 模型模型开发
Ch16-20 策略回测/组合/风险
Ch21-24 高级AIRL/RAG/KG/Agent
Ch25-26 生产实盘/MLOps
ML4T 六大部分章节范围示意(基于官方 README 目录);示意非官方图。
Parts

六大部分章节清单

以下章节标题与范围来自官方 README(2026-08 核验)。

部分章节范围主题关键内容
引言Ch1The Process Is Your Edge流程纪律胜过模型复杂度;证据边界
Part I 金融数据Ch2-5市场微观结构 / 基本面与另类 / 合成数据ITCH 解析、点内时间基本面、TimeGAN/Tail-GAN 合成数据
Part II 研究设计Ch6-10策略框架 / 学习任务 / 特征工程 / 文本特征标签工程、triple-barrier、信息系数、FinBERT 情感
Part III 模型开发Ch11-15ML Pipeline / 提升 / 深度时序 / 潜因子 / 因果Ridge 基线、XGBoost/LightGBM、PatchTST、Double ML
Part IV 策略实现Ch16-20回测 / 组合 / 成本 / 风险 / 综合回测即证伪、HRP、Almgren-Chriss、VaR/CVaR、kill switch
Part V 高级 AICh21-24强化学习 / RAG / 知识图谱 / 自主 AgentDQN/PPO/SAC 执行与对冲、Graph RAG、多智能体研究
Part VI 生产Ch25-26实盘交易 / MLOps 治理IB/Alpaca/QuantConnect、漂移检测、特征存储
结语Ch27The Systematic Edge系统化哲学与职业路径
Libraries

6 个生产级 Python 库

每章 notebook 构建在这 6 个库之上,每个库对应工作流的一个阶段,可单独使用。

阶段作用
ml4t-dataData19+ 数据源统一接口的市场数据获取
ml4t-engineerSignal特征、标签、替代 bar 与防泄漏数据集准备
ml4t-modelsModels金融原生潜因子、SDF、直接预测与组合学习
ml4t-diagnosticEvaluation特征验证、策略诊断、Deflated Sharpe Ratio
ml4t-backtestStrategy带真实执行的 event-driven 回测
ml4t-liveDeployment带券商集成的生产交易
Workflow

端到端工作流怎么走

把上面的部分串起来,就是一条从想法到实盘的研究-生产管线。

  1. 定义研究想法与规则

    明确 universe、决策频率、成本模型、评估协议与运行日志(Ch6)。

  2. 准备数据与特征

    用 ml4t-data 取数,ml4t-engineer 做特征与标签,走 Polars 列式处理(Ch2-10)。

  3. 训练与选择模型

    从线性基线到 GBDT/深度时序/因果,用 ml4t-models 与 walk-forward CV(Ch11-15)。

  4. 回测与风险叠加

    ml4t-backtest 回测,加组合、成本、风险 overlay 与 ml4t-diagnostic 诊断(Ch16-20)。

  5. 部署与监控

    ml4t-live 接券商,配合 MLOps 漂移检测、安全上线与熔断(Ch25-26)。

说明:以上为仓库依据的工作流示意,用于理解各阶段职责;不包含未验证的第三方集成或性能承诺,回测结果不构成收益保证。
Companion resources

配套资源:112 个 primer + 61 个 agent skills

官网还提供免费的概念解释(primer)与可复用编码任务(agent skills),按工作流阶段分类——这些是「具体有多少、各是什么」的清单,不是泛泛的介绍。

Primer 分类数量代表主题
Foundations8限价订单簿、双时态数据模型、仿真器需复现的 stylized facts
研究与特征工程21因子多重检验、分数差分、金融序列 path signature
模型开发22正则化几何、金融共形预测、Double ML 机制
策略实现27Deflated Sharpe Ratio、分层风险平价、Almgren-Chriss
高级 AI8马尔可夫决策过程、策略梯度定理、事件预测评分
生产2champion-challenger、特征存储训练-服务偏移
跨领域概念24动量与均值回归、偏差-方差权衡、walk-forward
Agent skills & case-study reading

61 个 agent skills:把工作流拆成带护栏的任务

每个 skill 内置防未来函数(lookahead bias)、防数据泄漏与防多重检验的护栏,供编码 agent 直接复用。

数据与特征(17)

数据获取 7 + 特征工程 10:取数、造 bar、数据校验、triple-barrier 标签、特征选择。

评估与回测(13)

评估验证 8 + 回测 5:walk-forward CV、purging-and-embargo、Deflated Sharpe、成本模型、tear sheet。

组合与生产(31)

组合 5 + 基础设施 4 + 工作流 5 + 生产 2 + 高级 AI 5 + 概念 10:仓位、风险指标、kill switch、实盘与监控。

案例化阅读法:不要按「随机森林介绍」读,而要按「Ch12 梯度提升 → 用 GBDT 生成交易信号(多数案例最强表格模型)」「Ch21 强化学习 → 用 DQN/PPO 做最优执行与深度对冲」读;每个章节都对应一个可落地的交易任务。
FAQ

常见问题

ML4T 的「证据边界」是什么意思?

官方把「探索(调参)」与「确认(评估)」用一条证据边界分开,配合 walk-forward 交叉验证,避免用同一份数据既调参又评估导致的过拟合。

27 章必须按顺序读吗?

官方建议先读 docs/what-this-is.md、installation.md、running-notebooks.md 三个入门文档,再按六大部分推进;每个案例贯穿 Ch6-Ch20,可按案例主题跳读。

6 个库能脱离书单独用吗?

能。每个库文档独立、可单独 pip 使用,对应工作流一个阶段,例如 ml4t-backtest 可单独做事件驱动回测。

数据层为什么用 Polars?

第 3 版从 Pandas 迁到 Polars 以获得快速、基于表达式的操作;存储基准覆盖 Parquet、DuckDB、kdb+、TimescaleDB。

高级 AI 部分和传统模型是什么关系?

它是新增内容,跨越整个工作流:强化学习用于执行/对冲、RAG 与知识图谱用于研究、自主 Agent 用于多智能体研究,是传统模型的延伸而非替代。

理解架构后怎么继续?

想实际跑起来,先看安装与首次运行;想深入某阶段,看模型、数据与策略页。