# 量化 ML/DL 架构地图（dsh-ml · PCPT 知识层）

> 定位声明：本文公开**方法与知识**，不公开生产策略。PCPT（内部策略生产团队）
> 使用与本文同源的工程语言做更深的工作；dsh-quant 侧提供可手算、可测试的
> 最小框架（线性模型 / walk-forward / 因子评价），让任何 dsh 用户都能从
> 「数据 → 模型 → 样本外验证」走一遍完整流程。

## 1. 量化 ML 的研究管线架构

一切量化 ML 研究都收敛到同一条管线，每一环都可被上一环的泄漏污染：

```
数据获取 → 清洗/对齐 → 特征工程 → 标签构造 → 模型训练 → 样本外验证 → 风险/成本 → 执行
   ↑                                                    ↓
   └──────────── 数据质量与标注（dsh-data 提供工具） ←──┘
```

- **标签构造**：`features[t] 预测 returns[t+1]`——对齐必须显式，任何「用 t 期的
  信息解释 t 期收益」都是未来函数（look-ahead）。
- **验证与训练分离**：随机切分在时序数据上**不合法**（相邻样本自相关，随机
  切分会把未来信息泄漏进训练集）。金标准是 walk-forward（见 §3）。
- dsh-quant 对应工具：`quant_data_quality` → `quant_factor_evaluate` →
  `quant_factor_neutralize` → `quant_linear_model` / `quant_walk_forward` →
  `quant_metrics` / `quant_risk` → `quant_research_pipeline`。

## 2. 模型阶梯：从线性到强化学习

复杂度递增 = 拟合能力递增 = 过拟合风险递增 = 可解释性递减。**先证明线性
版本有效，再往上爬**——每一级都要用样本外证据证明「复杂度换来了增量」。

| 阶梯 | 典型用法 | 优势 | 代价 |
|---|---|---|---|
| **线性（OLS/Ridge）** | 因子合成、收益归因 | 可解释、可手算、参数少 | 只捕捉线性关系 |
| **逻辑回归** | 方向预测（涨/跌分类）| 概率输出、稳健 | 仍是线性决策面 |
| **树系（GBDT 等）** | 非线性交互、特征选择 | 交互/阈值自动 | 易过拟合、需强正则 |
| **深度学习（LSTM/Transformer）** | 序列模式、多资产联合建模 | 表达力强 | 数据饥渴、黑箱、调参重 |
| **强化学习** | 直接优化交易策略 | 端到端优化决策 | 非平稳、样本效率低、安全约束难 |

- dsh-quant 实现到**线性 + walk-forward**（可手算的诚实基线），并给出
  `quant_linear_model` 的 Ridge 正则化——正则化是爬更高阶梯前的必修课。
- 树/DL/RL 属 PCPT 内部生产范畴；本文给出问题形式化（§5），不给出实现。

## 3. 样本外验证金标准

- **Walk-forward（滚动前推）**：训练窗口只用过去，预测未来一段，窗口滚动
  前进。`quant_walk_forward` 实现：输出全样本外预测 + OOS IC/RankIC + 逐窗口
  权重（训练集拟合优度 trainR2 只是参考，OOS 才是证据）。
- **禁止随机 K 折**：时序数据 `t` 与 `t+1` 相关，随机切分 → 训练集含未来 →
  IC 虚高。若必须用 K 折，需要 Purged K-Fold（剔除训练/验证边界附近的样本）
  + Embargo（验证集后再隔一段）。
- **Deflated Sharpe（去膨胀夏普）**：试了 N 组参数/特征后，最大夏普会被
  「多次试验」抬高；显著性需按试验次数校正（Harvey & Liu）。规则化操作：
  参数网格搜索后看**收益面是否平滑**——最优参数是孤峰多半是过拟合。
- **样本内外衰减比**：样本内 IC 与 OOS IC 的比值。衰减超过 50% 要警惕；
  OOS IC 在 ±0.02 以下基本是噪声（单资产日频）。

## 4. 过拟合诊断清单

1. **参数平面平滑性**：grid search 的热力图应呈连续山丘；孤立的尖峰 = 过拟合
   （`quant_backtest_grid` 可用来画参数-收益面）。
2. **特征/样本比**：经验线「每特征 ≥ 30 样本」；特征越多越需要正则化
   （Ridge λ、树深度、dropout）。
3. **IC 衰减形状**：好因子 IC 随 horizon 平滑衰减（`icDecay`），尖峰单期
   衰减 = 脆弱。
4. **换手成本校验**：IC × 换手 × 单边成本 ≥ 阈值才可交易；高换手因子在
   加成本后常常归零（`quant_factor_evaluate` 的 turnover 字段）。
5. **防御性思维**：任何「看起来太好」的结果先怀疑泄漏（未来函数、幸存者
   偏差、复权错误），再怀疑过拟合，最后才相信信号。

## 5. 强化学习问题形式化（知识层）

量化 RL 的标准形式化（dsh-quant 不实现，供研究与讨论对齐语言）：

- **状态 S**：特征向量 + 当前持仓/组合权重 + 市场环境。
- **动作 A**：目标权重向量（连续）或调仓档位（离散）。
- **奖励 R**：组合收益 − 交易成本 − 风险惩罚（如波动率/回撤的负项）。
  奖励必须**净额**（扣成本），否则策略会过度交易。
- **环境**：历史行情回放（backtest 即环境）；非平稳性是核心难点——
  市场结构会漂移，训练/测试分布不一致。
- **评估与训练分离**：RL 的训练曲线在金融里几乎无意义；必须用独立的
  walk-forward 样本外区间评估，且要跑多次种子取分布而非单次最优。
- **为什么生产 RL 难**：样本效率低（一次交易一天）、探索代价高（真金白银）、
  安全约束硬（仓位/回撤上限）。这些正是 PCPT 内部工程要解决的问题——
  dsh-quant 提供「把 RL 决策接回回测/风控」的框架接口（`quant_execute_sim`、
  `quant_backtest_*` 的输出契约）。

## 6. 边界重申

- **公开**：方法、框架、demo、知识（本文 + `demos/ml-workflow.ts` +
  `quant_linear_model` + `quant_walk_forward`）。
- **内部**：生产策略、特征库、模型参数、RL 实现（PCPT）。
- 内外共用同一套域语言，互相学习：内部吸收开源验证方法论，外部共享
  「可复现的最小工作流」。
