系统的「数据底座」—— Alpha 的源头 · 多源接入 · 严格清洗 · 因子库构建
股票的数据维度比加密货币更丰富。除了基础的行情数据,基本面和另类数据才是获取超额收益(Alpha)的关键。数据的广度、质量与新鲜度,直接决定了模型的上限——「垃圾进、垃圾出」,没有干净的数据底座,再强的策略也无从谈起。
行情、基本面、另类数据多源融合,喂给模型一幅更完整的市场图景。
历史数据必须严格清洗,否则模型学到的是「幻觉」而非真实规律。
分红送股会造成价格跳空,严格前复权还原真实收益,避免「假暴跌 / 假暴涨」。
剔除退市风险警示(ST / *ST)标的,防止退市、壳炒作污染样本。
剔除上市不足 60 天的新股与流动性差的标的,规避上市初期异常波动。
从原始数据中提取可解释、可复用的特征因子,并持续评估其有效性。
| 因子 | 类别 | IC 均值 | IC_IR | 有效性 |
|---|---|---|---|---|
| 20 日动量 | 动量 | 0.042 | 0.68 | ● 有效 |
| 60 日波动率 | 波动率 | -0.031 | 0.55 | ● 有效(低波) |
| 主力净流入占比 | 资金流向 | 0.026 | 0.41 | ● 有效 |
| PE 分位 | 估值 | -0.018 | 0.33 | ● 中性 |
| ROE 质量 | 质量 | 0.019 | 0.29 | ● 中性 |
| 龙虎榜席位信号 | 另类 | 0.009 | 0.14 | ● 衰减待迭代 |