独立完成一项研究
核心问题能不能独立完成一项不骗自己的机器学习量化研究?下一步学什么?
第五单元 · 第 1 / 1 节15
视频
待发布
预计 2026-10-22 17:30(北京时间)发布,以实际公开时间为准。
视频发布后会嵌入在这里,并加入 Bilibili 合集“量化与机器学习入门”。 预计时长约 8 分钟。
学习目标
- 看一个新信号怎样从头走完 信号 → 模型 → 组合 → 报告。
- 把前四个单元的方法串成一条完整的流程。
- 知道入门之后的方向。
让 AI 带你做模拟数据
把下面的提示词整段复制给任意一个 AI 助手。它会先生成一份模拟的股票月度数据(设定对每一节都一样),再带你把这一节的分析做一遍。数据是模拟的,具体数字会和视频不同,但应该看到同样的规律。
任务(第 15 节):从头到尾走一遍一项小研究。先定规矩,再看结果。
1. 先定下规矩,并记下来:新因子 dprof = prof − 12 个月前的 prof;只看第 60 个月以后;结果只算一次;看到结果以后不改定义。
2. 算 dprof 的每月 IC、平均 IC 和 t 值,画出累计 IC;再把第 60–125 个月和第 126–191 个月分开,各算一个 t 值。
3. 算 dprof 和 prof 的相关系数。每个月把 dprof 对五个特征做回归、取残差,再算残差的平均 IC 和 t 值。
4. 把 dprof 当成第六个特征,加进第 11 节的岭回归,比较加入前后的平均 IC 和“每月买前 50 只”的年化收益。
5. 按第 14 节的样子,写一句结论。提示词开头的模拟数据设定
请用 Python(numpy、pandas,需要时用 scikit-learn)带我做一个量化入门练习。先生成一份模拟的股票月度数据,随机种子用 42:
1. 300 只股票,192 个月(月份编号 0–191,相当于 16 年)。
2. 每只股票有一个固定的波动 sigma,从 0.05 到 0.13 均匀抽取;它的 beta = 0.5 + 5 × sigma。
3. 每个月有五个特征:mom(动量)、val(估值,越大越便宜)、size(规模)、lowvol(低波动)、prof(盈利)。
- mom、val、size、prof:第 0 个月取标准正态;之后每个月,新值 = 0.9 × 上月值 + 0.44 × 标准正态。
- lowvol = −sigma + 0.02 × 标准正态。
- 每个月把五个特征各自在 300 只股票之间标准化(减平均、除以标准差)。
4. 每个月抽一个下个月的大盘收益 mkt_next ~ 正态(0.005, 0.05);再给五个特征各抽一个当月系数 = 基础系数 + 0.01 × 标准正态,基础系数依次是 0.004、0.003、0、0.005、0.002。
5. 下个月收益 ret_next = beta × mkt_next + Σ(当月系数 × 特征) + sigma × 标准正态。
6. 整理成一张长表:每行是一只股票的一个月,列为 month、stock、sigma、五个特征、mkt_next、ret_next。打印前几行和总行数。
后面统一的口径:
- IC:每个月,某一列和 ret_next 在 300 只股票之间的 Spearman 秩相关。
- 年化收益:把每月收益连乘,再按 12 / 月数 开方后减 1。
- 等权基准:每个月 300 只股票 ret_next 的平均。
- 第 m 个月这一行的特征在第 m 个月月底已知,标签 ret_next 是第 m+1 个月的收益。训练模型时,在第 s 个月月底打分,训练只用月份 ≤ s−2 的行(中间隔开一个月)。
接下来按我的要求一步一步做。每一步先用一两句话说明在做什么,再给代码和结果。应该看到
- dprof 单独看有一点点 IC(平均大约 0 到 0.02),t 值有时能超过 2,前后两段也不一定一致。
- 它和 prof 的相关系数大约 0.6。去掉五个已有特征的影响以后,剩下的 IC 接近 0,t 值不到 2。
- 加进岭回归以后,平均 IC 几乎不变(差别在 0.001 以内)。
- 诚实的结论是:dprof 没有提供新的信息,不采用。
对不上的时候,把你的结果和这几条一起发给 AI,让它解释是哪一步出了问题。
自测
一个新因子没通过事先写好的检验。接下来最好怎么做?
- A. 换个定义,一直改到好看为止
- B. 只看它表现好的那几年
- C. 写下结论,不采用;想试新定义,就当成新想法,定新的规矩,用新的数据检验
- D. 先放进实盘试试
看答案
答案 C。看过结果再改,就是第 06 节那种“挑出来的好结果”。
一个新因子单独看 t 值超过 2,可它和已有的因子很像,加进模型以后 IC 几乎不变。该怎么理解?
- A. 它没有带来新信息,它的那点效果,已有的因子早就有了
- B. 它是一个很强的新因子
- C. 模型出错了
- D. 应该把已有的因子删掉
看答案
答案 A。新因子要看它能补充什么,不能只看它单独的成绩。
学完这门课,机器学习量化的核心是什么?
- A. 找到一个一定赚钱的公式
- B. 用最复杂的模型
- C. 收集尽可能多的特征
- D. 建立一套不会骗自己的流程
看答案
答案 D。先定规矩、按时间验证、扣掉成本、选好基准、写清假设。
常见坑
- 前面所有单元的坑都会再出现一次,自检清单就是为此准备的