第 5 课
不能保证未来,量化研究到底有什么用?
总结第一次完整实验,理解量化研究怎样帮助我们改进判断,而不是承诺未来收益。
2023 年的信封已经拆开了。
蛙兄把两段结果写进摘要,又认真检查了一遍:同一批公司、同一套分组、同一个收益算法,一个都没有偷偷换。
可他没有马上合上电脑。
“我们先提出假设,再固定规则;算完前两年,还特意留出 2023 年重新验证。”
蛙兄掰着手指数了一遍。
“最后还是不能说数字 8 有效,更不能说以后一定赚钱。”
他转头看向蛙博士。
“那我们忙了这么久,到底得到了什么?”
蛙博士笑了。
“你终于问到了这次研究最重要的问题。”
量化研究不是一台预测未来的许愿机。它的价值,是把模糊直觉变成可以检查的规则,再根据证据决定:这个想法应该停止、继续观察,还是进入下一轮研究。

先说清楚:我们还没有创造一套策略
我们一直在研究“股票代码里有没有 8”。
但严格说来,它还不是一套可以执行的交易策略。
因为我们没有规定:
- 什么时候买;
- 什么时候卖;
- 一次持有多久;
- 每家公司买多少;
- 交易成本怎样计算;
- 遇到大幅亏损怎么办。
我们只做了一件更靠前的事:把公司分成两组,看看某个特点是否伴随着收益差异。
如果差异稳定存在,它最多先成为一条值得继续研究的线索。等它拥有明确的买卖和持有规则以后,我们才能进一步讨论一套策略表现怎样。
所以,“数字 8 有没有分组价值”和“一套策略有没有效”,原本就不是同一道题。
三个听起来相似,其实完全不同的问题
蛙博士在白板上写下三句话:
- 它为什么会带来收益?
- 它能不能帮助我们预测?
- 它能不能保证未来赚钱?
“这不都是在问它有没有用吗?”蛙兄说。
“听起来像,研究时却不能混在一起。”
第一件事:解释为什么会发生
这个问题在寻找原因。
例如,我们认为某个行业的需求增长、公司的盈利改善,最终可能影响市场预期和股价。研究者会继续检查这条因果路径是否说得通。
对数字 8,我们已经知道答案:虚构代码是随机生成的,与收益没有关系。字符 8 并没有一条能够推动价格的通道。
第二件事:寻找可以重复的预测信息
这个问题暂时不要求我们解释所有原因,它先问:某个提前定义好的规律,能不能在没有参与前期研究的数据里继续提供有用的区分?
有时,我们可能先发现一种稳定现象,后来才慢慢弄清它为什么出现。
就像乌云可以帮助我们判断可能要下雨,但不是乌云伸手把雨滴按下来的。预测线索与完整的原因解释有关,却不是同一个东西。
缺少合理解释时,我们应该更加谨慎,要求更稳定、更广泛的证据;但不能因为暂时讲不全原因,就说所有预测研究都没有价值。
第三件事:保证下一次一定赚钱
这一件事,量化研究做不到。
市场会变化,参与者会学习,原本存在的规律可能变弱,新的政策和事件也可能改变环境。即使过去多次有效,下一次仍然可能失败。
所以,三件事的关系不是“只要做了量化,它们就会一起成立”。
| 我们在问什么 | 量化研究可以怎样帮助 | 它不能替我们做什么 |
|---|---|---|
| 为什么会发生 | 检查解释是否符合数据,寻找可能的作用路径 | 只凭一张收益表证明因果 |
| 能不能帮助预测 | 查看规律能否在未参与前期分析的数据中重复 | 把一次漂亮结果直接写成稳定规律 |
| 能不能保证未来 | 描述风险、失败情况和证据边界 | 保证下一次一定成功或赚钱 |
实际研究中,量化方法主要帮助我们积累第二类证据:一个规律能不能在没参与前期分析的数据里继续提供有用信息。数据也可能为第一类问题提供线索,但不会自动证明原因;至于第三件事,它从来不在量化研究的承诺里。

量化研究不是盖章,而是在积累证据
现在换一个更接近市场研究的假设:某种信号在连续下跌后出现,出现以后的一段时间里,价格可能更容易反弹。
研究者在看结果以前就定义好信号、观察时间和比较方法。它在研究期跑出了优势,在真正没有参与前期分析的验证期里,方向和幅度又比较稳定地重复了。
我们应该怎么说?
不能说:
已经永久证明这个规律有效,以后一定赚钱。
但也不应该说:
反正未来无法保证,所以这些结果什么都说明不了。
更合适的表达是:
这个规律在两个预先划分的历史时期中都出现了相对稳定的优势,现有证据比只看研究期时更强,值得进入下一轮检查。
留出验证的意义就在这里。
如果结果没有重复,我们会降低信心;如果比较稳定地重复,我们会提高信心;如果像数字 8 一样给出混合结果,我们就保留分歧,不强行安排输赢。
量化研究不负责让我们从“不知道”瞬间跳到“绝对正确”。
它负责让信心随着证据变化。
一条线索,可以站在不同的证据台阶上
蛙博士画了一段没有终点奖杯的台阶。
第一阶,是一句直觉:
我感觉这个现象可能和收益有关。
第二阶,是把直觉变成固定规则,并在研究期看到差异。
第三阶,是不修改规则,让未参与前期分析的数据重新检查一次。
再往后,研究者可能继续观察:
- 换一些时期,结果是否仍然存在;
- 换一批合理样本,结果是否过度依赖少数对象;
- 优势是否大到足以覆盖交易成本;
- 收益背后承担了多大风险;
- 市场环境改变后,规律是否还在。
走得越远,证据通常越丰富,但没有哪一级会突然变成“未来必胜证书”。
而且,并不是每个想法都值得爬完整段台阶。
如果前面已经出现明显反对证据,或者我们知道它背后的关系本来就是随机的,及时停下来反而更合理。

如果研究期和验证期都跑出优势呢
这正是最容易让人走向两个极端的地方。
一种极端是:
两段都赢了,已经证明有效。
另一种极端是:
未来仍不确定,所以两段结果没有意义。
两种说法都太满。
如果规则是在看结果以前固定的,验证数据也确实没有参与前期调整,并且优势在两段时期中表现得比较稳定,那么它当然获得了比第一次结果更强的预测证据。
这不是“什么都没得到”。
它意味着这个想法值得花更多时间,继续检查不同环境、风险、成本,以及怎样变成可以执行的规则。
这里的“有效”也不能孤零零地写在空中。我们至少要继续追问:在哪个市场、哪段时期、哪套规则和哪种比较口径下有效?如果以后变成交易策略,还要问考虑成本和风险以后是否仍有价值。
条件说得越清楚,“有效”这两个字才越接近一条可以检查的研究结论。
但我们仍然只对已经看到的证据负责。市场下一次会怎样,没有人能提前替它签字。
数字 8 现在站在哪里
把刚才的台阶放回这次实验:
- 我们提出了一个明确假设;
- 在看结果以前固定了分组、时期和指标;
- 研究期出现了一些描述性差异;
- 留出期给出了部分重复、部分不重复的混合结果;
- 我们知道虚构代码随机生成,并且与收益无关。
因此,最合理的选择不是把它升级成选股规律,也不是再换几个口径帮它寻找胜利。
我们可以停止把字符 8 当作收益线索。
“所以,这次研究失败了?”蛙兄问。
“这个假设没有获得继续前进的理由。”蛙博士说,“但研究没有失败。”
它帮我们尽早发现一条路不值得继续走,避免投入更多时间,甚至避免把偶然结果带进真实决策。
排除一个缺乏价值的想法,本身就是研究成果。
可以用一句话概括:
数字
8可以下课,但这套研究方法要留下。
研究结束时,不只有“成功”和“失败”两个按钮
一轮研究结束以后,我们通常有不止两个选择:
- 停止研究:证据明显不足,或已经知道关键关系来自随机巧合;
- 继续观察:证据有一点支持,但还不稳定,暂时不急着扩大结论;
- 重新提出假设:发现原问题太含糊或逻辑需要调整,于是把新问题当作一次新研究,而不是偷偷修改旧实验;
- 进入更完整的回测:规律在未参与前期分析的数据中仍有较稳定的表现,值得继续检查时间、风险和执行规则。
这四个方向没有统一答案。
AI 可以帮助我们整理证据和发现遗漏,但最后选择哪条路,需要由人根据研究目标和证据边界来确认。
你可以把这次研究材料交给 AI,请它帮你完成最后一次回看:
和 Codex 一起判断研究去向
请读取当前虚构股票代码研究的实验约定、原研究摘要和留出验证摘要,不要重新计算,不要修改规则,也不要增加新的分析。
请用大白话分别回答:
- 当前数据已经确认了哪些历史事实;
- 它是否提供了稳定的预测证据;
- 它是否能够证明字符
8造成了收益差异; - 它是否能够保证未来表现;
- 结合“虚构代码随机生成且与收益无关”这个已知前提,这条线索更适合停止、继续观察、重新提出假设,还是进入更完整的回测。
请说明理由,并明确区分“停止研究数字 8”和“否定量化研究方法”。先向我汇报,不要创建新程序或修改现有文件。
这里的正确答案不是由 AI 替你按下按钮。
更重要的是,你能不能检查它的理由是否与现有证据一致。
确认 AI 的建议和理由都没有越过证据以后,最后一步由你来拍板,再让它把决定写回摘要:
把最终决定留下
我确认这条线索的研究去向是:停止把数字 8 当作收益线索,保留本次研究方法。
请把这项最终决定和理由追加到现有研究摘要结尾。理由要同时说明:原研究期与验证期得到的是混合结果;虚构代码随机生成并且与收益无关;停止这条线索不等于否定量化研究。不要重新计算、修改原有结果或创建新分析。完成后告诉我你修改了哪个文件,以及新增内容所在的位置。
我们到底带走了什么
完成这一步后,蛙兄看着研究摘要最后多出的那行字:
停止把数字
8当作收益线索,保留本次研究方法。
然后,他终于合上了电脑。
“我好像明白了。”
“量化研究不是每次都要找出一个能赚钱的答案。”
“它先让我把问题说清楚,再用数据决定自己应该更相信一点,还是少相信一点。”
蛙博士点点头。
“有时候,最值钱的结果就是及时知道不该继续。”
这一次,我们从一个不会随时间改变的代码字符出发,完整走过了第一轮研究:
提出假设
→ 固定规则
→ 数据验证
→ 查看结果
→ 质疑结果
→ 用未参与前期分析的数据再验证
→ 写下暂时结论
→ 判断下一步
接下来,问题会向前走一步。
我们不再研究代码里有没有某个字符,而会观察一种可能在特定交易日出现、又会随时间消失的市场信号。
它会带来新的难题:信号在哪一天出现?出现以后看多远?什么才算表现更好?
不过,我们已经有了一件可以重复使用的工具。
不是某段程序,而是面对一个新想法时,知道怎样让证据开口,也知道证据应该说到哪里停下。
量化研究不能替未来作保证,但它能用可以检查的证据,帮我们决定一个想法值得继续、修改,还是停止。
课后讨论
留下你的问题、理解或不同意见,也看看其他学习者怎么想。