HoppyQuant

第 8 课

这么多路线,这门课准备带你走哪一条?

组装课程采用的假设驱动、可解释、基于日频数据的实证研究路线,并说明两个实战案例的分工。

这几章学下来,蛙兄的桌上已经摆了不少研究零件:

假设
数据定义
指标
候选信号
规则
回测

每一个词单独拿出来,他好像都认识。

可真要开始研究,它们该怎样接在一起?

蛙兄又想起那张量化地图,索性继续往清单上加:

高频交易
统计套利
机器学习
新闻情绪模型
自动交易系统
复杂数学公式

清单越写越长,他又开始没底。

“这些是不是都学完了,我才有资格开始第一个实验?”

蛙博士看了看清单,问:“你准备先查清哪个问题?”

蛙兄愣了一下。

零件和工具摆了一桌,他却还没有把它们装成一条可以走的路。

蛙博士拿起橡皮,把清单暂时擦到只剩三样东西:

一个说得清的问题
一份能够检查它的数据
一把前后一致的尺子

“先用这三样走完一趟,”他说,“其他装备以后再加,也来得及。”

蛙兄准备了高频、套利、机器学习和自动交易等全套学习清单,蛙博士把桌面清到只剩问题、数据和统一尺子。
图 1|课程不会从最复杂的工具开始,而会从一个能够查清楚的问题开始。

现在,把学过的零件装起来

前面学过的假设、定义、指标、信号、规则和回测,在这门课程里会被装成同一条路线。

用一句稍微正式的话概括,就是:

假设驱动、可解释、基于日频数据的实证量化研究。

听起来有点长。

拆开以后,其实还是我们已经见过的普通话。这里要做的,只是确认每个零件会被装在什么位置。

假设驱动:先有问题,再找证据

我们的研究先从一句真实想法出发,而不是拿来一百个指标,只留下碰巧涨得最好的一组:

  • 股票名字里带有吉利数字,后来的表现会不会不一样?
  • 神奇九转的下行信号完成后,价格是不是更容易反弹?
  • 某个信号出现时,成交量状态会不会让结果发生变化?

这些想法可以来自生活直觉、市场上流传的说法,也可以来自一条比较完整的经济或行为解释。

起点不一定高深。

底线是:它最终能够被说清楚、写成规则,也允许数据回答“不是这样”。

可解释:每一步都能回头检查

这里的“可解释”不要求每个想法都先写出一套经济学理论。

“九转之后可能反弹”本来就是一种市场说法。如果我们还不知道它为什么可能成立,就应该老实承认,不用临时编一条因果故事给它穿西装。

我们真正要求的是:

  • 为什么研究这个问题;
  • 每个词被定义成了什么;
  • 使用了哪些数据;
  • 怎样比较;
  • 哪个结果会让我们修改或放弃原想法。

如果程序给出一张漂亮图,我们还能够顺着这些记录回去,看看漂亮究竟从哪里来。

日频实证研究:用每天留下的记录实际检查

第一期课程主要使用 A 股个股和指数的日频数据。

一天一条价格、成交量和其他可用记录,不做微秒级交易,也不处理高频订单簿。

“实证”也没有那么吓人:除了讨论一件事听起来有没有道理,我们还会拿真实记录检查它在历史样本里发生了什么。

这条路会经过哪些地方?

一项研究要从“我觉得”走到收益曲线,中间会依次经过这些地方:

提出市场想法
→ 说清楚模糊词
→ 写成允许被反对的假设
→ 建立可计算定义
→ 检查数据
→ 判断是否出现弱规律
→ 形成最小买卖规则
→ 完成研究级回测
→ 写下当前结论和限制

有些研究会在半路停下。

假设说不清,可以停;数据不够,可以停;结果不支持,也可以停。

一条路线允许研究失败,才真的允许证据参与。

市场想法经过澄清、假设、计算定义、数据检查、弱规律、最小规则、研究级回测和结论等检查站。
图 2|课程选择的研究路线,会让市场想法依次经过一组可以复查的检查站。

第一次实验,先研究一个不会吓跑人的问题

我们的第一个实战问题是:

股票名字里带有吉利数字,后来的表现会不会与其他股票不同?

它听起来有点像午休时的闲聊。

这正是它适合当第一个实验的原因。

读者不需要先懂复杂金融理论,就能参与定义:什么算吉利数字,使用哪个时期的股票名称,观察未来多久,又应该和谁比较。

这项研究主要把股票分成几组,再比较各组后来的表现。

它属于静态特征的分组研究

我们通过它练习下面这些基本动作,而不是如何凭股票名字赚钱:

  • 在看结果前固定定义;
  • 检查每组有多少样本;
  • 使用同一口径计算结果;
  • 选择比较对象;
  • 接受“没有明显差别”也是完整结论。

第二次实验,让一个信号在时间里出现

接下来,问题会变成:

神奇九转的下行信号完成后,接下来一段时间是不是更容易反弹?

这次不能只把股票分成两堆。

我们要先说明哪个版本的九转,哪一天算信号完成,从哪一天开始观察,观察几个交易日,以及连续或重叠信号怎样处理。

信号会在不同股票、不同日期陆续出现。

我们把每次信号发生的日期对齐,再观察它们后来怎样变化。

这种做法可以叫作基于技术信号的事件研究

它首先回答的是:

这个信号发生以后,历史上通常出现了什么?

它还没有回答:

现在是否应该买?
应该买多少?
什么时候卖?

事件之后出现统计差异,不等于一套策略已经诞生。

幸运数字案例训练静态分组研究,神奇九转案例训练技术信号事件研究,两者一起为后面的规则回测铺路。
图 3|两个实战案例分别练习静态分组与信号事件研究,并共同走向规则回测。

然后才轮到 MACD、市值和成交量

假设九转信号之后出现了一点值得继续检查的差异。

蛙兄很可能会问:

“是不是所有九转信号都一样?如果当时的 MACD 状态不同、公司大小不同、成交活跃程度不同,结果会不会也不同?”

这个问题合理。

但我们不能把参与计算的所有数字都叫作“因子”。

假设跳泡可乐某天刚刚完成一个九转下行信号:

  • 九转完成负责指出事件或候选信号出现了;
  • MACD是根据价格计算出的技术指标,可以被进一步写成一个候选条件;
  • 市值是公司在当时的一项可记录特征,可以用于分组或筛选;
  • 成交量是原始市场记录,相对成交量或换手率才是进一步整理出的指标;
  • 未来五天、十天或二十天是观察窗口或参数,不是因子;
  • 沪深300是一个可能的比较基准,也不是因子。

它们都可能出现在同一项研究里,但干的是不同工作。

把名字分清,不是咬文嚼字。

如果一个时间窗口被误叫成因子,读者就很容易以为不断试三天、五天、十天、二十天是在发现新规律。其实,他可能只是在同一份历史数据里挑最好看的答案。

同一项跳泡可乐研究里,九转信号、MACD、市值、成交量、观察窗口和沪深 300 各自承担不同职责。
图 4|同一项研究里的信号、指标、变量、窗口和基准,各自回答不同问题。

我们检查的是“有没有新增信息”

加入一个候选条件,是为了回答:

知道这个条件以后,是否比只知道九转信号多得到了一点信息?

例如,只看九转信号时,结果可能很混乱。

再区分不同成交量状态以后,某一组的表现似乎更集中。这时也不能立刻宣布“成交量因子找到了买点”。

还要继续检查:

  • 每一组是不是只剩很少样本;
  • 换一段时间以后差异还在不在;
  • 换一批股票以后是否完全消失;
  • 这个条件是不是看完结果才临时想到的;
  • 它有没有一个说得过去的解释,或者至少明确的研究理由。

课程要训练的是逐项检查候选条件能否带来增量信息,而不是让 AI 一口气试几百种组合,再把历史上最好看的一组端回来。

弱规律怎样走到回测?

事件研究如果留下一个值得继续调查的弱规律,下一步才是补齐规则。

例如:

  • 哪个条件满足时,才产生候选买入信号;
  • 使用哪一天可以实际得到的价格进入;
  • 固定持有,还是满足另一个条件退出;
  • 同一只股票连续出现信号怎样处理;
  • 停牌、涨跌停和缺失数据怎样处理;
  • 使用什么统一仓位假设;
  • 手续费和滑点怎样记录。

这些内容写清以后,我们才拥有一套可以在历史中模拟的最小策略

这一步属于规则驱动的系统化回测。

它与前面的事件研究是前后两站,不是同一件事。

跑赢沪深300,能说明什么?

只看策略自己赚了多少,很容易误会。

假设一套虚构规则在某段时间上涨了 4%。

如果同期沪深300上涨了 6%,它其实落后基准 2 个百分点。

如果同期沪深300下跌了 1%,它则比基准多了 5 个百分点。

把策略收益减去基准收益,得到的是相对这个基准的超额收益

这把尺子能帮助我们区分:收益主要是跟着市场一起走,还是相对基准多出了一部分。

但“历史上跑赢沪深300”不能自动改写成“发现了稳定 Alpha”。

基准是否合适、承担了什么风险、结果能否在新数据中保留,都还需要继续检查。

为什么从这条路开始?

不是因为它最容易赚钱。

也不是因为简单方法天然比复杂模型可靠。

我们选择它,是因为第一次学习时,研究过程比较容易摊开来看:

  • 问题来自哪里,看得见;
  • 定义怎样变化,看得见;
  • 数据怎样进入,看得见;
  • 哪个条件改变了结果,看得见;
  • 结果失败时,也比较容易回头调查。

Codex 或 WorkBuddy 可以帮助我们创建项目、整理数据、编写程序、重复运行和排查错误。

但“这个条件为什么值得检查”“这次比较是否公平”“证据够不够支持结论”,仍然需要人负责。

这条路线也能让没有 Python 基础的读者完成一轮真正的量化研究,而不是先用几个月学习语法,最后忘了自己原本想问什么。

没选的路线,不是被判了不及格

第一期课程需要一个清楚的起点,因此没有把机器学习、高频交易、做市、复杂套利、新闻文本、组合优化和自动交易放在主轴上。

这些路线依赖另一套数据、基础设施或研究问题,也都有自己的价值。等读者真正掌握提出假设、检查数据、区分探索与验证、完成回测和限制结论,再继续学习它们会更有准备。

本章重点

我们不是先挑最厉害的工具,而是先挑一个能被查清楚的问题。

课程要交付的是调查问题的能力,不是一套标准赚钱答案。

下一站:AI 会写代码以后,人还负责什么?

蛙兄重新拿起那张学习清单。

这一次,他没有写工具名称。

他只写了一行:

我觉得某种市场现象可能存在,怎样才能让数据真正反对我?

现在,研究零件已经装成了一条完整路线。

接下来确实会出现很多实现工作:建立项目、整理数据、计算指标、生成信号、执行规则、检查结果和重复运行。

Codex 或 WorkBuddy 可以承担其中很大一部分。

新的问题是:既然 AI 已经会写代码、处理数据和排查错误,人为什么还不能从研究里下班?

下一章,我们就来划清这条责任线。

本章参考资料

资料核对日期:2026-08-13

跳泡可乐、学习清单、九转信号、候选条件、收益数字和全部研究情节均为虚构教学案例,不对应真实公司、股票、收益或策略。课程使用 A 股作为数据案例,不承诺发现赚钱因子,也不构成投资建议。

课后讨论

留下你的问题、理解或不同意见,也看看其他学习者怎么想。