HoppyQuant

第 3 课

做量化的人,平时都在研究什么?

辨认常见量化研究路线,并区分研究对象、证据入口、时间尺度与工具等不同层次的标签。

蛙兄准备给一份研究文件改名。

文件里装的是跳泡可乐和一批 A 股公司的日线数据。他想比较公司特征,也想看看历史上相似情况有没有反复出现。

他刚输入“跳泡可乐研究”,电脑就弹出一串文件夹:

量化选股
因子研究
趋势跟随
事件驱动
统计套利
机器学习
高频交易

蛙兄把文件拖向“量化选股”,停了一下;又拖向“因子研究”,还是觉得不踏实。

如果以后用了预测模型,是不是又该搬到“机器学习”?如果研究公司公告前后的价格变化,是不是要改叫“事件驱动”?

他索性问了几个研究者。

第一个说:“你在比较很多股票,当然算量化选股。”

第二个说:“你在找可以重复比较的特征,也可以叫因子研究。”

第三个看了一眼数据频率:“反正肯定不是高频。”

奇怪的是,他们可能都没说错。

蛙兄抱着跳泡可乐研究文件,站在量化选股、因子、事件驱动、机器学习和高频等多个文件夹前犹豫。
图 1|量化领域的许多标签,并不都在描述研究的同一个维度。

这些名字,根本没在回答同一个问题

把“因子”“高频”“事件驱动”和“机器学习”排成一列,很像把下面这些东西放进同一张菜单:

面条
十分钟做好
用平底锅
有点辣

它们都在描述一顿饭,却不是同一种分类。

量化圈里的名字也一样。

有些名字在说主要研究什么,比如公司之间的差异、价格趋势、某个事件前后,或者一组相关资产之间的关系。

有些名字在说怎样寻找答案,比如先讲清可能的原因,先从数据里寻找重复现象,或者直接训练一个预测模型。

还有些名字在说交易有多快,或者用了什么工具

所以,第一条规则很简单:

先别急着问它属于哪个门派。先问这个名字到底在描述哪一部分。

三个入口,不是三间互不来往的办公室

前面我们已经见过三种寻找证据的入口。

这里只做一次很短的回看,因为真正重要的是它们怎样进入量化研究。

先问“为什么可能这样”

有人会从现实机制出发。

例如,他认为消费者更喜欢低糖饮料,可能改变品类销量;销量、价格和成本又可能影响公司的经营结果,最后影响市场期待。

他会先把这条因果链讲清楚,再找数据检查每一段是否站得住。

这是机制驱动的入口。

先问“以前有没有反复出现”

也有人先不讲完整故事。

他会把许多公司、许多日期放在一起比较,寻找某种差异或形状是否经常伴随后续结果出现,再检查这种现象换一段时间、换一批样本后还在不在。

这是统计发现的入口。

先问“能不能猜得更准”

还有人会把价格、成交量、公司记录和行业数据一起交给模型,让它估计未来收益、方向、风险或某件事发生的概率。

他的重点是预测在没参与训练的新数据上是否仍然有用。

这是预测驱动的入口。

三扇门可以通向同一个房间。

研究者可以先从无糖饮料的经营逻辑提出假设,再用历史数据检查这种差异是否反复出现,最后看看加入更多信息后能否改善预测。

也可以先在数据中发现一个现象,再回头寻找合理解释。

机制驱动、统计发现和预测驱动三扇入口通向同一个跳泡可乐研究室,三条路线可以前后接力。
图 2|机制、统计发现和预测是寻找证据的三个入口,不是互斥的办公室。

常见路线一:因子与量化选股

这类研究经常面对一大排股票。研究者会整理价格相对高低、公司规模、成长情况、盈利质量或过去价格表现等特征,再比较不同股票后来有什么差别。

用大白话说,它很像给许多股票填写同一份体检表,然后看看哪些项目可能和后续结果有关。

“量化选股”更强调系统地比较和选择股票;“因子研究”更强调寻找和检验能够解释或区分股票表现的共同特征。两个词经常一起出现,后面我们还会专门拆开指标、候选因子和信号。

真正的难点是特征怎样定义、比较是否公平、历史差异是不是碰巧,以及成本会不会吃掉原本很小的规律。

常见路线二:趋势跟随

趋势研究主要盯着价格已经走出的方向。研究者需要明确多长时间算一段趋势、什么表示趋势仍在,以及什么变化触发退出。

证据通常来自许多历史时期和对象的重复检查。难点是价格会来回晃动,趋势可能刚被规则认出来就结束,频繁改变方向还会带来成本。

我们在前面的趋势派课程里已经见过它的投资逻辑。放到这里,它只是说明:同一种价格规律,也可以被写成一致、可重复检查的量化规则。

常见路线三:事件驱动

事件驱动研究先在日历上圈出一件事,例如财务报告、并购公告、股份回购、指数调整或事先定义的政策变化。然后观察事件前后发生了什么,并与同期大盘、行业或相似公司比较。

这里最容易出现的误解是:

有事件
=
有交易机会

当然不是。

事件只是帮我们把观察时间对齐。市场可能早已知道消息,样本也可能太少;研究者仍然要定义窗口、比较对象和不支持原想法的结果。

常见路线四:统计套利与市场中性

这类研究经常不只问“一只股票会涨还是会跌”,而是观察两个或一组对象之间的相对关系

例如,两家业务相近的饮料公司,历史价格曾经经常一起变化。某段时间它们突然分开,研究者可能会追问:这种差距只是短暂偏离,还是两家公司已经真的不一样了?

统计套利常从这类统计关系和相对定价出发,经典的配对交易就是一个容易理解的例子。

名字里有“套利”,过程仍然可能亏损:旧关系会失效,价格差可能继续扩大,流动性和成本也会改变结果。

“市场中性”通常只是尝试减少某类大盘涨跌带来的方向影响,不代表其他风险一起消失。这类路线还经常涉及相反方向的头寸、对冲和更复杂的执行;本课程实战暂不做空,因此这里只负责帮它在地图上找到位置。

常见路线五:宏观量化

宏观量化把镜头拉远。

它可能观察利率、通胀、经济增长、汇率、信用和商品价格,再研究这些变化怎样影响不同市场、行业或指数。

如果跳泡可乐的成本高度依赖糖、铝和运输,宏观研究者可能不会从一瓶可乐的销量开始,而会先看原材料、利率和消费环境的变化。

这类问题经常需要连接不同频率、不同国家和不同市场的数据。宏观数据可能发布得很慢,后来还会修订;同一个通胀数字放在不同经济环境里,市场反应也可能完全不同。

两个特别容易放错层的标签

前面五类名字,多少还在描述研究对象或策略想法。

接下来的两个词,经常被一起塞进“量化门派”,可它们更像从另外两个角度贴上来的标签。

高频与做市:一个涉及速度,一个涉及市场活动

高频交易通常使用高速系统读取市场数据、提交大量订单,并在非常短的时间里建立和结束头寸。它不是“把日线策略运行得更快”,因为数据、延迟、市场微观结构和风险控制都会一起改变。

做市说的是另一种市场活动:持续准备按公开报价买入或卖出,为其他交易者提供对手方,同时管理库存和价格风险。

高频公司可以做市,也可以做统计套利;做市活动也不等同于所有高频交易。

这就是标签重叠的一个好例子:交易速度正在做什么市场活动,不是同一条坐标轴。

机器学习:它更像一套工具和预测方法

机器学习擅长处理很多输入、复杂关系和大量模型组合。量化选股、事件预测和宏观研究都可能使用它,所以“机器学习量化”主要说明使用了哪类预测工具,还没有完整回答研究对象是什么。

灵活也会带来麻烦:模型越能适应旧数据,越可能把噪声也学得很认真。研究者需要用没有参与训练的数据检查结果,也要防止反复试验后只挑最好看的版本。

预测更准和解释原因仍然是两件事。模型可以帮助测量和预测,却不会自动告诉我们市场为什么形成这种关系。

因子选股、趋势、事件、相对关系和宏观是常见研究路线;高频与做市描述速度和市场活动,机器学习是可叠加的预测工具。
图 3|研究路线、速度、市场活动和工具属于不同层次的标签。

同一个项目,可以挂好几块牌子

现在回到蛙兄的文件。

假设他的研究是这样:

  • 每天使用 A 股日线和公司公开记录;
  • 给许多股票整理价值、成长和价格趋势等特征;
  • 比较这些特征能否区分后续表现;
  • 再用一个机器学习模型组合多个输入,做一次样本外预测检查。

这项研究可以同时被叫作:

  • 量化选股,因为它在系统比较股票;
  • 因子式研究,因为它在研究一组可重复比较的特征;
  • 统计发现,因为它检查历史差异是否反复出现;
  • 预测研究,因为它要估计未来结果;
  • 机器学习项目,因为它使用了这种预测工具;
  • 日频研究,因为它每天只有一组市场记录。

它却不是高频交易。使用电脑,也没有让一天一条的数据突然跑进微秒世界。

如果蛙兄后来只研究财务报告发布前后,它又会多一个“事件驱动”的标签。

标签不是只能选一个的身份证。

它们更像挂在同一件行李上的几块牌子:一块写里面装什么,一块写准备送到哪里,一块写怎样运输。

同一份跳泡可乐日频股票研究挂着量化选股、特征比较、统计发现、预测和机器学习等多块行李牌,但没有挂高频标签。
图 4|同一个研究项目可以同时拥有多个不冲突的标签。

看见新名词,先问三句话

量化行业还会冒出很多本章没列出的名字。

不用每看见一个词,就重新背一套门派。

先问三句话,通常已经能把它放回地图:

它主要在观察什么?
它怎样寻找和检查证据?
这个名字是在说研究问题、时间速度,还是使用的工具?

如果还想继续追问,再补一句:

它最依赖什么数据、知识、交易条件或基础设施?

这样一来,“高频”就不会被误解为高级版日线,“机器学习”也不会被误解为一种市场规律,“市场中性”更不会被听成没有风险。

名字不是排行榜

高频听起来快,机器学习听起来新,套利听起来像稳赚。

这些词都很容易给人加上一层光环。

可一条路线是否可靠,最终仍然要回到具体问题:定义清不清楚,数据能不能信,比较公不公平,成本有没有漏,换一段时间还能不能站住。

复杂模型可以认真地犯错,简单规则也可以稳定地犯错。

本章重点

标签是研究项目的行李牌,不是互相排斥的身份证,更不是收益排行榜。

蛙兄最后没有把文件硬塞进某一个文件夹。

他把名字改成了:

跳泡可乐研究
问题:比较股票特征与后续表现
证据入口:统计比较+预测检查
时间尺度:日频
工具:暂未决定

名字变长了一点,但谁打开它,都更容易知道里面究竟在做什么。

下一站:一句‘我觉得’怎样才能拿去验证?

现在,量化研究的地图已经铺开了。

当然,第一次学习不需要把因子、高频、套利、宏观和机器学习全部走一遍。我们的实战会使用 A 股日频数据,从一个能够说清楚的市场想法出发,一步步检查证据。

不过,现在还不急着展示整条实战路线。

无论最后选择哪一种工具,研究都得先回答一个更朴素的问题:一句“我觉得”,还要补上什么,数据才知道该怎样反对它?

下一章,我们就从这句话开始。

本章参考资料

资料核对日期:2026-08-13

跳泡可乐、研究文件、公司记录、公告和全部研究设想均为虚构教学案例,不对应真实公司、股票或策略。本章只帮助读者理解常见量化路线及其标签边界,不评价收益,不构成投资建议。

课后讨论

留下你的问题、理解或不同意见,也看看其他学习者怎么想。