第 3 课
做量化的人,平时都在研究什么?
辨认常见量化研究路线,并区分研究对象、证据入口、时间尺度与工具等不同层次的标签。
蛙兄准备给一份研究文件改名。
文件里装的是跳泡可乐和一批 A 股公司的日线数据。他想比较公司特征,也想看看历史上相似情况有没有反复出现。
他刚输入“跳泡可乐研究”,电脑就弹出一串文件夹:
量化选股
因子研究
趋势跟随
事件驱动
统计套利
机器学习
高频交易
蛙兄把文件拖向“量化选股”,停了一下;又拖向“因子研究”,还是觉得不踏实。
如果以后用了预测模型,是不是又该搬到“机器学习”?如果研究公司公告前后的价格变化,是不是要改叫“事件驱动”?
他索性问了几个研究者。
第一个说:“你在比较很多股票,当然算量化选股。”
第二个说:“你在找可以重复比较的特征,也可以叫因子研究。”
第三个看了一眼数据频率:“反正肯定不是高频。”
奇怪的是,他们可能都没说错。

这些名字,根本没在回答同一个问题
把“因子”“高频”“事件驱动”和“机器学习”排成一列,很像把下面这些东西放进同一张菜单:
面条
十分钟做好
用平底锅
有点辣
它们都在描述一顿饭,却不是同一种分类。
量化圈里的名字也一样。
有些名字在说主要研究什么,比如公司之间的差异、价格趋势、某个事件前后,或者一组相关资产之间的关系。
有些名字在说怎样寻找答案,比如先讲清可能的原因,先从数据里寻找重复现象,或者直接训练一个预测模型。
还有些名字在说交易有多快,或者用了什么工具。
所以,第一条规则很简单:
先别急着问它属于哪个门派。先问这个名字到底在描述哪一部分。
三个入口,不是三间互不来往的办公室
前面我们已经见过三种寻找证据的入口。
这里只做一次很短的回看,因为真正重要的是它们怎样进入量化研究。
先问“为什么可能这样”
有人会从现实机制出发。
例如,他认为消费者更喜欢低糖饮料,可能改变品类销量;销量、价格和成本又可能影响公司的经营结果,最后影响市场期待。
他会先把这条因果链讲清楚,再找数据检查每一段是否站得住。
这是机制驱动的入口。
先问“以前有没有反复出现”
也有人先不讲完整故事。
他会把许多公司、许多日期放在一起比较,寻找某种差异或形状是否经常伴随后续结果出现,再检查这种现象换一段时间、换一批样本后还在不在。
这是统计发现的入口。
先问“能不能猜得更准”
还有人会把价格、成交量、公司记录和行业数据一起交给模型,让它估计未来收益、方向、风险或某件事发生的概率。
他的重点是预测在没参与训练的新数据上是否仍然有用。
这是预测驱动的入口。
三扇门可以通向同一个房间。
研究者可以先从无糖饮料的经营逻辑提出假设,再用历史数据检查这种差异是否反复出现,最后看看加入更多信息后能否改善预测。
也可以先在数据中发现一个现象,再回头寻找合理解释。

常见路线一:因子与量化选股
这类研究经常面对一大排股票。研究者会整理价格相对高低、公司规模、成长情况、盈利质量或过去价格表现等特征,再比较不同股票后来有什么差别。
用大白话说,它很像给许多股票填写同一份体检表,然后看看哪些项目可能和后续结果有关。
“量化选股”更强调系统地比较和选择股票;“因子研究”更强调寻找和检验能够解释或区分股票表现的共同特征。两个词经常一起出现,后面我们还会专门拆开指标、候选因子和信号。
真正的难点是特征怎样定义、比较是否公平、历史差异是不是碰巧,以及成本会不会吃掉原本很小的规律。
常见路线二:趋势跟随
趋势研究主要盯着价格已经走出的方向。研究者需要明确多长时间算一段趋势、什么表示趋势仍在,以及什么变化触发退出。
证据通常来自许多历史时期和对象的重复检查。难点是价格会来回晃动,趋势可能刚被规则认出来就结束,频繁改变方向还会带来成本。
我们在前面的趋势派课程里已经见过它的投资逻辑。放到这里,它只是说明:同一种价格规律,也可以被写成一致、可重复检查的量化规则。
常见路线三:事件驱动
事件驱动研究先在日历上圈出一件事,例如财务报告、并购公告、股份回购、指数调整或事先定义的政策变化。然后观察事件前后发生了什么,并与同期大盘、行业或相似公司比较。
这里最容易出现的误解是:
有事件
=
有交易机会
当然不是。
事件只是帮我们把观察时间对齐。市场可能早已知道消息,样本也可能太少;研究者仍然要定义窗口、比较对象和不支持原想法的结果。
常见路线四:统计套利与市场中性
这类研究经常不只问“一只股票会涨还是会跌”,而是观察两个或一组对象之间的相对关系。
例如,两家业务相近的饮料公司,历史价格曾经经常一起变化。某段时间它们突然分开,研究者可能会追问:这种差距只是短暂偏离,还是两家公司已经真的不一样了?
统计套利常从这类统计关系和相对定价出发,经典的配对交易就是一个容易理解的例子。
名字里有“套利”,过程仍然可能亏损:旧关系会失效,价格差可能继续扩大,流动性和成本也会改变结果。
“市场中性”通常只是尝试减少某类大盘涨跌带来的方向影响,不代表其他风险一起消失。这类路线还经常涉及相反方向的头寸、对冲和更复杂的执行;本课程实战暂不做空,因此这里只负责帮它在地图上找到位置。
常见路线五:宏观量化
宏观量化把镜头拉远。
它可能观察利率、通胀、经济增长、汇率、信用和商品价格,再研究这些变化怎样影响不同市场、行业或指数。
如果跳泡可乐的成本高度依赖糖、铝和运输,宏观研究者可能不会从一瓶可乐的销量开始,而会先看原材料、利率和消费环境的变化。
这类问题经常需要连接不同频率、不同国家和不同市场的数据。宏观数据可能发布得很慢,后来还会修订;同一个通胀数字放在不同经济环境里,市场反应也可能完全不同。
两个特别容易放错层的标签
前面五类名字,多少还在描述研究对象或策略想法。
接下来的两个词,经常被一起塞进“量化门派”,可它们更像从另外两个角度贴上来的标签。
高频与做市:一个涉及速度,一个涉及市场活动
高频交易通常使用高速系统读取市场数据、提交大量订单,并在非常短的时间里建立和结束头寸。它不是“把日线策略运行得更快”,因为数据、延迟、市场微观结构和风险控制都会一起改变。
做市说的是另一种市场活动:持续准备按公开报价买入或卖出,为其他交易者提供对手方,同时管理库存和价格风险。
高频公司可以做市,也可以做统计套利;做市活动也不等同于所有高频交易。
这就是标签重叠的一个好例子:交易速度和正在做什么市场活动,不是同一条坐标轴。
机器学习:它更像一套工具和预测方法
机器学习擅长处理很多输入、复杂关系和大量模型组合。量化选股、事件预测和宏观研究都可能使用它,所以“机器学习量化”主要说明使用了哪类预测工具,还没有完整回答研究对象是什么。
灵活也会带来麻烦:模型越能适应旧数据,越可能把噪声也学得很认真。研究者需要用没有参与训练的数据检查结果,也要防止反复试验后只挑最好看的版本。
预测更准和解释原因仍然是两件事。模型可以帮助测量和预测,却不会自动告诉我们市场为什么形成这种关系。

同一个项目,可以挂好几块牌子
现在回到蛙兄的文件。
假设他的研究是这样:
- 每天使用 A 股日线和公司公开记录;
- 给许多股票整理价值、成长和价格趋势等特征;
- 比较这些特征能否区分后续表现;
- 再用一个机器学习模型组合多个输入,做一次样本外预测检查。
这项研究可以同时被叫作:
- 量化选股,因为它在系统比较股票;
- 因子式研究,因为它在研究一组可重复比较的特征;
- 统计发现,因为它检查历史差异是否反复出现;
- 预测研究,因为它要估计未来结果;
- 机器学习项目,因为它使用了这种预测工具;
- 日频研究,因为它每天只有一组市场记录。
它却不是高频交易。使用电脑,也没有让一天一条的数据突然跑进微秒世界。
如果蛙兄后来只研究财务报告发布前后,它又会多一个“事件驱动”的标签。
标签不是只能选一个的身份证。
它们更像挂在同一件行李上的几块牌子:一块写里面装什么,一块写准备送到哪里,一块写怎样运输。

看见新名词,先问三句话
量化行业还会冒出很多本章没列出的名字。
不用每看见一个词,就重新背一套门派。
先问三句话,通常已经能把它放回地图:
它主要在观察什么?
它怎样寻找和检查证据?
这个名字是在说研究问题、时间速度,还是使用的工具?
如果还想继续追问,再补一句:
它最依赖什么数据、知识、交易条件或基础设施?
这样一来,“高频”就不会被误解为高级版日线,“机器学习”也不会被误解为一种市场规律,“市场中性”更不会被听成没有风险。
名字不是排行榜
高频听起来快,机器学习听起来新,套利听起来像稳赚。
这些词都很容易给人加上一层光环。
可一条路线是否可靠,最终仍然要回到具体问题:定义清不清楚,数据能不能信,比较公不公平,成本有没有漏,换一段时间还能不能站住。
复杂模型可以认真地犯错,简单规则也可以稳定地犯错。
标签是研究项目的行李牌,不是互相排斥的身份证,更不是收益排行榜。
蛙兄最后没有把文件硬塞进某一个文件夹。
他把名字改成了:
跳泡可乐研究
问题:比较股票特征与后续表现
证据入口:统计比较+预测检查
时间尺度:日频
工具:暂未决定
名字变长了一点,但谁打开它,都更容易知道里面究竟在做什么。
下一站:一句‘我觉得’怎样才能拿去验证?
现在,量化研究的地图已经铺开了。
当然,第一次学习不需要把因子、高频、套利、宏观和机器学习全部走一遍。我们的实战会使用 A 股日频数据,从一个能够说清楚的市场想法出发,一步步检查证据。
不过,现在还不急着展示整条实战路线。
无论最后选择哪一种工具,研究都得先回答一个更朴素的问题:一句“我觉得”,还要补上什么,数据才知道该怎样反对它?
下一章,我们就从这句话开始。
本章参考资料
资料核对日期:2026-08-13
- CFA Institute:Active Equity Investing: Strategies,用于核对因子式股票研究、统计套利、事件驱动、量化研究流程和过拟合、成本等常见边界;本章没有把这些分类当作唯一行业标准;
- Tobias J. Moskowitz、Yao Hua Ooi 与 Lasse Heje Pedersen:Time Series Momentum,用于核对趋势研究会系统考察过去价格方向与后续变化;本章不采用论文中的历史收益作为未来承诺;
- A. Craig MacKinlay:Event Studies in Economics and Finance,用于核对事件研究围绕明确事件观察公司价值变化的基本位置;
- Evan Gatev、William N. Goetzmann 与 K. Geert Rouwenhorst:Pairs Trading,用于核对统计套利可以从相关证券之间的相对价格关系出发;本章不教学配对交易结构,也不搬用论文结果;
- SEC:Market Centers: Buying and Selling Stock 与 CFTC、SEC:Findings Regarding the Market Events of May 6, 2010,用于核对做市的基本活动、高频交易的速度与订单特征,以及高频、做市和统计套利可以重叠但并非同义词;
- Shihao Gu、Bryan Kelly 与 Dacheng Xiu:Empirical Asset Pricing via Machine Learning,用于核对机器学习在资产定价研究中侧重高维统计预测、需要防范过拟合,并且预测测量本身不能识别经济机制。
跳泡可乐、研究文件、公司记录、公告和全部研究设想均为虚构教学案例,不对应真实公司、股票或策略。本章只帮助读者理解常见量化路线及其标签边界,不评价收益,不构成投资建议。
课后讨论
留下你的问题、理解或不同意见,也看看其他学习者怎么想。