HoppyQuant

第 1 课

量化到底在做什么?

从一句模糊的市场直觉出发,认识量化研究怎样明确问题并以一致、可重复的方式检查证据。

蛙兄已经放弃申请加入“量化派”了。

他知道量化可以研究价值、成长、趋势和反转,也可以走进许多其他路线。但新的问题马上来了:它走进去以后,到底做什么?

蛙兄决定不再空想。

他打开 Codex,把上一章留下的那句话贴进对话框:

我觉得一个行业越来越重要,其中的好公司长期可能表现更好。请用量化验证。

鼠标已经停在发送按钮上,蛙博士却问了四句:

蛙兄盯着那句话看了一会儿。

他本来觉得自己已经提出了一个挺完整的想法。现在却发现,里面有四个词,每一个都能走向好几种不同的研究。

如果什么都不补充,Codex 当然也可以替他选。

问题是,AI 选出来的“好公司”,可能已经不是蛙兄心里想的好公司了。

蛙兄准备把一句模糊的行业判断交给 Codex 验证,蛙博士提醒验证指令不会自动补清研究定义。
图 1|在模糊想法后面加上‘请用量化验证’,不会自动补清研究定义。

“我觉得”没有错,它只是还没有说完

市场直觉不是量化研究的敌人。

很多研究一开始,都来自一句不太完整的话:

  • 我觉得这个行业以后会更重要;
  • 我觉得价格跌得太快,可能会修复;
  • 我觉得名字听起来吉利的股票更受欢迎;
  • 我觉得成交突然活跃,后面可能还有变化。

这些话有一个共同优点:它们提出了值得追问的方向。

也有一个共同问题:数据还不知道应该回答哪一个版本。

以蛙兄的判断为例,至少还要继续问:

研究谁:哪些行业、哪些公司?
观察什么:怎样记录“重要”和“好”?
满足什么条件:什么时候算这件事发生了?
看多久:一年、三年,还是其他时间?
怎样判断:和谁比,出现什么结果才算更好?

这些问题不是在故意刁难一句普通想法。

它们是在防止研究者看到结果以后,偷偷换一道题。

假如三年结果不好,蛙兄可以改口说“我说的长期是十年”;如果股价跑输市场,他也可以说“我说的表现好是公司没倒闭”。只要每个词都能事后改变,原来的想法就很难面对证据。

行业重要、好公司、长期和表现更好四个模糊词分别打开多个可能定义,说明同一句话可以走向不同研究。
图 2|四个模糊词的不同定义,可以把同一句话带向完全不同的研究。

量化研究,先把问题说到可以检查

现在,我们可以给出这门课使用的工作定义。

量化研究,是把一个关于市场的想法,用相对明确的对象、信息、条件、时间和判断标准表达出来,再用一致、可重复的方式检查证据。

这句话不需要背。我们把它拆开看看。

相对明确,不是假装研究者已经掌握绝对正确的定义。

它只是要求我们承认自己的选择。例如,暂时用行业销量增长代表“行业越来越重要”,就把这个选择写出来。以后可以讨论它好不好,却不能假装“重要”天生就等于销量增长。

一致,是说同一轮检查要尽量使用事先说好的口径。

不能因为某个定义没有得到喜欢的答案,就悄悄换一个定义,再只展示最漂亮的版本。定义可以修改,但修改需要留下记录,也要承认这是一次新的检查。

可重复,是说同样的数据、步骤和计算条件,重新做一次,应该得到同样的计算结果。

如果今天运行上涨 8%,明天什么都没改却变成上涨 18%,我们连程序做了什么都还没有确认,更谈不上相信结论。

但可重复也有一条很重要的边界:

一个错误定义,同样可以被程序一模一样地算错很多次。

所以,可重复帮助我们检查过程,不替我们保证问题问得合理。

量化研究把市场想法拆成对象、信息、条件、时间和判断标准,再以一致可重复的方式检查证据。
图 3|量化研究先明确对象、信息、条件、时间和判断标准,再检查证据。

数据不是来配合蛙兄的

蛙兄最初写的是“请用量化验证”。

这句话很容易被理解成:请想办法证明我说得对。

但量化研究不应该只给原想法准备一个“同意”按钮。证据至少可以把研究带向三种地方:

当前证据支持继续研究
当前证据不支持原来的想法
定义或数据不足,暂时无法判断

第三种结论不是逃避回答。

如果“行业重要性”没有合理记录,或者数据只覆盖很短时间,硬给一个支持或不支持,反而是假装我们知道得比实际更多。

第二种结论也不是研究失败。

如果数据没有支持原来的直觉,我们至少排除了一条暂时站不住的路。比起带着一个没有检查过的想法去冒险,这已经是一项有价值的结果。

本章重点

量化不是替“我觉得”寻找证明。它要先把“我觉得”说清楚,再让证据有机会支持、反对,或者告诉我们现在还无法判断。

一项研究大概会经过哪些地方?

这一整个单元,就是要把量化研究里面的零件慢慢摊开。

现在先看一眼全景:

市场直觉
→ 澄清模糊概念
→ 写成可以被反对的假设
→ 建立可以计算的定义
→ 获取并检查数据
→ 判断有没有值得继续研究的现象
→ 写出最小规则
→ 放进历史数据检查
→ 得出与证据强度相匹配的结论

暂时不用记住每一站叫什么,也不用知道怎样操作。

我们现在只看两件事。

第一,程序不是起点。在程序出现以前,研究者已经需要决定自己到底在问什么。

第二,回测也不是终点后面的“赚钱认证”。历史检查以后,我们仍然可能发现证据不稳定、成本太高,或者原来的解释根本站不住。

后面的课程会一站一站走过去。现在只要知道,它们不能被一句“请帮我验证”压缩成一个按钮。

从市场直觉到澄清、假设、定义、数据、候选现象、最小规则、历史检查和当前结论的量化研究全景路线。
图 4|从市场直觉走向当前结论的一条完整量化研究路线。

数字很多,不一定是在做量化研究

“量化”两个字很容易带来一幅画面:几块屏幕、密密麻麻的数字、快速跳动的图表,再加上一位正在敲代码的人。

这些东西可能出现在量化研究中,却没有一个单独等于量化研究。

数字很多,不等于问题清楚。

一张表可以有几百列。如果研究者不知道每一列代表什么,数字越多,只是迷路的路口越多。

公式复杂,不等于答案可靠。

复杂公式可以处理复杂关系,也可能只是在更隐蔽地放大错误假设。

技术指标出现,不等于已经证明未来。

均线、MACD 或 RSI 会按照公式整理历史记录。它们量了什么、能否与未来结果建立关系,还需要分开检查。

Python 和 AI 会工作,不等于研究已经成立。

它们可以把定义变成程序,帮助处理数据和调查错误。可如果原问题没有说清,它们只会更快地执行某一种猜法。

可以自动下单,也不等于规则值得执行。

自动交易解决的是怎样执行,不是为什么这套规则可能拥有优势。

所以,量化研究不是这些工具的合照。

它是一种对待问题和证据的方式。工具让过程更容易实现,却不能替研究者决定问题是否合理、证据是否可信。

数字、公式、技术指标、Python、AI 和自动交易围在工具箱周围,但没有任何一项单独等于量化研究。
图 5|数字与工具可以帮助研究,但没有任何一项单独等于量化研究。

下一站:不是所有重要的东西都能塞进表格

蛙兄没有发送原来的那句话。

他新建了一张小表,准备先写下研究需要的信息:

日期:可以记录
收盘价:可以记录
成交量:可以记录
行业越来越重要:?
好公司:?

前三项很自然地进入了格子,后两项却卡住了。

“行业重要性”和“公司好不好”当然可能非常重要。问题只是:它们没有像收盘价一样,自己带着一个现成数字来到表格里。

那是不是不能直接量化的信息,就不值得研究?还是说,我们需要寻找某种替代记录?如果替代得很糟,数字又会骗我们什么?

这正是下一章要解决的问题。

本章参考资料

资料核对日期:2026-08-12

本章对‘量化研究’的表述是服务后续课程的一套工作定义,不宣称为金融行业唯一标准。蛙兄的行业判断、Codex 对话框和信息表均为虚构教学情节,不对应真实行业、公司、股票或投资建议。

课后讨论

留下你的问题、理解或不同意见,也看看其他学习者怎么想。