第 1 课
量化到底在做什么?
从一句模糊的市场直觉出发,认识量化研究怎样明确问题并以一致、可重复的方式检查证据。
蛙兄已经放弃申请加入“量化派”了。
他知道量化可以研究价值、成长、趋势和反转,也可以走进许多其他路线。但新的问题马上来了:它走进去以后,到底做什么?
蛙兄决定不再空想。
他打开 Codex,把上一章留下的那句话贴进对话框:
我觉得一个行业越来越重要,其中的好公司长期可能表现更好。请用量化验证。
鼠标已经停在发送按钮上,蛙博士却问了四句:
蛙兄盯着那句话看了一会儿。
他本来觉得自己已经提出了一个挺完整的想法。现在却发现,里面有四个词,每一个都能走向好几种不同的研究。
如果什么都不补充,Codex 当然也可以替他选。
问题是,AI 选出来的“好公司”,可能已经不是蛙兄心里想的好公司了。

“我觉得”没有错,它只是还没有说完
市场直觉不是量化研究的敌人。
很多研究一开始,都来自一句不太完整的话:
- 我觉得这个行业以后会更重要;
- 我觉得价格跌得太快,可能会修复;
- 我觉得名字听起来吉利的股票更受欢迎;
- 我觉得成交突然活跃,后面可能还有变化。
这些话有一个共同优点:它们提出了值得追问的方向。
也有一个共同问题:数据还不知道应该回答哪一个版本。
以蛙兄的判断为例,至少还要继续问:
研究谁:哪些行业、哪些公司?
观察什么:怎样记录“重要”和“好”?
满足什么条件:什么时候算这件事发生了?
看多久:一年、三年,还是其他时间?
怎样判断:和谁比,出现什么结果才算更好?
这些问题不是在故意刁难一句普通想法。
它们是在防止研究者看到结果以后,偷偷换一道题。
假如三年结果不好,蛙兄可以改口说“我说的长期是十年”;如果股价跑输市场,他也可以说“我说的表现好是公司没倒闭”。只要每个词都能事后改变,原来的想法就很难面对证据。

量化研究,先把问题说到可以检查
现在,我们可以给出这门课使用的工作定义。
量化研究,是把一个关于市场的想法,用相对明确的对象、信息、条件、时间和判断标准表达出来,再用一致、可重复的方式检查证据。
这句话不需要背。我们把它拆开看看。
相对明确,不是假装研究者已经掌握绝对正确的定义。
它只是要求我们承认自己的选择。例如,暂时用行业销量增长代表“行业越来越重要”,就把这个选择写出来。以后可以讨论它好不好,却不能假装“重要”天生就等于销量增长。
一致,是说同一轮检查要尽量使用事先说好的口径。
不能因为某个定义没有得到喜欢的答案,就悄悄换一个定义,再只展示最漂亮的版本。定义可以修改,但修改需要留下记录,也要承认这是一次新的检查。
可重复,是说同样的数据、步骤和计算条件,重新做一次,应该得到同样的计算结果。
如果今天运行上涨 8%,明天什么都没改却变成上涨 18%,我们连程序做了什么都还没有确认,更谈不上相信结论。
但可重复也有一条很重要的边界:
一个错误定义,同样可以被程序一模一样地算错很多次。
所以,可重复帮助我们检查过程,不替我们保证问题问得合理。

数据不是来配合蛙兄的
蛙兄最初写的是“请用量化验证”。
这句话很容易被理解成:请想办法证明我说得对。
但量化研究不应该只给原想法准备一个“同意”按钮。证据至少可以把研究带向三种地方:
当前证据支持继续研究
当前证据不支持原来的想法
定义或数据不足,暂时无法判断
第三种结论不是逃避回答。
如果“行业重要性”没有合理记录,或者数据只覆盖很短时间,硬给一个支持或不支持,反而是假装我们知道得比实际更多。
第二种结论也不是研究失败。
如果数据没有支持原来的直觉,我们至少排除了一条暂时站不住的路。比起带着一个没有检查过的想法去冒险,这已经是一项有价值的结果。
量化不是替“我觉得”寻找证明。它要先把“我觉得”说清楚,再让证据有机会支持、反对,或者告诉我们现在还无法判断。
一项研究大概会经过哪些地方?
这一整个单元,就是要把量化研究里面的零件慢慢摊开。
现在先看一眼全景:
市场直觉
→ 澄清模糊概念
→ 写成可以被反对的假设
→ 建立可以计算的定义
→ 获取并检查数据
→ 判断有没有值得继续研究的现象
→ 写出最小规则
→ 放进历史数据检查
→ 得出与证据强度相匹配的结论
暂时不用记住每一站叫什么,也不用知道怎样操作。
我们现在只看两件事。
第一,程序不是起点。在程序出现以前,研究者已经需要决定自己到底在问什么。
第二,回测也不是终点后面的“赚钱认证”。历史检查以后,我们仍然可能发现证据不稳定、成本太高,或者原来的解释根本站不住。
后面的课程会一站一站走过去。现在只要知道,它们不能被一句“请帮我验证”压缩成一个按钮。

数字很多,不一定是在做量化研究
“量化”两个字很容易带来一幅画面:几块屏幕、密密麻麻的数字、快速跳动的图表,再加上一位正在敲代码的人。
这些东西可能出现在量化研究中,却没有一个单独等于量化研究。
数字很多,不等于问题清楚。
一张表可以有几百列。如果研究者不知道每一列代表什么,数字越多,只是迷路的路口越多。
公式复杂,不等于答案可靠。
复杂公式可以处理复杂关系,也可能只是在更隐蔽地放大错误假设。
技术指标出现,不等于已经证明未来。
均线、MACD 或 RSI 会按照公式整理历史记录。它们量了什么、能否与未来结果建立关系,还需要分开检查。
Python 和 AI 会工作,不等于研究已经成立。
它们可以把定义变成程序,帮助处理数据和调查错误。可如果原问题没有说清,它们只会更快地执行某一种猜法。
可以自动下单,也不等于规则值得执行。
自动交易解决的是怎样执行,不是为什么这套规则可能拥有优势。
所以,量化研究不是这些工具的合照。
它是一种对待问题和证据的方式。工具让过程更容易实现,却不能替研究者决定问题是否合理、证据是否可信。

下一站:不是所有重要的东西都能塞进表格
蛙兄没有发送原来的那句话。
他新建了一张小表,准备先写下研究需要的信息:
日期:可以记录
收盘价:可以记录
成交量:可以记录
行业越来越重要:?
好公司:?
前三项很自然地进入了格子,后两项却卡住了。
“行业重要性”和“公司好不好”当然可能非常重要。问题只是:它们没有像收盘价一样,自己带着一个现成数字来到表格里。
那是不是不能直接量化的信息,就不值得研究?还是说,我们需要寻找某种替代记录?如果替代得很糟,数字又会骗我们什么?
这正是下一章要解决的问题。
本章参考资料
资料核对日期:2026-08-12
- National Academies:Reproducibility and Replicability in Science,用于核对计算可重复性的边界:使用相同输入数据、计算步骤、方法、代码和分析条件得到一致结果;本章没有把可重复性写成研究结论已经在新数据中复制成功;
- CFA Institute:Standard V(A), Diligence and Reasonable Basis,用于保留定量研究仍需检查数据来源、模型参数、假设、限制与工具输出的边界。
本章对‘量化研究’的表述是服务后续课程的一套工作定义,不宣称为金融行业唯一标准。蛙兄的行业判断、Codex 对话框和信息表均为虚构教学情节,不对应真实行业、公司、股票或投资建议。
课后讨论
留下你的问题、理解或不同意见,也看看其他学习者怎么想。