第 2 课
不是所有重要的东西,都能塞进表格
区分直接记录、代理指标、暂时难以量化和不应强行量化的信息,并看见表格留下的画外空间。
蛙兄把上一章留下的表格重新打开了。
日期、收盘价和成交量都很好填。跳泡可乐披露过的营业收入,也可以放进一格。
到了下一行,题目变成了:
这家公司靠谱吗?
蛙兄想了想,在旁边填了一个数字:
9.5
蛙博士看见以后,没有说它高,也没有说它低。
他只问:“满分是多少?”
“十分。”
“谁打的?”
“我。”
“那这九点五分,是因为它按时交货、很少出事故,还是因为你喜欢喝?”
蛙兄把鼠标移回那一格,突然觉得这个数字有点孤单。
它确实进了表格。
但谁也不知道它进去以后代表什么。

现实不会主动排成一张表
价格、成交量和日期,看起来很有“数据气质”。
它们通常有相对明确的记录方式。我们可以问某一天的收盘价是多少,也可以数当天有多少成交。
可是我们真正关心的事情,经常长成另一副样子:
- 这家公司管理得好不好;
- 顾客是不是真的喜欢这个品牌;
- 行业未来有没有空间;
- 一条新闻到底改变了什么;
- 市场是不是过度兴奋了。
这些问题并不比收盘价低级。它们只是没有自己穿着数字制服,排队走进表格。
所以,我们先别急着把世界切成两半:这一半“可以量化”,另一半“不能量化”。
更实用的做法,是看看一件事现在处于什么状态。
第一种:已经有比较明确的记录
比如,跳泡可乐某个交易日的收盘价、成交量,或者公司在报告中披露的营业收入。
这些信息已经有了相对明确的名称、时间和记录口径。程序更容易读取,我们也更容易比较。
但“容易进表”不等于“已经没有问题”。
收盘价不能告诉我们为什么有人买卖;一行营业收入也不能告诉我们公司是不是靠降价才卖得更多。即使数据采用了标准化格式,也仍然要检查时间、口径、单位、遗漏和错误。
它们只是比较容易记录,不是自动得到答案。
第二种:没有现成数字,但可以寻找一个代理
蛙兄真正想问的是“跳泡可乐靠不靠谱”。
这句话太宽了,不能直接塞进一个格子。可我们可以先问:蛙兄说的“靠谱”,到底是哪一面?
如果他关心顾客是否愿意回来买,可以观察复购。
如果他关心产品是否经常出问题,可以观察投诉和退货。
如果他关心公司能不能把货稳定送到超市,可以观察交付延误。
这些记录都不是“靠谱”本身。它们只是让我们从某个角度靠近“靠谱”。
这种做法通常叫作使用代理(proxy):原来的东西不好直接观察,于是先找一个与它有关、又能够记录的东西代替。
代理很有用。没有它,很多现实问题根本无法开始检查。
代理也很危险。因为研究者一旦选了代理,就已经悄悄选择了自己要看现实的哪一面。

代理像手电筒,不像复印机
晚上停电时,一束手电筒可以照亮桌上的一瓶可乐。
但它照到瓶盖,不等于照到了整张桌子。
代理也是这样。
复购率高,可能说明顾客喜欢产品,也可能只是促销券很便宜。
投诉少,可能说明产品稳定,也可能是顾客懒得投诉,或者投诉渠道很难找。
交付准时,说明供应链的某一部分运转顺利,却不能直接说明管理团队在战略、研发和财务上都很出色。
所以,给一个概念找代理时,至少要追问三句:
如果这三句话答不出来,先别急着计算。
蛙兄原来的 9.5 最大的问题,不是小数点后少了一位,而是我们不知道这束光照向了哪里。

第三种:现在还很难量化
有些事情不是完全没有办法,只是做起来比一张日线表复杂得多。
比如一条新闻的含义。
我们当然可以尝试记录新闻出现的时间、里面提到的公司、文字更偏正面还是负面,甚至训练模型给大量文本分类。
可麻烦马上就来了:
- 同一句话放在不同背景下,意思可能不同;
- 新闻发布时间不一定等于市场第一次知道的时间;
- “正面语气”不一定是超出预期的好消息;
- 模型给出的分数,还需要确认究竟量到了什么。
管理能力、公司文化和品牌感受也类似。它们不是永远不能研究,只是需要更多资料、更复杂的定义和额外验证。
在第一期课程里,我们不会进入新闻文本和地缘信息量化。不是因为这些东西不重要,而是因为我们先选择一块更适合小白完成研究闭环的地面:结构化的 A 股日频个股和指数数据。
把边界说清楚,比假装什么都能做更专业。
第四种:当前不适合强行量化
还有一些时候,问题不在于技术暂时不够强,而在于我们根本没想清楚要量什么。
“我觉得跳泡可乐很有灵魂,所以给它九点五分”,就是一个例子。
如果没有明确含义,没有可信记录,也说不清这个分数为什么和研究问题有关,那么把感受改写成数字,并不会自动让它更科学。
有时,获取某种数据还可能代价过高、来源不可靠,甚至涉及不应该收集的私人信息。此时,表格里留一个空白,比填进一个看起来精确的假数字更诚实。
“现在不适合量化”不是宣布它永远不能研究。
它只是说:以当前问题、数据和方法,我们还没有找到一个值得信任的记录方式。
没进表格,不等于应该被忘掉
假设蛙兄最后只保留了价格、成交量和财务数据。
跳泡可乐的新口味为什么突然受欢迎,管理层为什么改变渠道,公司文化是否影响执行,这些内容可能没有进入这一轮计算。
它们仍然可以做很多事:
- 帮助我们提出下一条假设;
- 解释为什么某段结果特别奇怪;
- 提醒我们当前数据遗漏了什么;
- 限制我们可以把结论说到多远。
量化研究不是把表格外面的世界宣布无效。
它只是诚实地说:这一轮检查,我们记录了这些,没有记录那些。

一张表,是一次取景
同一个跳泡可乐,不同的人可以做出完全不同的表。
有人记录价格和成交量,有人整理收入与成本,有人观察行业销量,有人统计新闻,有人研究顾客行为。
没有哪张表自动等于完整的跳泡可乐。
每张表都在回答一个更小的问题,也都留下了自己的画外空间。
表格是一张经过选择的照片,不是现实世界的原件。
可以计算,不等于已经量对;没有进入表格,也不等于不重要。
下一站:做量化的人平时都在研究什么?
蛙兄删掉了那个孤零零的 9.5。
他没有把“公司靠谱吗”这一行也删掉,而是在旁边写了两句话:
这一轮准备用什么来观察它?
这个记录没有覆盖什么?
表格没有因此变得无所不知。
但它终于开始诚实了。
接下来还有一个新问题:即使大家都同意使用数据,不同人仍会选择不同的表、不同的问题和不同的证据方法。
那么,做量化的人平时到底在研究什么?为什么量化里面也会出现那么多看起来不一样的路线?
本章参考资料
资料核对日期:2026-08-13
- 上海证券交易所:XBRL 分类标准,用于说明部分上市公司披露可以通过分类标准组织成较易被程序读取的结构化信息;本章没有把结构化数据写成完整、无误或已经适合任何研究问题;
- OECD:Handbook on Constructing Composite Indicators 与 OECD 关于代理指标的说明,用于核对指标会简化复杂现实、方法选择会影响结果,以及代理记录需要谨慎解释的边界;
- NIST:Validity,用于核对一个测量是否真正量到了研究者想量的东西这一基本边界;
- NBER:Which News Moves Stock Prices? A Textual Analysis,用于确认新闻文本并非原则上永远不能进入量化研究;本章不教学文本分析方法,也不采用论文中的结果作为策略结论。
跳泡可乐、靠谱分数、复购、投诉、交付和全部经营情节均为虚构教学案例,不对应真实公司、股票、披露或投资机会。本章只解释怎样看待可记录与暂时不可记录的信息,不提供投资建议。
课后讨论
留下你的问题、理解或不同意见,也看看其他学习者怎么想。