HoppyQuant

第 2 课

不是所有重要的东西,都能塞进表格

区分直接记录、代理指标、暂时难以量化和不应强行量化的信息,并看见表格留下的画外空间。

蛙兄把上一章留下的表格重新打开了。

日期、收盘价和成交量都很好填。跳泡可乐披露过的营业收入,也可以放进一格。

到了下一行,题目变成了:

这家公司靠谱吗?

蛙兄想了想,在旁边填了一个数字:

9.5

蛙博士看见以后,没有说它高,也没有说它低。

他只问:“满分是多少?”

“十分。”

“谁打的?”

“我。”

“那这九点五分,是因为它按时交货、很少出事故,还是因为你喜欢喝?”

蛙兄把鼠标移回那一格,突然觉得这个数字有点孤单。

它确实进了表格。

但谁也不知道它进去以后代表什么。

蛙兄在跳泡可乐研究表里填下‘靠谱程度 9.5 分’,蛙博士追问这个数字是谁打的、量了什么。
图 1|一个数字进入表格,不代表它已经拥有清楚、可靠的含义。

现实不会主动排成一张表

价格、成交量和日期,看起来很有“数据气质”。

它们通常有相对明确的记录方式。我们可以问某一天的收盘价是多少,也可以数当天有多少成交。

可是我们真正关心的事情,经常长成另一副样子:

  • 这家公司管理得好不好;
  • 顾客是不是真的喜欢这个品牌;
  • 行业未来有没有空间;
  • 一条新闻到底改变了什么;
  • 市场是不是过度兴奋了。

这些问题并不比收盘价低级。它们只是没有自己穿着数字制服,排队走进表格。

所以,我们先别急着把世界切成两半:这一半“可以量化”,另一半“不能量化”。

更实用的做法,是看看一件事现在处于什么状态

第一种:已经有比较明确的记录

比如,跳泡可乐某个交易日的收盘价、成交量,或者公司在报告中披露的营业收入。

这些信息已经有了相对明确的名称、时间和记录口径。程序更容易读取,我们也更容易比较。

但“容易进表”不等于“已经没有问题”。

收盘价不能告诉我们为什么有人买卖;一行营业收入也不能告诉我们公司是不是靠降价才卖得更多。即使数据采用了标准化格式,也仍然要检查时间、口径、单位、遗漏和错误。

它们只是比较容易记录,不是自动得到答案

第二种:没有现成数字,但可以寻找一个代理

蛙兄真正想问的是“跳泡可乐靠不靠谱”。

这句话太宽了,不能直接塞进一个格子。可我们可以先问:蛙兄说的“靠谱”,到底是哪一面?

如果他关心顾客是否愿意回来买,可以观察复购。

如果他关心产品是否经常出问题,可以观察投诉和退货。

如果他关心公司能不能把货稳定送到超市,可以观察交付延误。

这些记录都不是“靠谱”本身。它们只是让我们从某个角度靠近“靠谱”。

这种做法通常叫作使用代理(proxy):原来的东西不好直接观察,于是先找一个与它有关、又能够记录的东西代替。

代理很有用。没有它,很多现实问题根本无法开始检查。

代理也很危险。因为研究者一旦选了代理,就已经悄悄选择了自己要看现实的哪一面。

收盘价和成交量可以直接记录,公司靠谱需要寻找代理,新闻含义暂时难量化,随手打分则不应强行量化。
图 2|面对信息时,可以区分直接记录、寻找代理、暂时困难和不应强行量化四种状态。

代理像手电筒,不像复印机

晚上停电时,一束手电筒可以照亮桌上的一瓶可乐。

但它照到瓶盖,不等于照到了整张桌子。

代理也是这样。

复购率高,可能说明顾客喜欢产品,也可能只是促销券很便宜。

投诉少,可能说明产品稳定,也可能是顾客懒得投诉,或者投诉渠道很难找。

交付准时,说明供应链的某一部分运转顺利,却不能直接说明管理团队在战略、研发和财务上都很出色。

所以,给一个概念找代理时,至少要追问三句:

如果这三句话答不出来,先别急着计算。

蛙兄原来的 9.5 最大的问题,不是小数点后少了一位,而是我们不知道这束光照向了哪里。

复购率、投诉率和准时交付三束手电筒照向跳泡可乐,各自只显示公司靠谱的一个侧面。
图 3|代理指标像手电筒,只照亮原问题的一个侧面。

第三种:现在还很难量化

有些事情不是完全没有办法,只是做起来比一张日线表复杂得多。

比如一条新闻的含义。

我们当然可以尝试记录新闻出现的时间、里面提到的公司、文字更偏正面还是负面,甚至训练模型给大量文本分类。

可麻烦马上就来了:

  • 同一句话放在不同背景下,意思可能不同;
  • 新闻发布时间不一定等于市场第一次知道的时间;
  • “正面语气”不一定是超出预期的好消息;
  • 模型给出的分数,还需要确认究竟量到了什么。

管理能力、公司文化和品牌感受也类似。它们不是永远不能研究,只是需要更多资料、更复杂的定义和额外验证。

在第一期课程里,我们不会进入新闻文本和地缘信息量化。不是因为这些东西不重要,而是因为我们先选择一块更适合小白完成研究闭环的地面:结构化的 A 股日频个股和指数数据。

把边界说清楚,比假装什么都能做更专业。

第四种:当前不适合强行量化

还有一些时候,问题不在于技术暂时不够强,而在于我们根本没想清楚要量什么。

“我觉得跳泡可乐很有灵魂,所以给它九点五分”,就是一个例子。

如果没有明确含义,没有可信记录,也说不清这个分数为什么和研究问题有关,那么把感受改写成数字,并不会自动让它更科学。

有时,获取某种数据还可能代价过高、来源不可靠,甚至涉及不应该收集的私人信息。此时,表格里留一个空白,比填进一个看起来精确的假数字更诚实。

“现在不适合量化”不是宣布它永远不能研究。

它只是说:以当前问题、数据和方法,我们还没有找到一个值得信任的记录方式。

没进表格,不等于应该被忘掉

假设蛙兄最后只保留了价格、成交量和财务数据。

跳泡可乐的新口味为什么突然受欢迎,管理层为什么改变渠道,公司文化是否影响执行,这些内容可能没有进入这一轮计算。

它们仍然可以做很多事:

  • 帮助我们提出下一条假设;
  • 解释为什么某段结果特别奇怪;
  • 提醒我们当前数据遗漏了什么;
  • 限制我们可以把结论说到多远。

量化研究不是把表格外面的世界宣布无效。

它只是诚实地说:这一轮检查,我们记录了这些,没有记录那些。

同一幅跳泡可乐现实场景中,表格取景框记录了价格、成交量和收入,框外仍保留品牌、管理、顾客感受与新闻含义。
图 4|表格是对现实的一次取景,画面之外仍可能保留重要信息。

一张表,是一次取景

同一个跳泡可乐,不同的人可以做出完全不同的表。

有人记录价格和成交量,有人整理收入与成本,有人观察行业销量,有人统计新闻,有人研究顾客行为。

没有哪张表自动等于完整的跳泡可乐。

每张表都在回答一个更小的问题,也都留下了自己的画外空间。

本章重点

表格是一张经过选择的照片,不是现实世界的原件。

可以计算,不等于已经量对;没有进入表格,也不等于不重要。

下一站:做量化的人平时都在研究什么?

蛙兄删掉了那个孤零零的 9.5

他没有把“公司靠谱吗”这一行也删掉,而是在旁边写了两句话:

这一轮准备用什么来观察它?
这个记录没有覆盖什么?

表格没有因此变得无所不知。

但它终于开始诚实了。

接下来还有一个新问题:即使大家都同意使用数据,不同人仍会选择不同的表、不同的问题和不同的证据方法。

那么,做量化的人平时到底在研究什么?为什么量化里面也会出现那么多看起来不一样的路线?

本章参考资料

资料核对日期:2026-08-13

跳泡可乐、靠谱分数、复购、投诉、交付和全部经营情节均为虚构教学案例,不对应真实公司、股票、披露或投资机会。本章只解释怎样看待可记录与暂时不可记录的信息,不提供投资建议。

课后讨论

留下你的问题、理解或不同意见,也看看其他学习者怎么想。