HoppyQuant

第 5 课

现实世界,怎样变成表格里的数字?

沿着现实概念、代理定义、变量和数据字段,把一句普通描述落成可记录又诚实保留边界的数字。

蛙兄打开 AI,输入了一句话:

帮我找出比跳泡可乐更大的公司。

AI 很快回了一句:

你说的“大”,是员工更多、营业收入更高、总资产更多,还是总市值更高?

蛙兄愣了一下。

“大公司不就是大公司吗?”

蛙博士拿来四个纸箱,分别贴上标签:

人多
卖得多
家底厚
市场认为它更值钱

“这四个箱子都可以装数字,”蛙博士说,“但装出来的,不一定是同一批公司。”

上一章已经说过:表格只能照见现实的一部分。这一次,我们不再讨论“是不是所有东西都该量化”,只处理下一步——一个普通概念怎样真正落进数据表。

蛙兄面对员工人数、营业收入、总资产和总市值四种大公司名单,发现它们并不相同。
图 1|同一个‘大公司’概念,可以落到四种不同的可观察定义。

“公司大”不是一个现成字段

员工人数多,量到的是组织规模。

营业收入高,量到的是一段时间里卖出了多少东西。

总资产多,量到的是账面上掌握了多少资源。

总市值高,量到的是市场在某个时点给全部股票标出的总价格。

它们都可以描述“公司规模”的一面,但没有谁天生就是“公司大”的唯一答案。

如果蛙兄想研究的是“市场眼里的大公司”,总市值可能比较合适。

如果他想研究“生意做得有多大”,营业收入也许更接近问题。

如果他关心的是“公司质量”,这四个数字甚至都不能单独给出答案。

所以,选择口径不是把数据下载回来以后才处理的小细节。

你选哪一个数字,就已经选择了自己准备看现实的哪一面。

第一步:先保留那句人话

“公司规模”“行业热度”“价格走强”,这些都是现实概念。

它们很好用,因为人平时就是这样思考和交流的。问题在于,它们通常还不能直接拿去计算。

我们不需要嫌弃这些词,也不必马上把它们删掉。

先把原话留着,后面才知道数字原本想回答什么。

蛙兄于是写下:

原来的问题:市场眼里的公司规模,会不会影响股票后来的表现?

这句话还不够精确,但方向已经比“大公司好不好”清楚了一点。

第二步:说明你准备用什么代表它

“市场眼里的公司规模”仍然没有一把可以直接插进电脑的尺子。

蛙兄决定先用某个交易日的总市值来代表它。上一章已经认识了这种做法:为不好直接观察的概念选择一项可记录内容,叫作选择代理定义

这里不再重讲代理为什么只能照亮一面,只把这次选择写清楚:总市值表示市场给公司的整体估值规模,却不会自动告诉我们:

  • 公司有多少员工;
  • 仓库里有多少资产;
  • 产品卖得好不好;
  • 管理层是否可靠;
  • 这只股票以后会不会涨。

它是这项研究选定的观察角度,不是“公司规模”的唯一答案。

第三步:让这个数字可以跟着对象和时间变化

现在,蛙兄要记录不同公司在不同交易日的总市值。

跳泡可乐有一个数,别的公司也有自己的数;今天和下一个交易日,数字还可能变化。

这种会随着研究对象或时间取得不同数值的东西,可以叫作变量

在这个例子里,某家公司在某个交易日的总市值 就是一个变量。

变量不是表格里的某个格子。

它更像我们决定要持续观察的那件事。等它落到某家公司、某一天,才会得到一个具体数值。

第四步:把记录放进明确的位置

接下来,数据表终于可以登场了。

company_id | trade_date | market_cap | unit
-----------|------------|------------|------
HOPPOP     | 某交易日     | 5000000    | 万元

market_cap 是用来存放总市值的数据字段

字段可以理解成表格里有固定职责的一列:这一列放公司,那一列放日期,另一列放总市值。

但只看 5000000,我们仍然不知道它在说什么。

至少还需要知道:

  • 这是哪家公司;
  • 对应哪一天;
  • 单位是元、万元,还是别的单位;
  • 使用的是哪一种市值口径;
  • 这个数字在当时是否已经可以获得。

字段名只是抽屉上的标签。对象、时间、单位和口径,才告诉我们抽屉里放的是什么。

公司规模经过市场估值口径和某日总市值,最终落到带公司、日期和单位的数据字段。
图 2|从现实概念、代理定义和变量,一步步落到明确的数据字段。

四步走完,不等于找到了唯一答案

我们刚才走过的是:

现实概念:公司规模
→ 代理定义:用市场认可的估值规模来观察
→ 变量:某家公司在某个交易日的总市值
→ 数据字段:market_cap

这条链是清楚的,却不是唯一的。

另一个人完全可以从营业收入出发,只要他的研究问题确实关心销售规模,并且把统计期间、币种和口径说清楚。

两个人使用不同定义,不代表其中一个一定错了。

真正要检查的是:这个定义还在回答原来的问题吗?

有些数字非常好算,但几乎没回答问题

蛙兄又想到了一个更省事的办法:

用公司名字的字数,代表公司质量。

这当然很好算。

程序数一数文字,几乎一眨眼就能得到结果。名字有四个字的公司得 4 分,名字有八个字的公司得 8 分。

但“算得快”没有回答更重要的问题:公司名字的长度,为什么能够代表公司质量?

如果这座桥根本没有搭起来,再精确的小数、再整齐的图表,也只是在认真计算一件与问题无关的事。

蛙兄用尺子测量公司名字长度,旁边的公司质量问题仍然没有答案。
图 3|容易计算的数字,也可能与原来的研究问题几乎无关。
本章重点

可以计算,只说明这件事做得到。

能不能代表原问题,还需要另外解释和检查。

一张“概念落地五问”

以后想把一句人话放进表格,可以先问五件事:

本章工具
  1. 我原来想研究的概念是什么? 2. 我选择用哪个可以观察的东西代表它? 3. 这个记录会随着谁、在什么时候变化? 4. 数据表里用哪一列、什么单位保存它? 5. 这个定义漏掉了原问题的哪些部分?

如果第二问始终找不到一个说得通的答案,合格的结论也可以是:

以现在的问题和数据,我们还没有找到合理的量化定义。

空着,不一定比硬填一个数字更糟。

AI 可以帮蛙兄列出“公司规模”可能使用的十种数据,也可以帮他查找字段、换算单位和整理表格。

但到底哪一种口径仍然代表原问题,最后必须由蛙兄确认。

下一站:指标到底在量什么?

现在,蛙兄已经知道每日收盘价、成交量和总市值为什么能够成为数据字段。

接下来,人们还会继续加工这些记录。

比如,把过去二十个交易日的收盘价放在一起,算出一条平均价格。这个加工后的数字,通常可以叫作一个指标

可一旦打开行情软件,均线、MACD、RSI、布林带和换手率会一起冒出来,像一抽屉长得不同的尺子。

它们拿什么来算?量到了什么?又漏掉了什么?

下一章,我们就来一把一把地拆。

本章参考资料

资料核对日期:2026-08-14

  • 本章的“概念落地五问”为课程内部教学工具,不依赖外部资料。

跳泡可乐、公司代码和表格记录均为虚构教学案例,不对应真实公司或股票。课程使用 A 股作为主要数据案例,本章不构成投资建议。

课后讨论

留下你的问题、理解或不同意见,也看看其他学习者怎么想。