前置条件与学习依赖 / PREREQUISITES
① 计量基础
OLS、固定效应、标准误与聚类;理解"总体均值""抽样分布""条件期望"这些基础概念。
② 站内前置页面
③ 软件前置
Stata 17+,会用 regaregreghdfecollapsetable
④ 难度分级
方法论 · 核心

01 五层框架是什么

一篇实证论文,从"我想研究 X 对 Y 的影响"到那张回归表,中间其实经过了五层独立的决策。把这五层叠起来看:

Population(总体) → 研究谁?

Sample(抽样) → 哪些人/企业进了样本?

Data(测量) → X 和 Y 怎么测?

Model(模型) → 用什么函数关系去拟合?

Inference(推断) → 标准误怎么算?结论怎么推?

这五层不是流水线,而是五层独立的"假设"。每一层都可能出错,而最致命的错误不是某一层内部算错了,而是层与层之间不一致——你在引言里说研究的是"中国所有制造业企业的平均效应"(Population),但样本里只有 2010 年以后上市的企业(Sample),变量用的是"年报披露的研发支出"(Data),模型是线性 OLS(Model),标准误聚在企业层(Inference)。这五层放在一起,你真正估计的其实是"2010 年后中国上市制造业企业、其年报披露的研发支出对会计利润的线性关系、按企业层聚类的条件相关"——和你引言里说的那句话,已经相去甚远。

这一页的任务,就是把这五层逐一拆开,告诉你每一层该问什么问题、用什么 Stata 命令去检查、以及层与层之间怎么对齐。

02 第 1 层:Population 研究总体

Population 回答的问题是:你想研究"谁"?不是"你手上有什么数据",而是"你真正想对谁下结论"。

常见的 Population 表述有三种,从窄到宽:

  • 具体总体:"2010–2020 年中国 A 股上市制造业企业"。这是一个有明确边界的总体。
  • 理论总体:"所有面临融资约束的创新型企业"。这是理论概念,需要在 Sample 层操作化。
  • 抽象总体:"企业投资对政策冲击的反应"。这是经济学命题,Population 其实是"一般企业"。

Population 层最常见的问题是没有明确的研究总体。很多论文引言写"本文研究 X 对 Y 的影响",通篇不说"对谁"。这在审稿人眼里是一个红旗——你连研究谁都没说清楚,怎么能说你估计的是"平均效应"?

✓ 一句话检验

在写引言第一段时,逼自己写出完整句子:"本文研究 ____(政策/处理)对 ____(结果)在 ____(总体)中的因果效应。"最后那个空必须填出来。填不出来,就是 Population 层没设计好。

03 第 2 层:Sample 抽样机制

Sample 回答的问题是:Population 里的哪些个体,最终进了你的回归样本?这中间经过了多少道筛选?每一道筛选是不是和你关心的结果相关?

抽样机制分两类:

  • 概率抽样(probability sampling):总体中每个个体有已知的入样概率。例如"从全国人口普查框中按 1% 等比例随机抽取"。这种情况下,样本均值是总体均值的无偏估计。
  • 非概率抽样(non-probability sampling):入样概率未知、或为零。例如"只看上市公司""只看某城市的调查""只看注册满 5 年的企业"。

绝大多数微观实证论文用的都是非概率抽样。此时你必须回答一个关键问题:样本选择是否与结果变量相关?如果"能否进样本"和"Y 的值"独立,那么样本选择是随机的、不影响因果解释(只影响外部效度);如果"能否进样本"本身就依赖于 Y 或与 Y 相关的变量,那就产生了选择偏误(selection bias)

经典例子:你研究"教育对收入的影响",但样本只包含"已经工作的人"。而"是否工作"本身和"潜在收入"相关——低收入的人更可能不工作。于是你观察到的"教育—收入"关系,是在已经工作的那批人里的关系,不是全人口的关系。这就是 Heckman (1979) 两阶段模型要处理的问题。

⚠ Sample 层最隐蔽的偏误

不是"样本太小",而是"删除观测的规则和 Y 相关"。例如你因为"研发支出缺失"删掉企业,如果"研发支出缺失"和"企业创新失败"相关,那你删掉的恰恰是最该被研究的那批企业。下一页 EDA 会教你怎么诊断这一点。

04 第 3 层:Data 数据测量

Data 回答的问题是:你论文里写的 X 和 Y,在数据里到底是什么变量?

理论概念到可观测变量之间,隔着一层"操作化(operationalization)"。例如:

  • 理论概念"企业创新" → 数据里你用的是"专利申请数"?还是"研发支出"?还是"新产品销售额"?
  • 理论概念"政策冲击" → 数据里你用的是"政策实施年份的虚拟变量"?还是"企业 exposure 强度"?
  • 理论概念"融资约束" → 你用 KZ 指数?WW 指数?SA 指数?还是利息支出/现金流?

测量层有两个核心问题:

  1. 测量误差(measurement error):如果你用 X̃ = X* + e 去代替真实的 X*,且 e 与 X* 无关(经典测量误差),那么 OLS 系数会向零衰减(attenuation bias);如果 e 与 X* 相关,偏误方向不确定。
  2. 代理变量(proxy variable):当真实 X* 根本不可观测时,你只能用一个相关的变量 Z 去代理它。例如用"教育年限"代理"人力资本"。代理变量引入的偏误取决于它和遗漏变量的关系。

Data 层的检查标准很朴素:你的变量名、变量定义、单位、取值范围、缺失规则,能不能在论文附录里一页写清楚?写不清楚,就是 Data 层没过关。

05 第 4 层:Model 模型设定

Model 回答的问题是:你假设 X 和 Y 之间是什么函数关系?

最常见的 Model 假设是线性:

线性模型
$$Y_i = \alpha + \beta X_i + \gamma' Z_i + \varepsilon_i$$

但线性假设本身是一个强假设。它假设:(1) X 对 Y 的边际效应处处相同(线性);(2) 没有交互项;(3) 控制变量 Z 的系数不依赖于 X;(4) 误差项与 X 条件独立(外生性)。这四条里只要有一条不成立,你的 β 就不是你想要的那个因果效应。

Model 层常见问题:

  • 函数形式误设:真实关系是 U 型(Y 随 X 先降后升),你却硬跑线性,系数可能接近 0——不是没效应,是你用错了函数。
  • 固定效应层级错:你以为在控制"企业不可观测异质性",结果 FE 设在了行业层,那你控制的其实是行业、不是企业。
  • 控制变量选错:控制了"坏控制变量"(bad control)——即那些本身被处理影响的变量——相当于把处理效应的一部分"控制掉"了。

Model 层的核心原则:你写下的每一个符号,都必须对应一个可讲的经济学故事。写不出故事的项,就不要放进模型。

06 第 5 层:Inference 统计推断

Inference 回答的问题是:你报告的标准误、p 值、置信区间,对不对?

这是五层里技术上最"琐碎"、但被审稿人挑得最多的一层。核心问题有三个:

  1. 标准误聚类层级:误差项在什么维度上相关?是企业内时序相关(聚到企业)?行业内相关(聚到行业)?还是双向聚类(企业 + 行业年份)?聚类层级选错,标准误会被低估几个数量级,星号全是假的。
  2. 多重比较(multiple testing):你跑了 20 个回归,其中一个 p=0.04,这个 0.04 还可信吗?Bonferroni 校正、FDR 控制都是为此而生。
  3. 推断的"目标"是什么:你是在对样本做描述(population 已知),还是在对总体做推断(population 未知、从 sample 推断)?前者根本不需要标准误,后者才需要。

Inference 层最常见的错误:只报 OLS 默认的 i.i.d. 标准误,不聚类。在面板数据里,企业内多年观测显然不独立,默认标准误几乎一定太小。

07 层间一致性:你估计的到底是什么

五层框架最有价值的部分,不是单独看每一层,而是看层与层之间是否对齐。下面这张表列出最常见的"不一致"及其后果:

不一致类型你以为你在估计实际上你在估计
Population ≠ Sample"所有制造业企业的平均效应""上市、规模以上、存活到样本期末的企业的平均效应"(选择偏误)
Sample ≠ Data"研发投入对创新的影响""年报披露的研发支出对专利申请数的影响"(测量口径偏误)
Data ≠ Model"非线性门槛效应""线性条件相关"(函数形式错)
Model ≠ Inference"企业层面的处理效应""聚到行业层的标准误被高估,企业内变异被吞掉"
Population ≔ Inference"对全中国企业的推断""只对样本期内的样本企业做了描述"(无法外推)

审稿人最爱问的一句话——"你估计的这个效应,是 LATE、ATE 还是 ATT?"——本质上就是在问:你的五层是不是对齐的?如果你的处理只影响了"complier"群体,而你在引言里说估计的是"总体平均效应",那你就把 LATE 当成了 ATE 在写,这就是层间不一致。

⛔ 层间不一致是比"方法用错"更严重的错误

方法用错可以换;层间不一致意味着你整篇论文讲的故事和代码跑出来的东西根本不是一回事。这种错误在答辩和审稿时最难辩护——因为它不是技术细节,是"你到底在做什么研究"的根本问题。

08 每层检查清单与 Stata 命令

Population 层检查清单

  • □ 引言第一段是否写清了"对谁、对什么、什么效应"?
  • □ 你的总体是"有边界的"还是"理论概念"?如果是后者,操作化是否在 Data 层讲清楚了?

Sample 层检查清单与命令

  • □ 从 raw 到 analysis 每一步删了多少观测?(countreturn list
  • □ 被删掉的观测,在 X、Y 上和保留下来的观测系统不同吗?(ttest 比较组间均值)
  • □ 是否存在"只有 Y 可见时才进样本"的情况?(Heckman 选择模型)
stata · Sample 层诊断
* 对比"被删" vs "被留"的样本在 X、Y 上是否系统不同
gen kept = !missing(output, capital, labor)
ttest output, by(kept)        // 被删组 vs 保留组的 output 均值
ttest capital, by(kept)
ttest labor, by(kept)
* 如果 t 检验显著,说明删除不是随机的,Sample 层有选择偏误

Data 层检查清单与命令

  • □ 核心变量的取值范围合理吗?(summarizecodebook
  • □ 缺失值是 MCAR / MAR / MNAR 哪一种?
  • □ 变量定义和论文附录写的一致吗?

Model 层检查清单与命令

  • □ 线性假设合理吗?跑一下 twoway (scatter y x) (lfit y x) (qfit y x) 看曲线形状。
  • □ 是否该加二次项?gen x2 = x^2; reg y c.x##c.x
  • □ 固定效应层级对吗?reghdfe y x, absorb(firm year) vs absorb(industry year)

Inference 层检查清单与命令

  • □ 标准误聚类在哪一层?企业?行业?双向?reghdfe y x, absorb(firm year) vce(cluster firm)
  • □ 你跑了多少个规格?是否需要多重比较校正?
  • □ 置信区间宽度合理吗?(见 11 页显著性诊断)

09 论文案例:LaLonde (1986) NSW 实验

AER · 1986
Evaluating the Econometric Evaluations of Training Programs with Experimental Data
Robert J. LaLonde, American Economic Review, 76(4), 1986, pp. 604–620.
LaLonde 利用美国 National Supported Work (NSW) 示范项目的随机实验数据,先得到"培训对收入影响"的无偏实验估计(benchmark),然后故意把实验对照组扔掉、改用 PSID / CPS 调查中的非实验对照组,再用当时主流的观测计量方法(OLS、固定效应、Heckman 两步法)去估计同一个效应。结论是:观测方法估计出来的效应与实验基准相差甚远,且符号、量级都不稳定。

用五层框架看 LaLonde (1986) 的贡献,会非常清楚:

  • Population 层:都是"接受 NSW 培训的低收入成年男性",这一层实验和观测数据完全一致。
  • Sample 层(问题出在这里):实验对照组是从同一批申请者中随机抽的未参加者;而 LaLonde 替换上去的 PSID / CPS 对照组是全国调查中的普通劳动年龄男性。这两组人在年龄、教育、历史收入、种族、地域上的分布完全不同——也就是说,虽然 Population 概念上一样,Sample 的构成机制完全不同
  • Data 层:收入变量都来自调查,但实验数据和 PSID/CPS 的调查工具、时间窗口不同。
  • Model 层:LaLonde 用了当时主流的各种 OLS / FE / 选择模型,形式上和实验对照组的估计式一致。
  • Inference 层:标准误计算方式相同。

关键洞察:五层里,四层都对齐了,唯独 Sample 层错了——实验对照组是"随机抽的",观测对照组是"全国调查里碰巧出现的"。就这一层的不一致,导致所有观测方法的估计都偏离实验基准。这就是为什么 LaLonde (1986) 被视为"观测研究可信度危机"的开山之作:它告诉整个行业,你不能只盯着 Model 层的函数形式,Sample 层的选择机制错了,再精致的模型也救不回来

后续 Dehejia & Wahba (1999, JASA) 用倾向得分匹配(propensity score matching)重新分析 NSW 数据,部分恢复了实验基准;Heckman, Ichimura, Smith & Todd (1998, RESTUD) 进一步指出,匹配能否成功的关键,在于对照组和处理组是否来自同一劳动力市场、同一调查工具、同样的协变量分布——这本质上就是在强调 Sample 层的"可比性"。四十年后的今天,LaLonde 提出的核心问题仍然是因果推断方法的试金石。

✓ 把五层框架用在你的下一篇论文里

在开始写论文之前,拿一张白纸,把这五层各写一句话。写完之后,自己读一遍——如果五句话连起来读不通(比如 Population 说"所有企业"、Sample 说"上市公司"、Data 说"专利"、Model 说"线性"、Inference 说"聚到行业"),你就知道哪里需要回头改。