前置条件与学习依赖 / PREREQUISITES
① 数学 / 统计基础
无特殊公式推导要求——本页是整个实证模块的“地图”,只介绍分支与路线,不展开数学。
② 经济学理论前置
无;只需对“实证研究在做什么”有初步印象,不必先修高级理论课。
③ 软件 / 计算前置
无;建议先装好 Stata 17+,并按本页下方“软件与工具清单”了解外部命令生态。
④ 站内前置页面
无——本页是实证模块的入口(起点),按下方学习路线从 01 数据清洗开始。
⑤ 难度分级
入门

01 分支 Taxonomy:五阶段分组(A–E)与全部模型

实证论文模块按"论文生产流程"分为五个阶段组:A 数据准备与描述 → B 基准与因果识别 → C 识别诊断与稳健性 → D 前沿与预测方法 → E 论文工程。每组下列出该阶段包含的页面、对应教程链接与学习难度。建议按 A→B→C→D→E 的顺序学习,D 组前沿方法可在主流程跑通后按需选学。

A. 数据准备与描述
A · DATA PREPARATION
实证工作 80% 的时间花在数据上。把原始的 CSMAR/Wind/工业企业数据库变成干净的分析样本,再做探索性分析与样本构造,是 Table 1 和所有回归的基础。
数据清洗缺失值 / 异常值 / winsor2 缩尾
beginner
数据合并与面板merge / append / reshape / xtset
beginner
描述性统计summarize / pwcorr / esttab 导出
beginner
EDA与样本构造探索性分析 / 样本筛选与构造
intermediate
B. 基准与因果识别
B · BASELINE & CAUSAL ID
实证的核心:先从 OLS 到双向固定效应跑通"主回归表",再借助准实验设计讲因果——IV、DID、RDD、合成控制、动态面板、空间计量、聚束设计各有适用场景与假设。
基准回归OLS / 双向 FE / reghdfe / 聚类 SE
beginner
内生性与IV工具变量 / 2SLS / 弱IV / 过度识别
intermediate
DID 双重差分平行趋势 / 事件研究 / 交叠 DID
intermediate
RDD 断点回归模糊/精确 RDD / 带宽 / 局部线性
intermediate
合成控制法 SCMdonor pool / 权重 / 安慰剂
advanced
动态面板 GMM系统/差分 GMM / 工具变量矩
advanced
空间计量入门空间滞后/误差 / 权重矩阵
advanced
Bunching/Kink聚束设计聚束估计 / kink / 弹性反推
advanced
C. 识别诊断与稳健性
C · DIAGNOSTICS & ROBUSTNESS
主回归跑出来之后,审稿人会要求你证明结果"稳得住"、"讲得通"、"因人而异",并规范报告显著性。这一组决定了论文能不能过审。
稳健性检验替换变量 / 安慰剂 / 换样本 / 换 SE
intermediate
机制检验中介效应 / 调节效应 / 渠道变量
intermediate
异质性分析分样本 / 交乘项 / 组间差异检验
intermediate
显著性诊断实务报告口径 / p值与星号 / 经济显著性
advanced
显著性手法库与规范判别常见显著性手法 / 规范判别
advanced
D. 前沿与预测方法
D · FRONTIER & FORECASTING
主流程跑通后按需选学:因果推断的潜在结果框架与机器学习结合(DML、因果森林)、宏观大数据预测与即时预测、分位数/尾部、文本与结构突变、非参与贝叶斯推断等前沿工具。
潜在结果与因果图Ruben因果模型 / DAG / 后门前门
intermediate
DML去偏机器学习partialling out / Neyman 正交
advanced
因果森林与政策学习异质性处理效应 / ATE/CTE
advanced
大数据宏观预测面板大数据 / 降维 / 机器学习预测
advanced
即时预测与DFM动态因子模型 / 高频数据
advanced
分位数回归与GaR分位数回归 / 风险在险 GDP
advanced
文本分析与叙事冲击词嵌入 / 主题模型 / 文本度量
advanced
TVP-VAR与风险溯源时变参数VAR / 随机波动
advanced
非参/半参方法核估计 / 半参 / 可加模型
advanced
贝叶斯实证推断MCMC / 先验后验 / 贝叶斯收缩
advanced
E. 论文工程
E · PAPER WORKFLOW
把方法变成可发表、可复现的论文:复现流程、五层写作框架与顶刊方法地图,是从"会跑代码"到"会写论文"的工程化环节。
论文复现流程main.do / 模块化 / 日志复现
intermediate
五层框架论文五层结构 / 写作骨架
intermediate
顶刊方法地图与复现顶刊方法谱系 / 复现要点
advanced
难度标签说明

入门 概念直观、代码量小,1-2 天可上手;进阶 需要理解识别假设与诊断检验,3-5 天;前沿 涉及方法论争议与发表规范,需在实操中反复打磨。

02 分分支学习路径(前置依赖与分叉)

实证不是一条线走到底——数据与回归是必修主线,到"因果识别"处分叉为 IV / DID / RDD 三条互斥策略,之后再统一汇入"深化"段。每条路径都标了起点页、前置依赖、建议顺序与难度。不要跳步:没有干净的数据,后面所有识别策略都是空中楼阁。

① 数据路径(所有人必修)
入门
起点:01 数据清洗 前置依赖:无(领域入口) 目标:把原始库变成可回归的分析样本,产出 Table 1。
② 回归主线
入门
起点:04 基准回归 前置依赖:① 数据路径(01-03)完成 目标:跑通 OLS / 双向固定效应,产出主回归表 Table 2。
③ 因果推断分叉(按识别场景选一条)
进阶
起点:06 DID 或 07 RDD 前置依赖:② 回归主线(04 + 05)。三者不必全学,按你的政策冲击形态选:有明确处理时点→DID;有规则/评分断点→RDD;存在外生变量→IV。
④ 深化路径(投稿前必经)
进阶
起点:08 稳健性检验 前置依赖:② 主回归 + ③ 选定的识别策略(05/06/07 任一) 目标:把主回归"包装"成一篇能送审的完整论文。
怎么选路径

新手按 ①→②→③(选 DID)→④ 顺序走即可上手一篇完整论文。如果你已有干净数据、只补因果识别,可直接从 ③ 切入;已有主回归只想提升投稿规范,则直奔 ④ 的 11 显著性诊断。

03 实证论文的典型写作范式

一篇标准的应用微观实证论文,章节结构高度趋同。按下面的范式写,审稿人不会因为"结构不对"挑你。

章节内容对应分支
1. Introduction研究问题 + 识别策略一句话 + 主要发现 + 贡献(3 条 bullet)全局
2. 制度背景 / 文献政策冲击的制度细节、文献缺口、本文边际贡献分支 3(识别策略铺垫)
3. 数据与描述数据来源、清洗与合并、Table 1 描述性统计分支 1
4. 基准回归Table 2:OLS → FE → 加控制变量 → 加固定效应,逐步呈现分支 2
5. 因果识别DID 平行趋势 / IV 排他性 / RDD 连续性,核心 Table 3-4分支 3
6. 稳健性替换变量、安慰剂、换样本、换标准误分支 4
7. 机制与异质性打开黑箱讲渠道,按子样本讲谁受益更多分支 4
8. 结论与政策建议总结 + 政策含义 + 局限分支 5(叙述规范)
最常见的写作事故

① 数据没清洗就跑回归,Table 1 对不上;② 主回归只报 OLS,不做固定效应;③ DID 不画平行趋势图;④ 稳健性检验只做 1-2 项;⑤ 机制检验用"逐步法"中介而不讲识别。

04 软件与工具清单

Stata 17+

本模块主力工具。中文经管实证事实标准,CSMAR/Wind 生态原生支持。必装 reghdfe、estout、winsor2、ftools。

外部命令

reghdfe / ftools(高维固定效应)、estout / outreg2(导出表格)、winsor2(缩尾)、psmatch2(倾向得分)、rdrobust(RDD)。

数据来源

CSMAR、Wind、中国工业企业数据库(ASIF)、CNRDS、CRSM、地级市统计年鉴、企查查/天眼查补充。

文献工具

Zotero / EndNote 管理文献;Stata Journal 与 SSCN 社区找命令;GitHub 搜 replication package。

可视化

coefplot(系数图)、event_plot(事件研究图)、outreg2 / esttab 导出三线表到 Word/LaTeX。

复现规范

每个项目有 main.do 主脚本 + 分模块 do 文件 + log 日志;原始数据只读,清洗后数据单独存。

05 本领域全部页面(按学习顺序)

#页面所属分支难度
01实证总览与学习路线(本页)总览
02数据清洗A 数据准备入门
03数据合并与面板整理A 数据准备入门
04描述性统计与相关系数A 数据准备入门
05基准回归(OLS/固定效应)B 因果识别入门
06内生性与 IV / 2SLSB 因果识别进阶
07DID 双重差分B 因果识别进阶
08RDD 断点回归B 因果识别进阶
09稳健性检验完整清单C 诊断稳健性进阶
10机制检验(中介/调节)C 诊断稳健性进阶
11异质性分析C 诊断稳健性进阶
12显著性诊断实务C 诊断稳健性前沿