本文探讨了使用模型无关工具来辅助解释机器学习模型,类似于我们解释标准计量经济学模型的方式。文章将弗里德曼(2001年)的部分依赖函数(PDP)识别为以模型无关的方式直接实现多元回归系数的假设性推理。通过展示PDP的斜率,即部分边际效应(PME),文章再现了传统线性回归的系数,从而扩展了这一框架。通过对PME进行自举,可以构建一个类似于标准回归表的“视觉回归表”,显示PME的点的估计值和估计值的方差。这种方法使得可以在非线性机器学习模型中进行传统的计量经济学推理。
文章首先通过类比的方式解释了PME的含义,将其比作关于模型预测结果的实验,即改变一个特征而保持其他特征不变时,模型输出的变化情况。文章还证明了OLS的PME与OLS回归系数在分析上是等价的,并且自助法可以提供PME点估计的标准误差和置信区间。
为了展示该方法的应用,文章将PME和Shapley值应用于享乐主义房价定价示例,并比较了神经网络、支持向量机、随机森林和梯度提升模型的PME与传统线性回归的系数。结果表明,这些机器学习模型的PME揭示了模型发现的非线性关系,并允许直接比较这些模型。文章还扩展了PME到Shapley值分解,并探讨了如何利用它进一步解释模型输出。
文章最后将PME应用于爱荷华州艾姆斯的住房数据,并分析了COVID-19大流行前后人们对房屋偏好的变化。结果表明,机器学习模型可以捕捉到数据中的重要非线性特征,并且PME和Shapley值可以帮助我们理解这些特征对模型输出的影响。例如,模型显示,在COVID-19大流行后,人们对靠近城市中心的大地块房屋的偏好有所提高,而对新房的溢价有所下降。