本文探讨了双重选择Lasso(PDS Lasso)方法在随机田野实验中的应用效果。研究发现,尽管PDS Lasso常被用于选择控制变量以提高治疗效果估计的精度和减少偏差,但在实际应用中,该方法的优势往往有限。
主要发现:
- 变量选择有限: 尽管输入大量潜在控制变量,但PDS Lasso通常只选择少量变量,超过一半的情况下甚至不选择任何变量。
- 精度提升微小: 与Ancova相比,PDS Lasso平均仅能将标准误差减少不到一个百分点,且在四分之一的情况下标准误差反而更大。
- 流失率影响有限: 虽然存在流失时,PDS Lasso更有可能选择控制变量,但典型系数变化仍然很小,表明流失通常与结果无关。
- 潜在问题: PDS Lasso可能无法选择滞后因变量或其他重要控制变量,导致精度下降。
- 参数选择: 使用交叉验证选择惩罚参数可能引入过拟合风险,建议使用默认的插件惩罚参数。
建议:
- 研究人员应谨慎选择输入控制变量,避免“大杂烩”方法。
- 确保包含滞后因变量和随机化层固定效应在内的改进集,防止遗漏变量偏差。
- 注意缺失值处理,确保所有输入变量无缺失值。
- 在存在多个结果或多种治疗方法时,为每个结果或治疗方法分别运行PDS Lasso。
- 正确处理治疗相互作用,避免将交互变量错误地建模为另一种治疗方法。
结论:
PDS Lasso可以作为随机田野实验的有效稳健性检验工具,但研究人员不应期望其在平均上获得显著的精度提升。在使用该方法时,需要谨慎选择控制变量,并注意潜在问题,以确保结果的可靠性和有效性。